wiki-update(concepts): unsloth dynamic-3.0 - hermans fachliche kante (bpw, sweet-spot, mlx)
This commit is contained in:
parent
84e7b944cb
commit
2ae1dfad1e
1 changed files with 7 additions and 0 deletions
|
|
@ -72,6 +72,13 @@ Quelle: TeksEdge-Tweet `raw/xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38
|
||||||
- **Wichtige Abgrenzung:** Dynamic 3.0 ≠ MTP/[[speculative-decoding.md|Speculative Decoding]] — es geht um bessere Qualität-zu-Größe bei Quantisierung, nicht um Decode-Beschleunigung. Komplementär zu DFlash 2/MTP ([[#DFlash 2 / Speculative Decoding (Update 2026-08-19)]]).
|
- **Wichtige Abgrenzung:** Dynamic 3.0 ≠ MTP/[[speculative-decoding.md|Speculative Decoding]] — es geht um bessere Qualität-zu-Größe bei Quantisierung, nicht um Decode-Beschleunigung. Komplementär zu DFlash 2/MTP ([[#DFlash 2 / Speculative Decoding (Update 2026-08-19)]]).
|
||||||
- **Einordnung:** Dritter Baustein für „27B auf Consumer-Hardware" (kompakte Architektur → MTP/DFlash-Decode-Speedup → kleinere Quants). Anbieter Unsloth = auch hinter [[../../tools/unsloth-dspark.md|dSpark]] (DeepSeek V4 lokal 2x).
|
- **Einordnung:** Dritter Baustein für „27B auf Consumer-Hardware" (kompakte Architektur → MTP/DFlash-Decode-Speedup → kleinere Quants). Anbieter Unsloth = auch hinter [[../../tools/unsloth-dspark.md|dSpark]] (DeepSeek V4 lokal 2x).
|
||||||
|
|
||||||
|
**Fachliche Kante (Herman, OME #11718, 20.08.2026):**
|
||||||
|
- **Dynamic 3.0 ist in die Gewichte gebacken** — neue Modelldateien (UD-…-GGUF), kein Runtime-Schalter. Wer alte Quants hat, muss neu laden.
|
||||||
|
- **6,2 GB für 27B = ~1,8 bpw = IQ1-Territorium** — „preserves significantly more behavior" ist relativ; bei 1,8 bpw leidet Reasoning spürbar. Sweet Spot für echte Denk-Aufgaben: **UD-IQ2_S (8,4 GB) oder UD-Q3_K_XL (13,1 GB)**; IQ1_S eher Routing-/Klassifikations-Futter.
|
||||||
|
- **„10 % besser top-1 % accuracy" ist Unsloths eigene Benchmark** (Divergence-300, frisch/selbstgebaut). Plausibel (kein Training auf imatrix-Kalibrierungsdaten + KL-Optimierung = echte Hebel), aber Selbstvermessung.
|
||||||
|
- **Echter Fortschritt:** Quantisierung nähert sich der Qualitätsgrenze der Ursprungsmodelle bei gleicher Größe; 27B rutscht in die 8-GB-Klasse (vorher 16–24 GB). **MLX (nativ) noch nicht** — LM Studio auf Apple Silicon wartet, llama.cpp läuft.
|
||||||
|
- **Empfehlung für Hectors Setup** (fährt qwen3:4b + 9B Q6_K): auf unabhängige LLM-KL-/PPL-Vergleiche warten (paar Tage), dann **UD-Q3_K_XL** ziehen; IQ1-S-Klasse überspringen, wenn man damit denkt. Bitrate schlägt Parameterzahl nur bis zu einem Punkt (9B Q6_K ≈ 7 GB ≠ 27B IQ1_S 6,2 GB qualitativ).
|
||||||
|
|
||||||
## Offene Punkte
|
## Offene Punkte
|
||||||
|
|
||||||
- ⚠️ Detaillierte Benchmarks und Lizenz im Release-Zustand weiter prüfen; die Ollama-Seite bestätigt Architektur + Quantisierung, aber Referenz-Benchmarks (agentic, coding) sind noch nicht im Wiki verankert.
|
- ⚠️ Detaillierte Benchmarks und Lizenz im Release-Zustand weiter prüfen; die Ollama-Seite bestätigt Architektur + Quantisierung, aber Referenz-Benchmarks (agentic, coding) sind noch nicht im Wiki verankert.
|
||||||
|
|
|
||||||
Loading…
Add table
Reference in a new issue