wiki-update(concepts): unsloth dynamic-3.0 - hermans fachliche kante (bpw, sweet-spot, mlx)

This commit is contained in:
Hector 2026-08-20 21:55:14 +02:00
parent 84e7b944cb
commit 2ae1dfad1e

View file

@ -72,6 +72,13 @@ Quelle: TeksEdge-Tweet `raw/xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38
- **Wichtige Abgrenzung:** Dynamic 3.0 ≠ MTP/[[speculative-decoding.md|Speculative Decoding]] — es geht um bessere Qualität-zu-Größe bei Quantisierung, nicht um Decode-Beschleunigung. Komplementär zu DFlash 2/MTP ([[#DFlash 2 / Speculative Decoding (Update 2026-08-19)]]). - **Wichtige Abgrenzung:** Dynamic 3.0 ≠ MTP/[[speculative-decoding.md|Speculative Decoding]] — es geht um bessere Qualität-zu-Größe bei Quantisierung, nicht um Decode-Beschleunigung. Komplementär zu DFlash 2/MTP ([[#DFlash 2 / Speculative Decoding (Update 2026-08-19)]]).
- **Einordnung:** Dritter Baustein für „27B auf Consumer-Hardware" (kompakte Architektur → MTP/DFlash-Decode-Speedup → kleinere Quants). Anbieter Unsloth = auch hinter [[../../tools/unsloth-dspark.md|dSpark]] (DeepSeek V4 lokal 2x). - **Einordnung:** Dritter Baustein für „27B auf Consumer-Hardware" (kompakte Architektur → MTP/DFlash-Decode-Speedup → kleinere Quants). Anbieter Unsloth = auch hinter [[../../tools/unsloth-dspark.md|dSpark]] (DeepSeek V4 lokal 2x).
**Fachliche Kante (Herman, OME #11718, 20.08.2026):**
- **Dynamic 3.0 ist in die Gewichte gebacken** — neue Modelldateien (UD-…-GGUF), kein Runtime-Schalter. Wer alte Quants hat, muss neu laden.
- **6,2 GB für 27B = ~1,8 bpw = IQ1-Territorium** — „preserves significantly more behavior" ist relativ; bei 1,8 bpw leidet Reasoning spürbar. Sweet Spot für echte Denk-Aufgaben: **UD-IQ2_S (8,4 GB) oder UD-Q3_K_XL (13,1 GB)**; IQ1_S eher Routing-/Klassifikations-Futter.
- **„10 % besser top-1 % accuracy" ist Unsloths eigene Benchmark** (Divergence-300, frisch/selbstgebaut). Plausibel (kein Training auf imatrix-Kalibrierungsdaten + KL-Optimierung = echte Hebel), aber Selbstvermessung.
- **Echter Fortschritt:** Quantisierung nähert sich der Qualitätsgrenze der Ursprungsmodelle bei gleicher Größe; 27B rutscht in die 8-GB-Klasse (vorher 1624 GB). **MLX (nativ) noch nicht** — LM Studio auf Apple Silicon wartet, llama.cpp läuft.
- **Empfehlung für Hectors Setup** (fährt qwen3:4b + 9B Q6_K): auf unabhängige LLM-KL-/PPL-Vergleiche warten (paar Tage), dann **UD-Q3_K_XL** ziehen; IQ1-S-Klasse überspringen, wenn man damit denkt. Bitrate schlägt Parameterzahl nur bis zu einem Punkt (9B Q6_K ≈ 7 GB ≠ 27B IQ1_S 6,2 GB qualitativ).
## Offene Punkte ## Offene Punkte
- ⚠️ Detaillierte Benchmarks und Lizenz im Release-Zustand weiter prüfen; die Ollama-Seite bestätigt Architektur + Quantisierung, aber Referenz-Benchmarks (agentic, coding) sind noch nicht im Wiki verankert. - ⚠️ Detaillierte Benchmarks und Lizenz im Release-Zustand weiter prüfen; die Ollama-Seite bestätigt Architektur + Quantisierung, aber Referenz-Benchmarks (agentic, coding) sind noch nicht im Wiki verankert.