37 lines
2.1 KiB
Markdown
37 lines
2.1 KiB
Markdown
|
|
---
|
|||
|
|
type: xpost
|
|||
|
|
source_url: https://x.com/TeksEdge/status/2090228570253861075
|
|||
|
|
retrieved: 2026-08-20
|
|||
|
|
author: "@TeksEdge (David Hendrickson)"
|
|||
|
|
is_thread: false
|
|||
|
|
quote_count: 0
|
|||
|
|
---
|
|||
|
|
|
|||
|
|
# Unsloth Dynamic 3.0 — Neue GGUF-Quantisierung für Qwen3.8-27B
|
|||
|
|
|
|||
|
|
**Autor:** @TeksEdge (David Hendrickson)
|
|||
|
|
**URL:** https://x.com/TeksEdge/status/2090228570253861075
|
|||
|
|
**Retrieved:** 2026-08-20 (OME-Gruppe, Topic 27 "Tips & Tricks", gepostet von Kai/@PWeber)
|
|||
|
|
|
|||
|
|
## Inhalt
|
|||
|
|
|
|||
|
|
Follow-up-Warnung zu Unsloth AIs neu veröffentlichten **"Dynamic 3.0"-Quantisierungs-Versionen** des Qwen3.8-27B-Modells:
|
|||
|
|
|
|||
|
|
- **Neue GGUF-Dateien:** Unsloth hat aktualisierte GGUF-Dateien für Qwen3.8-27B veröffentlicht, die die neue **Dynamic V3-Quantisierung** nutzen.
|
|||
|
|
- **Brandneue Modelldateien:** Es handelt sich um *neue* Modell-Dateien (nicht um einen Toggle/Setting in LM Studio oder llama.cpp).
|
|||
|
|
- **Re-Download nötig:** Wer bereits eine ältere Unsloth-Qwen3.8-GGUF geladen hat, sollte die neuen **"UD-..."**-Versionen re-downloaden, um von den Verbesserungen zu profitieren.
|
|||
|
|
- **Deutlich kleiner bei mehr Leistung:** Die neuen Quants sind deutlich kleiner und erhalten dabei mehr der ursprünglichen Modell-Leistung:
|
|||
|
|
- UD-IQ1_S → ~6,2 GB
|
|||
|
|
- UD-IQ1_M → ~6,7 GB
|
|||
|
|
- UD-IQ2_S → ~8,4 GB
|
|||
|
|
- UD-Q3_K_XL → ~13,1 GB
|
|||
|
|
- Höherpräzise Varianten bis ~22 GB
|
|||
|
|
- **Kompatibilität:** Funktioniert mit den üblichen Tools (llama.cpp, LM Studio, RTX/CUDA, AMD, CPU, Apple Metal).
|
|||
|
|
- **Abgrenzung zu MTP/speculative decoding:** Dynamic 3.0 ist **nicht** dasselbe wie Qwen3.8s MTP (Speculative Decoding) — es geht spezifisch um bessere Qualität-zu-Größe bei Quantisierung.
|
|||
|
|
|
|||
|
|
**Kernaussage:** „If you grabbed the old Unsloth Qwen3.8 GGUF, go grab the new Dynamic 3.0 ones instead." Ein 27B-Modell passt jetzt in den ~6–8-GB-Bereich auf Consumer-Hardware — das ist signifikant.
|
|||
|
|
|
|||
|
|
## Einordnung
|
|||
|
|
|
|||
|
|
Passt zum laufenden Qwen3.8-27B-Faden (Speculative Decoding/DFlash 2, lokale Inferenz, Barbell-Routing): Quantisierungs-Optimierung ist ein weiterer Baustein für „27B auf Consumer-Hardware" — komplementär zur Decode-Beschleunigung (MTP/DFlash). Unsloth ist der Anbieter hinter dSpark (DeepSeek V4 lokal 2x).
|