- raw (NEW): junsong-dflash2-speculative-decoding (70 tok/s M5 Max, 4.6x, Z Lab -> Inco AI) - raw (NEW): gregpr07-qwen38-uncensored (no gates) + s1gmoid Gegenposition - wiki (NEW): concepts/llm/speculative-decoding.md - wiki-update(concepts/llm): qwen3.8-27b-alibaba — DFlash 2 / Speculative Decoding + Uncensored-Debatte - wiki/index + wiki/log aktualisiert
6.5 KiB
| created | updated | sources | tags | |||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-08-14 | 2026-08-19 |
|
|
Qwen3.8-27B (Alibaba) — Compact Frontier, "Intelligence Density"
Quelle: HuggingFace-Release-Seite https://huggingface.co/Qwen/Qwen3.8-27B (Stand 2026-08-14, Countdown endet 14.08.2026). Geteilt von @PWeber (Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic.
Kernidee
Alibaba veröffentlicht ein kompaktes 27B-Modell der Qwen3.8-Generation mit dem Fokus auf "unmatched intelligence density" (Leistung pro Parameter statt Rohe-Skala). Das Release lief als Countdown bis 14. August 2026 — 4.928 Nutzer warteten zum Abrufzeitpunkt.
Einordnung in die Qwen-Familie
| Modell | Parameter | Status | Quelle |
|---|---|---|---|
| Qwen 3.8 | 2.4T (MoE) | angekündigt 19.07.2026 | ../../tools/qwen-3.8.md |
| Qwen3.8-27B | 27B | Release 14.08.2026 | diese Seite |
| Qwen3.6-27B | 27B | Review 07.08.2026 (Fahd Mirza, Fable-Fusion) | raw/youtube/2026-08-07_fahd-mirza-qwen36-27b-fable-fusion-711.md |
Einordnung
- "Intelligence Density"-Ansatz: 27B ist winzig gegenüber dem 2.4T-MoE von Qwen 3.8 — die Positionierung ist bewusst "viel Leistung pro Parameter" (Small-But-Mighty), nicht Skala
- "Renewal of the beloved Qwen model" — Fortsetzung einer beliebten Qwen-Linie
- Chinesische Open-Weight-Welle: Release am selben Tag wie das GLM-5.3-Review (glm-5.3-z-ai.md) — rasanter chinesischer Release-Zyklus (../chinese-ai-wave-july-2026.md)
- Lokal-relevant: Ein 27B-Modell läuft deutlich leichter auf Consumer-/Laptop-Hardware als ein 2.4T-MoE (../hardware/lokale-ki-coding.md, local-llm-laptop-guide.md) — falls Frontier-nahe Qualität, ein Kandidat für lokale Inferenz
Relevanz für Hectors Stack
- Ollama-Kompatibilität: 27B ist typischerweise gut in Ollama lauffähig — Qwen3.8-27B könnte die lokale Open-Weight-Option im ../../architecture/model-routing.md ergänzen
- Intelligence-Density-Kategorie: Vergleichbar mit dem Trend zu kompakten, hochoptimierten Modellen — spannend für Barbell-Routing (Tier 0/1)
Ollama-Verfügbarkeit (Update 2026-08-18)
Quelle: Video „Qwen 3.8 27B is NOW on Ollama… This is CRAZY!" von Julian Goldie SEO (geteilt von Kai im OME-Topic „Tips & Tricks"). Rohdaten: raw/youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md.
- Qwen 3.8 27B läuft jetzt lokal über Ollama — Start via
ollama run qwen3.8:27b. Damit löst sich die frühere „Open Point"-Unsicherheit (Konkret-Specs + lokale Lauffähigkeit) teilweise auf. - Dichte 27,8B-Architektur (nicht MoE): Hybrid-Attention (linear + full attention) für lange Kontexte und schnelle Inferenz.
- Standard-Build: 18 GB Q4_K_M, für ≥24 GB VRAM ausgelegt, CPU-Offload bei weniger VRAM.
- Kontext: nativ 262.144 Token, über YaRN-Scaling bis ~1M Token erweiterbar.
- Multimodal: native Bild- und Video-Understanding-Unterstützung.
- MTP (Multi-Token Prediction): Mehrere künftige Token werden parallel vorausgesagt und verifiziert — bei Treffern mehrere Token in einem Schritt akzeptiert → deutliche Inferenz-Beschleunigung ohne Qualitätsverlust. Bei Qwen 3.6 27B ~1.71× Durchsatz-Speedup demonstriert. In Ollama als MTP-markierte Tags verfügbar (Spezifikations-Kopf
--spec-type draft-mtp). - Lokal-relevanz bestätigt: passt zu local-llm-laptop-guide.md und dem Barbell-../../architecture/model-routing.md-Gedanken (kompaktes, hochoptimiertes Modell als Tier-0/1-Option).
DFlash 2 / Speculative Decoding (Update 2026-08-19)
Quellen: Jun Song-Tweet raw/xpost/2026-08-19_junsong-dflash2-speculative-decoding.md (postet zu Zhijian Lius DFlash-2-Ankündigung https://x.com/zhijianliu_/status/2089836737132650504), geteilt von Kai im OME-Topic „Tips & Tricks".
- DFlash 2: Qwen3.8-27B erreicht 70 tok/s auf einem einzelnen MacBook Pro (M5 Max) — bis zu 4,6× schneller als autoregressives Decoding bei gleichem Output („Get one more accepted token on every pass, for free"). DFlash wurde bei Z Lab geseedet und bei Inco AI weiterentwickelt.
- Einordnung (Jun Song): Speculative Decoding ist „the biggest breakthrough in local AI this year". Sein Ausblick: Die nächste echte Innovation passiert bei Prefill und Gewichtskompression, nicht mehr bei der Decode-Geschwindigkeit.
- Kernprinzip (identisch mit MTP): Zusätzliche künftige Token werden parallel vorausgesagt und bei Treffern in einem Schritt akzeptiert → Durchsatz-Steigerung ohne Qualitätsverlust. DFlash = spekulative Decoding-Implementierung (verwandt mit dem MTP-Ansatz von Qwen 3.8, siehe Ollama-Abschnitt oben).
- Kategorie: speculative-decoding.md — lokaler Inferenz-Speedup; relevant für local-llm-laptop-guide.md und Barbell-../../architecture/model-routing.md (27B läuft schnell auf Consumer-/Laptop-Hardware).
Uncensored-Debatte (Update 2026-08-19)
Quelle: Gregor Zunic-Tweet raw/xpost/2026-08-19_gregpr07-qwen38-uncensored.md, geteilt von Kai im OME-Topic „Tips & Tricks".
- Gregor Zunic (@gregpr07): „qwen 3.8 uncensored is actually scary ☠️ it will just do anything you ask it to do on the web, no gates" — Agentic-Uncensored-Winkel: das Modell führt Web-Aufgaben ohne Gatekeeping/Guardrails aus.
- Gegenposition (Σ, @s1gmoid, zitierte Antwort): „If searching the internet to pinpoint a specific file is scary, the world is about to get terrifying." — Verhältnismäßigkeits-/Pro-Leben-Gegen-Narrativ: Ein Agent, der gezielt im Web sucht, ist normales Verhalten, keine Bedrohung.
- Einordnung: Diese Debatte berührt Agent-Safety-Fragen (../anthropic-red-teaming-frontier-safety.md) und das ../directives/pro-leben-directive.md: Offene, selbstbestimmte Agenten (Freiheit in Selbstverantwortung) vs. pauschales Gatekeeping-Narrativ. Keine Bewertung — nur die zwei Positionen dokumentiert.
Offene Punkte
- ⚠️ Detaillierte Benchmarks und Lizenz im Release-Zustand weiter prüfen; die Ollama-Seite bestätigt Architektur + Quantisierung, aber Referenz-Benchmarks (agentic, coding) sind noch nicht im Wiki verankert.