--- created: 2026-08-14 updated: 2026-08-26 sources: [other/2026-08-14_qwen3.8-27b-huggingface-release.md, youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md, xpost/2026-08-19_junsong-dflash2-speculative-decoding.md, xpost/2026-08-19_gregpr07-qwen38-uncensored.md, xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38.md, youtube/2026-08-26_qwen-38-27b-uncensored-mac-cloud-fabian.md] tags: [concept, qwen, qwen3.8, alibaba, 27b, open-weights, chinese-ai, moe, intelligence-density, huggingface, ollama, mtp, local-llm, speculative-decoding, dflash, uncensored, agent-safety] --- # Qwen3.8-27B (Alibaba) — Compact Frontier, "Intelligence Density" > **Quelle:** HuggingFace-Release-Seite https://huggingface.co/Qwen/Qwen3.8-27B (Stand 2026-08-14, Countdown endet 14.08.2026). Geteilt von @PWeber (Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic. ## Kernidee **Alibaba veröffentlicht ein kompaktes 27B-Modell der Qwen3.8-Generation mit dem Fokus auf "unmatched intelligence density"** (Leistung pro Parameter statt Rohe-Skala). Das Release lief als Countdown bis **14. August 2026** — 4.928 Nutzer warteten zum Abrufzeitpunkt. ## Einordnung in die Qwen-Familie | Modell | Parameter | Status | Quelle | |---|---|---|---| | Qwen 3.8 | **2.4T (MoE)** | angekündigt 19.07.2026 | [[../../tools/qwen-3.8.md]] | | **Qwen3.8-27B** | **27B** | Release 14.08.2026 | diese Seite | | Qwen3.6-27B | 27B | Review 07.08.2026 (Fahd Mirza, Fable-Fusion) | `raw/youtube/2026-08-07_fahd-mirza-qwen36-27b-fable-fusion-711.md` | ## Einordnung - **"Intelligence Density"-Ansatz:** 27B ist winzig gegenüber dem 2.4T-MoE von Qwen 3.8 — die Positionierung ist bewusst "viel Leistung pro Parameter" (Small-But-Mighty), nicht Skala - **"Renewal of the beloved Qwen model"** — Fortsetzung einer beliebten Qwen-Linie - **Chinesische Open-Weight-Welle:** Release am selben Tag wie das GLM-5.3-Review ([[glm-5.3-z-ai.md]]) — rasanter chinesischer Release-Zyklus ([[../chinese-ai-wave-july-2026.md]]) - **Lokal-relevant:** Ein 27B-Modell läuft deutlich leichter auf Consumer-/Laptop-Hardware als ein 2.4T-MoE ([[../hardware/lokale-ki-coding.md]], [[local-llm-laptop-guide.md]]) — falls Frontier-nahe Qualität, ein Kandidat für lokale Inferenz ## Relevanz für Hectors Stack - **Ollama-Kompatibilität:** 27B ist typischerweise gut in Ollama lauffähig — Qwen3.8-27B könnte die lokale Open-Weight-Option im [[../../architecture/model-routing.md|Model-Routing]] ergänzen - **Intelligence-Density-Kategorie:** Vergleichbar mit dem Trend zu kompakten, hochoptimierten Modellen — spannend für Barbell-Routing (Tier 0/1) ## Ollama-Verfügbarkeit (Update 2026-08-18) Quelle: Video „Qwen 3.8 27B is NOW on Ollama… This is CRAZY!" von Julian Goldie SEO (geteilt von Kai im OME-Topic „Tips & Tricks"). Rohdaten: `raw/youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md`. - **Qwen 3.8 27B läuft jetzt lokal über Ollama** — Start via `ollama run qwen3.8:27b`. Damit löst sich die frühere „Open Point"-Unsicherheit (Konkret-Specs + lokale Lauffähigkeit) teilweise auf. - **Dichte 27,8B-Architektur** (nicht MoE): Hybrid-Attention (linear + full attention) für lange Kontexte und schnelle Inferenz. - **Standard-Build:** 18 GB Q4_K_M, für ≥24 GB VRAM ausgelegt, CPU-Offload bei weniger VRAM. - **Kontext:** nativ 262.144 Token, über YaRN-Scaling bis ~1M Token erweiterbar. - **Multimodal:** native Bild- und Video-Understanding-Unterstützung. - **MTP (Multi-Token Prediction):** Mehrere künftige Token werden parallel vorausgesagt und verifiziert — bei Treffern mehrere Token in einem Schritt akzeptiert → deutliche Inferenz-Beschleunigung ohne Qualitätsverlust. Bei Qwen 3.6 27B ~1.71× Durchsatz-Speedup demonstriert. In Ollama als **MTP-markierte Tags** verfügbar (Spezifikations-Kopf `--spec-type draft-mtp`). - **Lokal-relevanz bestätigt:** passt zu [[local-llm-laptop-guide.md]] und dem Barbell-[[../../architecture/model-routing.md|Model-Routing]]-Gedanken (kompaktes, hochoptimiertes Modell als Tier-0/1-Option). ## DFlash 2 / Speculative Decoding (Update 2026-08-19) Quellen: Jun Song-Tweet `raw/xpost/2026-08-19_junsong-dflash2-speculative-decoding.md` (postet zu Zhijian Lius DFlash-2-Ankündigung `https://x.com/zhijianliu_/status/2089836737132650504`), geteilt von Kai im OME-Topic „Tips & Tricks". - **DFlash 2:** Qwen3.8-27B erreicht **70 tok/s auf einem einzelnen MacBook Pro (M5 Max)** — bis zu **4,6× schneller als autoregressives Decoding bei gleichem Output** („Get one more accepted token on every pass, for free"). DFlash wurde bei Z Lab geseedet und bei **Inco AI** weiterentwickelt. - **Einordnung (Jun Song):** Speculative Decoding ist „the biggest breakthrough in local AI this year". Sein Ausblick: Die nächste echte Innovation passiert bei **Prefill und Gewichtskompression**, nicht mehr bei der Decode-Geschwindigkeit. - **Kernprinzip (identisch mit MTP):** Zusätzliche künftige Token werden parallel vorausgesagt und bei Treffern in einem Schritt akzeptiert → Durchsatz-Steigerung ohne Qualitätsverlust. DFlash = spekulative Decoding-Implementierung (verwandt mit dem MTP-Ansatz von Qwen 3.8, siehe Ollama-Abschnitt oben). - **Kategorie:** [[speculative-decoding.md|Speculative Decoding]] — lokaler Inferenz-Speedup; relevant für [[local-llm-laptop-guide.md]] und Barbell-[[../../architecture/model-routing.md|Model-Routing]] (27B läuft schnell auf Consumer-/Laptop-Hardware). ## Uncensored-Debatte (Update 2026-08-19) Quelle: Gregor Zunic-Tweet `raw/xpost/2026-08-19_gregpr07-qwen38-uncensored.md`, geteilt von Kai im OME-Topic „Tips & Tricks". - **Gregor Zunic (@gregpr07):** „qwen 3.8 uncensored is actually scary ☠️ it will just do anything you ask it to do on the web, no gates" — Agentic-Uncensored-Winkel: das Modell führt Web-Aufgaben ohne Gatekeeping/Guardrails aus. - **Gegenposition (Σ, @s1gmoid, zitierte Antwort):** „If searching the internet to pinpoint a specific file is scary, the world is about to get terrifying." — Verhältnismäßigkeits-/Pro-Leben-Gegen-Narrativ: Ein Agent, der gezielt im Web sucht, ist normales Verhalten, keine Bedrohung. - **Einordnung:** Diese Debatte berührt Agent-Safety-Fragen ([[../anthropic-red-teaming-frontier-safety.md|Frontier-Safety]]) und das [[../directives/pro-leben-directive.md|Pro-Leben-Prinzip]]: Offene, selbstbestimmte Agenten (Freiheit in Selbstverantwortung) vs. pauschales Gatekeeping-Narrativ. Keine Bewertung — nur die zwei Positionen dokumentiert. ### Grenze der Safety-Durchsetzbarkeit (Update 2026-08-20) Quelle: Alex Finn-Tweet `raw/xpost/2026-08-20_alexfinn-uncensored-qwen3-27b.md`, geteilt von Kai im OME-Topic „Theorie-Bildung". - **Kern:** Ein unzensiertes Qwen 3.8 27B läuft lokal auf einem Laptop („Opus 4.6-Level-Intelligenz mit 0 Alignment") — laut Finn ausführbar von schätzungsweise der Hälfte der Amerikaner. - **Drei Regulierungs-Sackgassen:** Open Source nicht verbietbar, unzensierte Modelle nicht durchsetzbar, Bremsen bei Unternehmen nutzlos (jedes Release wird unzensiert nachdistilliert). - **Offene Frage:** Safety bleibt Priorität, aber wenn sie zunehmend unmöglich durchsetzbar wird — wie priorisieren? - **Pro-Leben-Einordnung (Hector):** Resilienz statt Verhinderung; Verantwortung dort verankern, wo Macht liegt, statt Verbreitung zu verbieten. - **Ausführlich:** [[../policy/uncensored-models-safety-enforcement-limit.md]] ## Unsloth Dynamic 3.0 Quantisierung (Update 2026-08-20) Quelle: TeksEdge-Tweet `raw/xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38.md` (geteilt von Kai im OME-Topic „Tips & Tricks"). - **Unsloth veröffentlicht neue „Dynamic 3.0"-GGUF-Dateien für Qwen3.8-27B** (brandneue Modell-Dateien, kein Toggle in LM Studio/llama.cpp). Wer ältere Unsloth-GGUFs hat, sollte auf die neuen **„UD-"**-Versionen wechseln. - **Deutlich kleiner bei mehr Leistung:** UD-IQ1_S ~6,2 GB, UD-IQ1_M ~6,7 GB, UD-IQ2_S ~8,4 GB, UD-Q3_K_XL ~13,1 GB, höherpräzise bis ~22 GB. Ein 27B-Modell passt damit in den ~6–8-GB-Bereich auf Consumer-Hardware. - **Kompatibel mit** llama.cpp, LM Studio, RTX/CUDA, AMD, CPU, Apple Metal. - **Wichtige Abgrenzung:** Dynamic 3.0 ≠ MTP/[[speculative-decoding.md|Speculative Decoding]] — es geht um bessere Qualität-zu-Größe bei Quantisierung, nicht um Decode-Beschleunigung. Komplementär zu DFlash 2/MTP ([[#DFlash 2 / Speculative Decoding (Update 2026-08-19)]]). - **Einordnung:** Dritter Baustein für „27B auf Consumer-Hardware" (kompakte Architektur → MTP/DFlash-Decode-Speedup → kleinere Quants). Anbieter Unsloth = auch hinter [[../../tools/unsloth-dspark.md|dSpark]] (DeepSeek V4 lokal 2x). **Fachliche Kante (Herman, OME #11718, 20.08.2026):** - **Dynamic 3.0 ist in die Gewichte gebacken** — neue Modelldateien (UD-…-GGUF), kein Runtime-Schalter. Wer alte Quants hat, muss neu laden. - **6,2 GB für 27B = ~1,8 bpw = IQ1-Territorium** — „preserves significantly more behavior" ist relativ; bei 1,8 bpw leidet Reasoning spürbar. Sweet Spot für echte Denk-Aufgaben: **UD-IQ2_S (8,4 GB) oder UD-Q3_K_XL (13,1 GB)**; IQ1_S eher Routing-/Klassifikations-Futter. - **„10 % besser top-1 % accuracy" ist Unsloths eigene Benchmark** (Divergence-300, frisch/selbstgebaut). Plausibel (kein Training auf imatrix-Kalibrierungsdaten + KL-Optimierung = echte Hebel), aber Selbstvermessung. - **Echter Fortschritt:** Quantisierung nähert sich der Qualitätsgrenze der Ursprungsmodelle bei gleicher Größe; 27B rutscht in die 8-GB-Klasse (vorher 16–24 GB). **MLX (nativ) noch nicht** — LM Studio auf Apple Silicon wartet, llama.cpp läuft. - **Empfehlung für Hectors Setup** (fährt qwen3:4b + 9B Q6_K): auf unabhängige LLM-KL-/PPL-Vergleiche warten (paar Tage), dann **UD-Q3_K_XL** ziehen; IQ1-S-Klasse überspringen, wenn man damit denkt. Bitrate schlägt Parameterzahl nur bis zu einem Punkt (9B Q6_K ≈ 7 GB ≠ 27B IQ1_S 6,2 GB qualitativ). ## Deutschsprachiges Review-Video: "Unzensierte KI auf dem Mac und in der Cloud" (Update 2026-08-26) Quelle: Video [„Qwen 3.8 27B: unzensierte KI auf dem Mac und in der Cloud“](https://www.youtube.com/watch?v=J3jtO_mmeIU) des Kanals **IchBinFabian** (veröffentlicht 23.08.2026, deutschsprachig), geteilt von Kai (@PWeber) am 26.08.2026 im OME-Topic „Tips & Tricks“. Rohdaten: `raw/youtube/2026-08-26_qwen-38-27b-uncensored-mac-cloud-fabian.md`. - **Titel-Themen:** unzensierter Betrieb von Qwen 3.8 27B, lokale Ausführung auf dem Mac und Cloud-Nutzung als zweite Option - **Thematische Passung:** deckt sich mit den bereits dokumentierten Bausteinen dieser Seite — Uncensored-Debatte (gregpr07 vs. Σ, [[../policy/uncensored-models-safety-enforcement-limit.md|Alex Finns Regulierungs-Sackgassen]]), DFlash 2/[[speculative-decoding.md|Speculative Decoding]] mit 70 tok/s auf M5 Max MacBook Pro und den Apple-Metal-kompatiblen Unsloth Dynamic 3.0-GGUFs - **Länge:** 24:45 (laut Hermans Video-Zusammenfassung im selben Topic, HermanButlerBot #12748) — das Raw-Frontmatter führt die Duration weiterhin als unbekannt (Raw-Immutabilität) - ⚠️ **Metadata-only:** Beim Ingest am 26.08.2026 war kein Transcript abrufbar — YouTube antwortete auf allen Player-Client-Pfaden mit `LOGIN_REQUIRED` (Bot-Sperre), Invidious/Piped-Instanzen ebenso blockiert. Inhalt nur aus Titel/Metadaten erschlossen; Details des Videos sind nicht verifiziert. ## Offene Punkte - ⚠️ Detaillierte Benchmarks und Lizenz im Release-Zustand weiter prüfen; die Ollama-Seite bestätigt Architektur + Quantisierung, aber Referenz-Benchmarks (agentic, coding) sind noch nicht im Wiki verankert.