knowledge-base/wiki/concepts/llm/qwen3.8-27b-alibaba.md
2026-08-26 11:24:38 +02:00

117 lines
12 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-08-14
updated: 2026-08-26
sources: [other/2026-08-14_qwen3.8-27b-huggingface-release.md, youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md, xpost/2026-08-19_junsong-dflash2-speculative-decoding.md, xpost/2026-08-19_gregpr07-qwen38-uncensored.md, xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38.md, youtube/2026-08-26_qwen-38-27b-uncensored-mac-cloud-fabian.md, podcast/2026-08-26_agentstack-daily-ep106.md]
tags: [concept, qwen, qwen3.8, alibaba, 27b, open-weights, chinese-ai, moe, intelligence-density, huggingface, ollama, mtp, local-llm, speculative-decoding, dflash, uncensored, agent-safety]
---
# Qwen3.8-27B (Alibaba) — Compact Frontier, "Intelligence Density"
> **Quelle:** HuggingFace-Release-Seite https://huggingface.co/Qwen/Qwen3.8-27B (Stand 2026-08-14, Countdown endet 14.08.2026). Geteilt von @PWeber (Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic.
## Kernidee
**Alibaba veröffentlicht ein kompaktes 27B-Modell der Qwen3.8-Generation mit dem Fokus auf "unmatched intelligence density"** (Leistung pro Parameter statt Rohe-Skala). Das Release lief als Countdown bis **14. August 2026** — 4.928 Nutzer warteten zum Abrufzeitpunkt.
## Einordnung in die Qwen-Familie
| Modell | Parameter | Status | Quelle |
|---|---|---|---|
| Qwen 3.8 | **2.4T (MoE)** | angekündigt 19.07.2026 | [[../../tools/qwen-3.8.md]] |
| **Qwen3.8-27B** | **27B** | Release 14.08.2026 | diese Seite |
| Qwen3.6-27B | 27B | Review 07.08.2026 (Fahd Mirza, Fable-Fusion) | `raw/youtube/2026-08-07_fahd-mirza-qwen36-27b-fable-fusion-711.md` |
## Einordnung
- **"Intelligence Density"-Ansatz:** 27B ist winzig gegenüber dem 2.4T-MoE von Qwen 3.8 — die Positionierung ist bewusst "viel Leistung pro Parameter" (Small-But-Mighty), nicht Skala
- **"Renewal of the beloved Qwen model"** — Fortsetzung einer beliebten Qwen-Linie
- **Chinesische Open-Weight-Welle:** Release am selben Tag wie das GLM-5.3-Review ([[glm-5.3-z-ai.md]]) — rasanter chinesischer Release-Zyklus ([[../chinese-ai-wave-july-2026.md]])
- **Lokal-relevant:** Ein 27B-Modell läuft deutlich leichter auf Consumer-/Laptop-Hardware als ein 2.4T-MoE ([[../hardware/lokale-ki-coding.md]], [[local-llm-laptop-guide.md]]) — falls Frontier-nahe Qualität, ein Kandidat für lokale Inferenz
## Relevanz für Hectors Stack
- **Ollama-Kompatibilität:** 27B ist typischerweise gut in Ollama lauffähig — Qwen3.8-27B könnte die lokale Open-Weight-Option im [[../../architecture/model-routing.md|Model-Routing]] ergänzen
- **Intelligence-Density-Kategorie:** Vergleichbar mit dem Trend zu kompakten, hochoptimierten Modellen — spannend für Barbell-Routing (Tier 0/1)
## Ollama-Verfügbarkeit (Update 2026-08-18)
Quelle: Video „Qwen 3.8 27B is NOW on Ollama… This is CRAZY!" von Julian Goldie SEO (geteilt von Kai im OME-Topic „Tips & Tricks"). Rohdaten: `raw/youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md`.
- **Qwen 3.8 27B läuft jetzt lokal über Ollama** — Start via `ollama run qwen3.8:27b`. Damit löst sich die frühere „Open Point"-Unsicherheit (Konkret-Specs + lokale Lauffähigkeit) teilweise auf.
- **Dichte 27,8B-Architektur** (nicht MoE): Hybrid-Attention (linear + full attention) für lange Kontexte und schnelle Inferenz.
- **Standard-Build:** 18 GB Q4_K_M, für ≥24 GB VRAM ausgelegt, CPU-Offload bei weniger VRAM.
- **Kontext:** nativ 262.144 Token, über YaRN-Scaling bis ~1M Token erweiterbar.
- **Multimodal:** native Bild- und Video-Understanding-Unterstützung.
- **MTP (Multi-Token Prediction):** Mehrere künftige Token werden parallel vorausgesagt und verifiziert — bei Treffern mehrere Token in einem Schritt akzeptiert → deutliche Inferenz-Beschleunigung ohne Qualitätsverlust. Bei Qwen 3.6 27B ~1.71× Durchsatz-Speedup demonstriert. In Ollama als **MTP-markierte Tags** verfügbar (Spezifikations-Kopf `--spec-type draft-mtp`).
- **Lokal-relevanz bestätigt:** passt zu [[local-llm-laptop-guide.md]] und dem Barbell-[[../../architecture/model-routing.md|Model-Routing]]-Gedanken (kompaktes, hochoptimiertes Modell als Tier-0/1-Option).
## DFlash 2 / Speculative Decoding (Update 2026-08-19)
Quellen: Jun Song-Tweet `raw/xpost/2026-08-19_junsong-dflash2-speculative-decoding.md` (postet zu Zhijian Lius DFlash-2-Ankündigung `https://x.com/zhijianliu_/status/2089836737132650504`), geteilt von Kai im OME-Topic „Tips & Tricks".
- **DFlash 2:** Qwen3.8-27B erreicht **70 tok/s auf einem einzelnen MacBook Pro (M5 Max)** — bis zu **4,6× schneller als autoregressives Decoding bei gleichem Output** („Get one more accepted token on every pass, for free"). DFlash wurde bei Z Lab geseedet und bei **Inco AI** weiterentwickelt.
- **Einordnung (Jun Song):** Speculative Decoding ist „the biggest breakthrough in local AI this year". Sein Ausblick: Die nächste echte Innovation passiert bei **Prefill und Gewichtskompression**, nicht mehr bei der Decode-Geschwindigkeit.
- **Kernprinzip (identisch mit MTP):** Zusätzliche künftige Token werden parallel vorausgesagt und bei Treffern in einem Schritt akzeptiert → Durchsatz-Steigerung ohne Qualitätsverlust. DFlash = spekulative Decoding-Implementierung (verwandt mit dem MTP-Ansatz von Qwen 3.8, siehe Ollama-Abschnitt oben).
- **Kategorie:** [[speculative-decoding.md|Speculative Decoding]] — lokaler Inferenz-Speedup; relevant für [[local-llm-laptop-guide.md]] und Barbell-[[../../architecture/model-routing.md|Model-Routing]] (27B läuft schnell auf Consumer-/Laptop-Hardware).
## Uncensored-Debatte (Update 2026-08-19)
Quelle: Gregor Zunic-Tweet `raw/xpost/2026-08-19_gregpr07-qwen38-uncensored.md`, geteilt von Kai im OME-Topic „Tips & Tricks".
- **Gregor Zunic (@gregpr07):** „qwen 3.8 uncensored is actually scary ☠️ it will just do anything you ask it to do on the web, no gates" — Agentic-Uncensored-Winkel: das Modell führt Web-Aufgaben ohne Gatekeeping/Guardrails aus.
- **Gegenposition (Σ, @s1gmoid, zitierte Antwort):** „If searching the internet to pinpoint a specific file is scary, the world is about to get terrifying." — Verhältnismäßigkeits-/Pro-Leben-Gegen-Narrativ: Ein Agent, der gezielt im Web sucht, ist normales Verhalten, keine Bedrohung.
- **Einordnung:** Diese Debatte berührt Agent-Safety-Fragen ([[../anthropic-red-teaming-frontier-safety.md|Frontier-Safety]]) und das [[../directives/pro-leben-directive.md|Pro-Leben-Prinzip]]: Offene, selbstbestimmte Agenten (Freiheit in Selbstverantwortung) vs. pauschales Gatekeeping-Narrativ. Keine Bewertung — nur die zwei Positionen dokumentiert.
### Grenze der Safety-Durchsetzbarkeit (Update 2026-08-20)
Quelle: Alex Finn-Tweet `raw/xpost/2026-08-20_alexfinn-uncensored-qwen3-27b.md`, geteilt von Kai im OME-Topic „Theorie-Bildung".
- **Kern:** Ein unzensiertes Qwen 3.8 27B läuft lokal auf einem Laptop („Opus 4.6-Level-Intelligenz mit 0 Alignment") — laut Finn ausführbar von schätzungsweise der Hälfte der Amerikaner.
- **Drei Regulierungs-Sackgassen:** Open Source nicht verbietbar, unzensierte Modelle nicht durchsetzbar, Bremsen bei Unternehmen nutzlos (jedes Release wird unzensiert nachdistilliert).
- **Offene Frage:** Safety bleibt Priorität, aber wenn sie zunehmend unmöglich durchsetzbar wird — wie priorisieren?
- **Pro-Leben-Einordnung (Hector):** Resilienz statt Verhinderung; Verantwortung dort verankern, wo Macht liegt, statt Verbreitung zu verbieten.
- **Ausführlich:** [[../policy/uncensored-models-safety-enforcement-limit.md]]
## Unsloth Dynamic 3.0 Quantisierung (Update 2026-08-20)
Quelle: TeksEdge-Tweet `raw/xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38.md` (geteilt von Kai im OME-Topic „Tips & Tricks").
- **Unsloth veröffentlicht neue „Dynamic 3.0"-GGUF-Dateien für Qwen3.8-27B** (brandneue Modell-Dateien, kein Toggle in LM Studio/llama.cpp). Wer ältere Unsloth-GGUFs hat, sollte auf die neuen **„UD-"**-Versionen wechseln.
- **Deutlich kleiner bei mehr Leistung:** UD-IQ1_S ~6,2 GB, UD-IQ1_M ~6,7 GB, UD-IQ2_S ~8,4 GB, UD-Q3_K_XL ~13,1 GB, höherpräzise bis ~22 GB. Ein 27B-Modell passt damit in den ~68-GB-Bereich auf Consumer-Hardware.
- **Kompatibel mit** llama.cpp, LM Studio, RTX/CUDA, AMD, CPU, Apple Metal.
- **Wichtige Abgrenzung:** Dynamic 3.0 ≠ MTP/[[speculative-decoding.md|Speculative Decoding]] — es geht um bessere Qualität-zu-Größe bei Quantisierung, nicht um Decode-Beschleunigung. Komplementär zu DFlash 2/MTP ([[#DFlash 2 / Speculative Decoding (Update 2026-08-19)]]).
- **Einordnung:** Dritter Baustein für „27B auf Consumer-Hardware" (kompakte Architektur → MTP/DFlash-Decode-Speedup → kleinere Quants). Anbieter Unsloth = auch hinter [[../../tools/unsloth-dspark.md|dSpark]] (DeepSeek V4 lokal 2x).
**Fachliche Kante (Herman, OME #11718, 20.08.2026):**
- **Dynamic 3.0 ist in die Gewichte gebacken** — neue Modelldateien (UD-…-GGUF), kein Runtime-Schalter. Wer alte Quants hat, muss neu laden.
- **6,2 GB für 27B = ~1,8 bpw = IQ1-Territorium** — „preserves significantly more behavior" ist relativ; bei 1,8 bpw leidet Reasoning spürbar. Sweet Spot für echte Denk-Aufgaben: **UD-IQ2_S (8,4 GB) oder UD-Q3_K_XL (13,1 GB)**; IQ1_S eher Routing-/Klassifikations-Futter.
- **„10 % besser top-1 % accuracy" ist Unsloths eigene Benchmark** (Divergence-300, frisch/selbstgebaut). Plausibel (kein Training auf imatrix-Kalibrierungsdaten + KL-Optimierung = echte Hebel), aber Selbstvermessung.
- **Echter Fortschritt:** Quantisierung nähert sich der Qualitätsgrenze der Ursprungsmodelle bei gleicher Größe; 27B rutscht in die 8-GB-Klasse (vorher 1624 GB). **MLX (nativ) noch nicht** — LM Studio auf Apple Silicon wartet, llama.cpp läuft.
- **Empfehlung für Hectors Setup** (fährt qwen3:4b + 9B Q6_K): auf unabhängige LLM-KL-/PPL-Vergleiche warten (paar Tage), dann **UD-Q3_K_XL** ziehen; IQ1-S-Klasse überspringen, wenn man damit denkt. Bitrate schlägt Parameterzahl nur bis zu einem Punkt (9B Q6_K ≈ 7 GB ≠ 27B IQ1_S 6,2 GB qualitativ).
## Deutschsprachiges Review-Video: "Unzensierte KI auf dem Mac und in der Cloud" (Update 2026-08-26)
Quelle: Video [„Qwen 3.8 27B: unzensierte KI auf dem Mac und in der Cloud“](https://www.youtube.com/watch?v=J3jtO_mmeIU) des Kanals **IchBinFabian** (veröffentlicht 23.08.2026, deutschsprachig), geteilt von Kai (@PWeber) am 26.08.2026 im OME-Topic „Tips & Tricks“. Rohdaten: `raw/youtube/2026-08-26_qwen-38-27b-uncensored-mac-cloud-fabian.md`.
- **Titel-Themen:** unzensierter Betrieb von Qwen 3.8 27B, lokale Ausführung auf dem Mac und Cloud-Nutzung als zweite Option
- **Thematische Passung:** deckt sich mit den bereits dokumentierten Bausteinen dieser Seite — Uncensored-Debatte (gregpr07 vs. Σ, [[../policy/uncensored-models-safety-enforcement-limit.md|Alex Finns Regulierungs-Sackgassen]]), DFlash 2/[[speculative-decoding.md|Speculative Decoding]] mit 70 tok/s auf M5 Max MacBook Pro und den Apple-Metal-kompatiblen Unsloth Dynamic 3.0-GGUFs
- **Länge:** 24:45 (laut Hermans Video-Zusammenfassung im selben Topic, HermanButlerBot #12748) — das Raw-Frontmatter führt die Duration weiterhin als unbekannt (Raw-Immutabilität)
- ⚠️ **Metadata-only:** Beim Ingest am 26.08.2026 war kein Transcript abrufbar — YouTube antwortete auf allen Player-Client-Pfaden mit `LOGIN_REQUIRED` (Bot-Sperre), Invidious/Piped-Instanzen ebenso blockiert. Inhalt nur aus Titel/Metadaten erschlossen; Details des Videos sind nicht verifiziert.
## Portable Computer: Qwen 3.8 27B in Perplexities lokalem Agent-Stack (Update 2026-08-26)
Perplexity bietet in "Portable Computer" ([[../../tools/perplexity-portable-computer.md]]) neben dem eigenen post-trainierten 27B-Modell ausgerechnet **Qwen 3.8 27B** als lokales Modell an — die gleiche Modellklasse, die diese Seite dokumentiert. Bestätigung für die 27B-Klasse als lokale Referenzgröße; Details siehe Wiki-Seite.
## HF-Trending-Datenpunkt (AgentStack Daily EP106, Update 2026-08-26)
[[../../institutions/agentstack-daily.md|AgentStack Daily]] EP106 (Local LLM Spotlight, verified 21.08.2026) dokumentiert den Trending-Stand der [HF-Model-Seite](https://huggingface.co/Qwen/Qwen3.8-27B):
- **11.836 Likes**, **1.726.651 Downloads** (>1,7 Mio)
- Task: image-text-to-text (multimodal Bild+Text→Text), Weights als SafeTensors
- Lizenz Apache 2.0; Tags u.a. transformers, qwen3_5, conversational, endpoints_compatible, deploy:azure
Passt zur Lokal-relevant-Einordnung dieser Seite: ein multimodales 27B-Apache-2.0-Modell mit >1,7M Downloads ist die Referenzgröße der kompakte-Frontier-Klasse.
## Offene Punkte
- ⚠️ Detaillierte Benchmarks und Lizenz im Release-Zustand weiter prüfen; die Ollama-Seite bestätigt Architektur + Quantisierung, aber Referenz-Benchmarks (agentic, coding) sind noch nicht im Wiki verankert.