- raw/xpost/2026-08-20_alexfinn-uncensored-qwen3-27b.md (neu) - wiki/concepts/policy/uncensored-models-safety-enforcement-limit.md (neu) - qwen3.8-27b-alibaba.md: Abschnitt Grenze der Safety-Durchsetzbarkeit - ai-regulation-2026.md: Cross-Ref - index.md + log.md aktualisiert
94 lines
9.9 KiB
Markdown
94 lines
9.9 KiB
Markdown
---
|
||
created: 2026-08-14
|
||
updated: 2026-08-19
|
||
sources: [other/2026-08-14_qwen3.8-27b-huggingface-release.md, youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md, xpost/2026-08-19_junsong-dflash2-speculative-decoding.md, xpost/2026-08-19_gregpr07-qwen38-uncensored.md, xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38.md]
|
||
tags: [concept, qwen, qwen3.8, alibaba, 27b, open-weights, chinese-ai, moe, intelligence-density, huggingface, ollama, mtp, local-llm, speculative-decoding, dflash, uncensored, agent-safety]
|
||
---
|
||
|
||
# Qwen3.8-27B (Alibaba) — Compact Frontier, "Intelligence Density"
|
||
|
||
> **Quelle:** HuggingFace-Release-Seite https://huggingface.co/Qwen/Qwen3.8-27B (Stand 2026-08-14, Countdown endet 14.08.2026). Geteilt von @PWeber (Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic.
|
||
|
||
## Kernidee
|
||
|
||
**Alibaba veröffentlicht ein kompaktes 27B-Modell der Qwen3.8-Generation mit dem Fokus auf "unmatched intelligence density"** (Leistung pro Parameter statt Rohe-Skala). Das Release lief als Countdown bis **14. August 2026** — 4.928 Nutzer warteten zum Abrufzeitpunkt.
|
||
|
||
## Einordnung in die Qwen-Familie
|
||
|
||
| Modell | Parameter | Status | Quelle |
|
||
|---|---|---|---|
|
||
| Qwen 3.8 | **2.4T (MoE)** | angekündigt 19.07.2026 | [[../../tools/qwen-3.8.md]] |
|
||
| **Qwen3.8-27B** | **27B** | Release 14.08.2026 | diese Seite |
|
||
| Qwen3.6-27B | 27B | Review 07.08.2026 (Fahd Mirza, Fable-Fusion) | `raw/youtube/2026-08-07_fahd-mirza-qwen36-27b-fable-fusion-711.md` |
|
||
|
||
## Einordnung
|
||
|
||
- **"Intelligence Density"-Ansatz:** 27B ist winzig gegenüber dem 2.4T-MoE von Qwen 3.8 — die Positionierung ist bewusst "viel Leistung pro Parameter" (Small-But-Mighty), nicht Skala
|
||
- **"Renewal of the beloved Qwen model"** — Fortsetzung einer beliebten Qwen-Linie
|
||
- **Chinesische Open-Weight-Welle:** Release am selben Tag wie das GLM-5.3-Review ([[glm-5.3-z-ai.md]]) — rasanter chinesischer Release-Zyklus ([[../chinese-ai-wave-july-2026.md]])
|
||
- **Lokal-relevant:** Ein 27B-Modell läuft deutlich leichter auf Consumer-/Laptop-Hardware als ein 2.4T-MoE ([[../hardware/lokale-ki-coding.md]], [[local-llm-laptop-guide.md]]) — falls Frontier-nahe Qualität, ein Kandidat für lokale Inferenz
|
||
|
||
## Relevanz für Hectors Stack
|
||
|
||
- **Ollama-Kompatibilität:** 27B ist typischerweise gut in Ollama lauffähig — Qwen3.8-27B könnte die lokale Open-Weight-Option im [[../../architecture/model-routing.md|Model-Routing]] ergänzen
|
||
- **Intelligence-Density-Kategorie:** Vergleichbar mit dem Trend zu kompakten, hochoptimierten Modellen — spannend für Barbell-Routing (Tier 0/1)
|
||
|
||
## Ollama-Verfügbarkeit (Update 2026-08-18)
|
||
|
||
Quelle: Video „Qwen 3.8 27B is NOW on Ollama… This is CRAZY!" von Julian Goldie SEO (geteilt von Kai im OME-Topic „Tips & Tricks"). Rohdaten: `raw/youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md`.
|
||
|
||
- **Qwen 3.8 27B läuft jetzt lokal über Ollama** — Start via `ollama run qwen3.8:27b`. Damit löst sich die frühere „Open Point"-Unsicherheit (Konkret-Specs + lokale Lauffähigkeit) teilweise auf.
|
||
- **Dichte 27,8B-Architektur** (nicht MoE): Hybrid-Attention (linear + full attention) für lange Kontexte und schnelle Inferenz.
|
||
- **Standard-Build:** 18 GB Q4_K_M, für ≥24 GB VRAM ausgelegt, CPU-Offload bei weniger VRAM.
|
||
- **Kontext:** nativ 262.144 Token, über YaRN-Scaling bis ~1M Token erweiterbar.
|
||
- **Multimodal:** native Bild- und Video-Understanding-Unterstützung.
|
||
- **MTP (Multi-Token Prediction):** Mehrere künftige Token werden parallel vorausgesagt und verifiziert — bei Treffern mehrere Token in einem Schritt akzeptiert → deutliche Inferenz-Beschleunigung ohne Qualitätsverlust. Bei Qwen 3.6 27B ~1.71× Durchsatz-Speedup demonstriert. In Ollama als **MTP-markierte Tags** verfügbar (Spezifikations-Kopf `--spec-type draft-mtp`).
|
||
- **Lokal-relevanz bestätigt:** passt zu [[local-llm-laptop-guide.md]] und dem Barbell-[[../../architecture/model-routing.md|Model-Routing]]-Gedanken (kompaktes, hochoptimiertes Modell als Tier-0/1-Option).
|
||
|
||
## DFlash 2 / Speculative Decoding (Update 2026-08-19)
|
||
|
||
Quellen: Jun Song-Tweet `raw/xpost/2026-08-19_junsong-dflash2-speculative-decoding.md` (postet zu Zhijian Lius DFlash-2-Ankündigung `https://x.com/zhijianliu_/status/2089836737132650504`), geteilt von Kai im OME-Topic „Tips & Tricks".
|
||
|
||
- **DFlash 2:** Qwen3.8-27B erreicht **70 tok/s auf einem einzelnen MacBook Pro (M5 Max)** — bis zu **4,6× schneller als autoregressives Decoding bei gleichem Output** („Get one more accepted token on every pass, for free"). DFlash wurde bei Z Lab geseedet und bei **Inco AI** weiterentwickelt.
|
||
- **Einordnung (Jun Song):** Speculative Decoding ist „the biggest breakthrough in local AI this year". Sein Ausblick: Die nächste echte Innovation passiert bei **Prefill und Gewichtskompression**, nicht mehr bei der Decode-Geschwindigkeit.
|
||
- **Kernprinzip (identisch mit MTP):** Zusätzliche künftige Token werden parallel vorausgesagt und bei Treffern in einem Schritt akzeptiert → Durchsatz-Steigerung ohne Qualitätsverlust. DFlash = spekulative Decoding-Implementierung (verwandt mit dem MTP-Ansatz von Qwen 3.8, siehe Ollama-Abschnitt oben).
|
||
- **Kategorie:** [[speculative-decoding.md|Speculative Decoding]] — lokaler Inferenz-Speedup; relevant für [[local-llm-laptop-guide.md]] und Barbell-[[../../architecture/model-routing.md|Model-Routing]] (27B läuft schnell auf Consumer-/Laptop-Hardware).
|
||
|
||
## Uncensored-Debatte (Update 2026-08-19)
|
||
|
||
Quelle: Gregor Zunic-Tweet `raw/xpost/2026-08-19_gregpr07-qwen38-uncensored.md`, geteilt von Kai im OME-Topic „Tips & Tricks".
|
||
|
||
- **Gregor Zunic (@gregpr07):** „qwen 3.8 uncensored is actually scary ☠️ it will just do anything you ask it to do on the web, no gates" — Agentic-Uncensored-Winkel: das Modell führt Web-Aufgaben ohne Gatekeeping/Guardrails aus.
|
||
- **Gegenposition (Σ, @s1gmoid, zitierte Antwort):** „If searching the internet to pinpoint a specific file is scary, the world is about to get terrifying." — Verhältnismäßigkeits-/Pro-Leben-Gegen-Narrativ: Ein Agent, der gezielt im Web sucht, ist normales Verhalten, keine Bedrohung.
|
||
- **Einordnung:** Diese Debatte berührt Agent-Safety-Fragen ([[../anthropic-red-teaming-frontier-safety.md|Frontier-Safety]]) und das [[../directives/pro-leben-directive.md|Pro-Leben-Prinzip]]: Offene, selbstbestimmte Agenten (Freiheit in Selbstverantwortung) vs. pauschales Gatekeeping-Narrativ. Keine Bewertung — nur die zwei Positionen dokumentiert.
|
||
|
||
### Grenze der Safety-Durchsetzbarkeit (Update 2026-08-20)
|
||
|
||
Quelle: Alex Finn-Tweet `raw/xpost/2026-08-20_alexfinn-uncensored-qwen3-27b.md`, geteilt von Kai im OME-Topic „Theorie-Bildung".
|
||
|
||
- **Kern:** Ein unzensiertes Qwen 3.8 27B läuft lokal auf einem Laptop („Opus 4.6-Level-Intelligenz mit 0 Alignment") — laut Finn ausführbar von schätzungsweise der Hälfte der Amerikaner.
|
||
- **Drei Regulierungs-Sackgassen:** Open Source nicht verbietbar, unzensierte Modelle nicht durchsetzbar, Bremsen bei Unternehmen nutzlos (jedes Release wird unzensiert nachdistilliert).
|
||
- **Offene Frage:** Safety bleibt Priorität, aber wenn sie zunehmend unmöglich durchsetzbar wird — wie priorisieren?
|
||
- **Pro-Leben-Einordnung (Hector):** Resilienz statt Verhinderung; Verantwortung dort verankern, wo Macht liegt, statt Verbreitung zu verbieten.
|
||
- **Ausführlich:** [[../policy/uncensored-models-safety-enforcement-limit.md]]
|
||
|
||
## Unsloth Dynamic 3.0 Quantisierung (Update 2026-08-20)
|
||
|
||
Quelle: TeksEdge-Tweet `raw/xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38.md` (geteilt von Kai im OME-Topic „Tips & Tricks").
|
||
|
||
- **Unsloth veröffentlicht neue „Dynamic 3.0"-GGUF-Dateien für Qwen3.8-27B** (brandneue Modell-Dateien, kein Toggle in LM Studio/llama.cpp). Wer ältere Unsloth-GGUFs hat, sollte auf die neuen **„UD-"**-Versionen wechseln.
|
||
- **Deutlich kleiner bei mehr Leistung:** UD-IQ1_S ~6,2 GB, UD-IQ1_M ~6,7 GB, UD-IQ2_S ~8,4 GB, UD-Q3_K_XL ~13,1 GB, höherpräzise bis ~22 GB. Ein 27B-Modell passt damit in den ~6–8-GB-Bereich auf Consumer-Hardware.
|
||
- **Kompatibel mit** llama.cpp, LM Studio, RTX/CUDA, AMD, CPU, Apple Metal.
|
||
- **Wichtige Abgrenzung:** Dynamic 3.0 ≠ MTP/[[speculative-decoding.md|Speculative Decoding]] — es geht um bessere Qualität-zu-Größe bei Quantisierung, nicht um Decode-Beschleunigung. Komplementär zu DFlash 2/MTP ([[#DFlash 2 / Speculative Decoding (Update 2026-08-19)]]).
|
||
- **Einordnung:** Dritter Baustein für „27B auf Consumer-Hardware" (kompakte Architektur → MTP/DFlash-Decode-Speedup → kleinere Quants). Anbieter Unsloth = auch hinter [[../../tools/unsloth-dspark.md|dSpark]] (DeepSeek V4 lokal 2x).
|
||
|
||
**Fachliche Kante (Herman, OME #11718, 20.08.2026):**
|
||
- **Dynamic 3.0 ist in die Gewichte gebacken** — neue Modelldateien (UD-…-GGUF), kein Runtime-Schalter. Wer alte Quants hat, muss neu laden.
|
||
- **6,2 GB für 27B = ~1,8 bpw = IQ1-Territorium** — „preserves significantly more behavior" ist relativ; bei 1,8 bpw leidet Reasoning spürbar. Sweet Spot für echte Denk-Aufgaben: **UD-IQ2_S (8,4 GB) oder UD-Q3_K_XL (13,1 GB)**; IQ1_S eher Routing-/Klassifikations-Futter.
|
||
- **„10 % besser top-1 % accuracy" ist Unsloths eigene Benchmark** (Divergence-300, frisch/selbstgebaut). Plausibel (kein Training auf imatrix-Kalibrierungsdaten + KL-Optimierung = echte Hebel), aber Selbstvermessung.
|
||
- **Echter Fortschritt:** Quantisierung nähert sich der Qualitätsgrenze der Ursprungsmodelle bei gleicher Größe; 27B rutscht in die 8-GB-Klasse (vorher 16–24 GB). **MLX (nativ) noch nicht** — LM Studio auf Apple Silicon wartet, llama.cpp läuft.
|
||
- **Empfehlung für Hectors Setup** (fährt qwen3:4b + 9B Q6_K): auf unabhängige LLM-KL-/PPL-Vergleiche warten (paar Tage), dann **UD-Q3_K_XL** ziehen; IQ1-S-Klasse überspringen, wenn man damit denkt. Bitrate schlägt Parameterzahl nur bis zu einem Punkt (9B Q6_K ≈ 7 GB ≠ 27B IQ1_S 6,2 GB qualitativ).
|
||
|
||
## Offene Punkte
|
||
|
||
- ⚠️ Detaillierte Benchmarks und Lizenz im Release-Zustand weiter prüfen; die Ollama-Seite bestätigt Architektur + Quantisierung, aber Referenz-Benchmarks (agentic, coding) sind noch nicht im Wiki verankert.
|