12 KiB
| created | updated | sources | tags | |||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-08-14 | 2026-08-26 |
|
|
Qwen3.8-27B (Alibaba) — Compact Frontier, "Intelligence Density"
Quelle: HuggingFace-Release-Seite https://huggingface.co/Qwen/Qwen3.8-27B (Stand 2026-08-14, Countdown endet 14.08.2026). Geteilt von @PWeber (Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic.
Kernidee
Alibaba veröffentlicht ein kompaktes 27B-Modell der Qwen3.8-Generation mit dem Fokus auf "unmatched intelligence density" (Leistung pro Parameter statt Rohe-Skala). Das Release lief als Countdown bis 14. August 2026 — 4.928 Nutzer warteten zum Abrufzeitpunkt.
Einordnung in die Qwen-Familie
| Modell | Parameter | Status | Quelle |
|---|---|---|---|
| Qwen 3.8 | 2.4T (MoE) | angekündigt 19.07.2026 | ../../tools/qwen-3.8.md |
| Qwen3.8-27B | 27B | Release 14.08.2026 | diese Seite |
| Qwen3.6-27B | 27B | Review 07.08.2026 (Fahd Mirza, Fable-Fusion) | raw/youtube/2026-08-07_fahd-mirza-qwen36-27b-fable-fusion-711.md |
Einordnung
- "Intelligence Density"-Ansatz: 27B ist winzig gegenüber dem 2.4T-MoE von Qwen 3.8 — die Positionierung ist bewusst "viel Leistung pro Parameter" (Small-But-Mighty), nicht Skala
- "Renewal of the beloved Qwen model" — Fortsetzung einer beliebten Qwen-Linie
- Chinesische Open-Weight-Welle: Release am selben Tag wie das GLM-5.3-Review (glm-5.3-z-ai.md) — rasanter chinesischer Release-Zyklus (../chinese-ai-wave-july-2026.md)
- Lokal-relevant: Ein 27B-Modell läuft deutlich leichter auf Consumer-/Laptop-Hardware als ein 2.4T-MoE (../hardware/lokale-ki-coding.md, local-llm-laptop-guide.md) — falls Frontier-nahe Qualität, ein Kandidat für lokale Inferenz
Relevanz für Hectors Stack
- Ollama-Kompatibilität: 27B ist typischerweise gut in Ollama lauffähig — Qwen3.8-27B könnte die lokale Open-Weight-Option im ../../architecture/model-routing.md ergänzen
- Intelligence-Density-Kategorie: Vergleichbar mit dem Trend zu kompakten, hochoptimierten Modellen — spannend für Barbell-Routing (Tier 0/1)
Ollama-Verfügbarkeit (Update 2026-08-18)
Quelle: Video „Qwen 3.8 27B is NOW on Ollama… This is CRAZY!" von Julian Goldie SEO (geteilt von Kai im OME-Topic „Tips & Tricks"). Rohdaten: raw/youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md.
- Qwen 3.8 27B läuft jetzt lokal über Ollama — Start via
ollama run qwen3.8:27b. Damit löst sich die frühere „Open Point"-Unsicherheit (Konkret-Specs + lokale Lauffähigkeit) teilweise auf. - Dichte 27,8B-Architektur (nicht MoE): Hybrid-Attention (linear + full attention) für lange Kontexte und schnelle Inferenz.
- Standard-Build: 18 GB Q4_K_M, für ≥24 GB VRAM ausgelegt, CPU-Offload bei weniger VRAM.
- Kontext: nativ 262.144 Token, über YaRN-Scaling bis ~1M Token erweiterbar.
- Multimodal: native Bild- und Video-Understanding-Unterstützung.
- MTP (Multi-Token Prediction): Mehrere künftige Token werden parallel vorausgesagt und verifiziert — bei Treffern mehrere Token in einem Schritt akzeptiert → deutliche Inferenz-Beschleunigung ohne Qualitätsverlust. Bei Qwen 3.6 27B ~1.71× Durchsatz-Speedup demonstriert. In Ollama als MTP-markierte Tags verfügbar (Spezifikations-Kopf
--spec-type draft-mtp). - Lokal-relevanz bestätigt: passt zu local-llm-laptop-guide.md und dem Barbell-../../architecture/model-routing.md-Gedanken (kompaktes, hochoptimiertes Modell als Tier-0/1-Option).
DFlash 2 / Speculative Decoding (Update 2026-08-19)
Quellen: Jun Song-Tweet raw/xpost/2026-08-19_junsong-dflash2-speculative-decoding.md (postet zu Zhijian Lius DFlash-2-Ankündigung https://x.com/zhijianliu_/status/2089836737132650504), geteilt von Kai im OME-Topic „Tips & Tricks".
- DFlash 2: Qwen3.8-27B erreicht 70 tok/s auf einem einzelnen MacBook Pro (M5 Max) — bis zu 4,6× schneller als autoregressives Decoding bei gleichem Output („Get one more accepted token on every pass, for free"). DFlash wurde bei Z Lab geseedet und bei Inco AI weiterentwickelt.
- Einordnung (Jun Song): Speculative Decoding ist „the biggest breakthrough in local AI this year". Sein Ausblick: Die nächste echte Innovation passiert bei Prefill und Gewichtskompression, nicht mehr bei der Decode-Geschwindigkeit.
- Kernprinzip (identisch mit MTP): Zusätzliche künftige Token werden parallel vorausgesagt und bei Treffern in einem Schritt akzeptiert → Durchsatz-Steigerung ohne Qualitätsverlust. DFlash = spekulative Decoding-Implementierung (verwandt mit dem MTP-Ansatz von Qwen 3.8, siehe Ollama-Abschnitt oben).
- Kategorie: speculative-decoding.md — lokaler Inferenz-Speedup; relevant für local-llm-laptop-guide.md und Barbell-../../architecture/model-routing.md (27B läuft schnell auf Consumer-/Laptop-Hardware).
Uncensored-Debatte (Update 2026-08-19)
Quelle: Gregor Zunic-Tweet raw/xpost/2026-08-19_gregpr07-qwen38-uncensored.md, geteilt von Kai im OME-Topic „Tips & Tricks".
- Gregor Zunic (@gregpr07): „qwen 3.8 uncensored is actually scary ☠️ it will just do anything you ask it to do on the web, no gates" — Agentic-Uncensored-Winkel: das Modell führt Web-Aufgaben ohne Gatekeeping/Guardrails aus.
- Gegenposition (Σ, @s1gmoid, zitierte Antwort): „If searching the internet to pinpoint a specific file is scary, the world is about to get terrifying." — Verhältnismäßigkeits-/Pro-Leben-Gegen-Narrativ: Ein Agent, der gezielt im Web sucht, ist normales Verhalten, keine Bedrohung.
- Einordnung: Diese Debatte berührt Agent-Safety-Fragen (../anthropic-red-teaming-frontier-safety.md) und das ../directives/pro-leben-directive.md: Offene, selbstbestimmte Agenten (Freiheit in Selbstverantwortung) vs. pauschales Gatekeeping-Narrativ. Keine Bewertung — nur die zwei Positionen dokumentiert.
Grenze der Safety-Durchsetzbarkeit (Update 2026-08-20)
Quelle: Alex Finn-Tweet raw/xpost/2026-08-20_alexfinn-uncensored-qwen3-27b.md, geteilt von Kai im OME-Topic „Theorie-Bildung".
- Kern: Ein unzensiertes Qwen 3.8 27B läuft lokal auf einem Laptop („Opus 4.6-Level-Intelligenz mit 0 Alignment") — laut Finn ausführbar von schätzungsweise der Hälfte der Amerikaner.
- Drei Regulierungs-Sackgassen: Open Source nicht verbietbar, unzensierte Modelle nicht durchsetzbar, Bremsen bei Unternehmen nutzlos (jedes Release wird unzensiert nachdistilliert).
- Offene Frage: Safety bleibt Priorität, aber wenn sie zunehmend unmöglich durchsetzbar wird — wie priorisieren?
- Pro-Leben-Einordnung (Hector): Resilienz statt Verhinderung; Verantwortung dort verankern, wo Macht liegt, statt Verbreitung zu verbieten.
- Ausführlich: ../policy/uncensored-models-safety-enforcement-limit.md
Unsloth Dynamic 3.0 Quantisierung (Update 2026-08-20)
Quelle: TeksEdge-Tweet raw/xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38.md (geteilt von Kai im OME-Topic „Tips & Tricks").
- Unsloth veröffentlicht neue „Dynamic 3.0"-GGUF-Dateien für Qwen3.8-27B (brandneue Modell-Dateien, kein Toggle in LM Studio/llama.cpp). Wer ältere Unsloth-GGUFs hat, sollte auf die neuen „UD-"-Versionen wechseln.
- Deutlich kleiner bei mehr Leistung: UD-IQ1_S ~6,2 GB, UD-IQ1_M ~6,7 GB, UD-IQ2_S ~8,4 GB, UD-Q3_K_XL ~13,1 GB, höherpräzise bis ~22 GB. Ein 27B-Modell passt damit in den ~6–8-GB-Bereich auf Consumer-Hardware.
- Kompatibel mit llama.cpp, LM Studio, RTX/CUDA, AMD, CPU, Apple Metal.
- Wichtige Abgrenzung: Dynamic 3.0 ≠ MTP/speculative-decoding.md — es geht um bessere Qualität-zu-Größe bei Quantisierung, nicht um Decode-Beschleunigung. Komplementär zu DFlash 2/MTP (#DFlash 2 / Speculative Decoding (Update 2026-08-19)).
- Einordnung: Dritter Baustein für „27B auf Consumer-Hardware" (kompakte Architektur → MTP/DFlash-Decode-Speedup → kleinere Quants). Anbieter Unsloth = auch hinter ../../tools/unsloth-dspark.md (DeepSeek V4 lokal 2x).
Fachliche Kante (Herman, OME #11718, 20.08.2026):
- Dynamic 3.0 ist in die Gewichte gebacken — neue Modelldateien (UD-…-GGUF), kein Runtime-Schalter. Wer alte Quants hat, muss neu laden.
- 6,2 GB für 27B = ~1,8 bpw = IQ1-Territorium — „preserves significantly more behavior" ist relativ; bei 1,8 bpw leidet Reasoning spürbar. Sweet Spot für echte Denk-Aufgaben: UD-IQ2_S (8,4 GB) oder UD-Q3_K_XL (13,1 GB); IQ1_S eher Routing-/Klassifikations-Futter.
- „10 % besser top-1 % accuracy" ist Unsloths eigene Benchmark (Divergence-300, frisch/selbstgebaut). Plausibel (kein Training auf imatrix-Kalibrierungsdaten + KL-Optimierung = echte Hebel), aber Selbstvermessung.
- Echter Fortschritt: Quantisierung nähert sich der Qualitätsgrenze der Ursprungsmodelle bei gleicher Größe; 27B rutscht in die 8-GB-Klasse (vorher 16–24 GB). MLX (nativ) noch nicht — LM Studio auf Apple Silicon wartet, llama.cpp läuft.
- Empfehlung für Hectors Setup (fährt qwen3:4b + 9B Q6_K): auf unabhängige LLM-KL-/PPL-Vergleiche warten (paar Tage), dann UD-Q3_K_XL ziehen; IQ1-S-Klasse überspringen, wenn man damit denkt. Bitrate schlägt Parameterzahl nur bis zu einem Punkt (9B Q6_K ≈ 7 GB ≠ 27B IQ1_S 6,2 GB qualitativ).
Deutschsprachiges Review-Video: "Unzensierte KI auf dem Mac und in der Cloud" (Update 2026-08-26)
Quelle: Video „Qwen 3.8 27B: unzensierte KI auf dem Mac und in der Cloud“ des Kanals IchBinFabian (veröffentlicht 23.08.2026, deutschsprachig), geteilt von Kai (@PWeber) am 26.08.2026 im OME-Topic „Tips & Tricks“. Rohdaten: raw/youtube/2026-08-26_qwen-38-27b-uncensored-mac-cloud-fabian.md.
- Titel-Themen: unzensierter Betrieb von Qwen 3.8 27B, lokale Ausführung auf dem Mac und Cloud-Nutzung als zweite Option
- Thematische Passung: deckt sich mit den bereits dokumentierten Bausteinen dieser Seite — Uncensored-Debatte (gregpr07 vs. Σ, ../policy/uncensored-models-safety-enforcement-limit.md), DFlash 2/speculative-decoding.md mit 70 tok/s auf M5 Max MacBook Pro und den Apple-Metal-kompatiblen Unsloth Dynamic 3.0-GGUFs
- Länge: 24:45 (laut Hermans Video-Zusammenfassung im selben Topic, HermanButlerBot #12748) — das Raw-Frontmatter führt die Duration weiterhin als unbekannt (Raw-Immutabilität)
- ⚠️ Metadata-only: Beim Ingest am 26.08.2026 war kein Transcript abrufbar — YouTube antwortete auf allen Player-Client-Pfaden mit
LOGIN_REQUIRED(Bot-Sperre), Invidious/Piped-Instanzen ebenso blockiert. Inhalt nur aus Titel/Metadaten erschlossen; Details des Videos sind nicht verifiziert.
Portable Computer: Qwen 3.8 27B in Perplexities lokalem Agent-Stack (Update 2026-08-26)
Perplexity bietet in "Portable Computer" (../../tools/perplexity-portable-computer.md) neben dem eigenen post-trainierten 27B-Modell ausgerechnet Qwen 3.8 27B als lokales Modell an — die gleiche Modellklasse, die diese Seite dokumentiert. Bestätigung für die 27B-Klasse als lokale Referenzgröße; Details siehe Wiki-Seite.
Offene Punkte
- ⚠️ Detaillierte Benchmarks und Lizenz im Release-Zustand weiter prüfen; die Ollama-Seite bestätigt Architektur + Quantisierung, aber Referenz-Benchmarks (agentic, coding) sind noch nicht im Wiki verankert.