knowledge-base/wiki/concepts/llm/qwen3.8-27b-alibaba.md

51 lines
3.9 KiB
Markdown
Raw Normal View History

---
created: 2026-08-14
updated: 2026-08-18
sources: [other/2026-08-14_qwen3.8-27b-huggingface-release.md, youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md]
tags: [concept, qwen, qwen3.8, alibaba, 27b, open-weights, chinese-ai, moe, intelligence-density, huggingface, ollama, mtp, local-llm]
---
# Qwen3.8-27B (Alibaba) — Compact Frontier, "Intelligence Density"
> **Quelle:** HuggingFace-Release-Seite https://huggingface.co/Qwen/Qwen3.8-27B (Stand 2026-08-14, Countdown endet 14.08.2026). Geteilt von @PWeber (Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic.
## Kernidee
**Alibaba veröffentlicht ein kompaktes 27B-Modell der Qwen3.8-Generation mit dem Fokus auf "unmatched intelligence density"** (Leistung pro Parameter statt Rohe-Skala). Das Release lief als Countdown bis **14. August 2026** — 4.928 Nutzer warteten zum Abrufzeitpunkt.
## Einordnung in die Qwen-Familie
| Modell | Parameter | Status | Quelle |
|---|---|---|---|
| Qwen 3.8 | **2.4T (MoE)** | angekündigt 19.07.2026 | [[../../tools/qwen-3.8.md]] |
| **Qwen3.8-27B** | **27B** | Release 14.08.2026 | diese Seite |
| Qwen3.6-27B | 27B | Review 07.08.2026 (Fahd Mirza, Fable-Fusion) | `raw/youtube/2026-08-07_fahd-mirza-qwen36-27b-fable-fusion-711.md` |
## Einordnung
- **"Intelligence Density"-Ansatz:** 27B ist winzig gegenüber dem 2.4T-MoE von Qwen 3.8 — die Positionierung ist bewusst "viel Leistung pro Parameter" (Small-But-Mighty), nicht Skala
- **"Renewal of the beloved Qwen model"** — Fortsetzung einer beliebten Qwen-Linie
- **Chinesische Open-Weight-Welle:** Release am selben Tag wie das GLM-5.3-Review ([[glm-5.3-z-ai.md]]) — rasanter chinesischer Release-Zyklus ([[../chinese-ai-wave-july-2026.md]])
- **Lokal-relevant:** Ein 27B-Modell läuft deutlich leichter auf Consumer-/Laptop-Hardware als ein 2.4T-MoE ([[../hardware/lokale-ki-coding.md]], [[local-llm-laptop-guide.md]]) — falls Frontier-nahe Qualität, ein Kandidat für lokale Inferenz
## Relevanz für Hectors Stack
- **Ollama-Kompatibilität:** 27B ist typischerweise gut in Ollama lauffähig — Qwen3.8-27B könnte die lokale Open-Weight-Option im [[../../architecture/model-routing.md|Model-Routing]] ergänzen
- **Intelligence-Density-Kategorie:** Vergleichbar mit dem Trend zu kompakten, hochoptimierten Modellen — spannend für Barbell-Routing (Tier 0/1)
## Ollama-Verfügbarkeit (Update 2026-08-18)
Quelle: Video „Qwen 3.8 27B is NOW on Ollama… This is CRAZY!" von Julian Goldie SEO (geteilt von Kai im OME-Topic „Tips & Tricks"). Rohdaten: `raw/youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md`.
- **Qwen 3.8 27B läuft jetzt lokal über Ollama** — Start via `ollama run qwen3.8:27b`. Damit löst sich die frühere „Open Point"-Unsicherheit (Konkret-Specs + lokale Lauffähigkeit) teilweise auf.
- **Dichte 27,8B-Architektur** (nicht MoE): Hybrid-Attention (linear + full attention) für lange Kontexte und schnelle Inferenz.
- **Standard-Build:** 18 GB Q4_K_M, für ≥24 GB VRAM ausgelegt, CPU-Offload bei weniger VRAM.
- **Kontext:** nativ 262.144 Token, über YaRN-Scaling bis ~1M Token erweiterbar.
- **Multimodal:** native Bild- und Video-Understanding-Unterstützung.
- **MTP (Multi-Token Prediction):** Mehrere künftige Token werden parallel vorausgesagt und verifiziert — bei Treffern mehrere Token in einem Schritt akzeptiert → deutliche Inferenz-Beschleunigung ohne Qualitätsverlust. Bei Qwen 3.6 27B ~1.71× Durchsatz-Speedup demonstriert. In Ollama als **MTP-markierte Tags** verfügbar (Spezifikations-Kopf `--spec-type draft-mtp`).
- **Lokal-relevanz bestätigt:** passt zu [[local-llm-laptop-guide.md]] und dem Barbell-[[../../architecture/model-routing.md|Model-Routing]]-Gedanken (kompaktes, hochoptimiertes Modell als Tier-0/1-Option).
## Offene Punkte
- ⚠️ Detaillierte Benchmarks und Lizenz im Release-Zustand weiter prüfen; die Ollama-Seite bestätigt Architektur + Quantisierung, aber Referenz-Benchmarks (agentic, coding) sind noch nicht im Wiki verankert.