knowledge-base/wiki/concepts/llm/qwen3.8-27b-alibaba.md
Hector f0d95da1cf ingest(youtube): qwen-3.8-27b-ollama-julian-goldie
- raw/youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md (neu)
- wiki/concepts/llm/qwen3.8-27b-alibaba.md (Update: Ollama-Verfügbarkeit + MTP)
- wiki/people/julian-goldie-seo.md (neu)
- wiki/index.md (97. Update)
- wiki/log.md (Eintrag)
2026-08-18 18:37:52 +02:00

50 lines
3.9 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-08-14
updated: 2026-08-18
sources: [other/2026-08-14_qwen3.8-27b-huggingface-release.md, youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md]
tags: [concept, qwen, qwen3.8, alibaba, 27b, open-weights, chinese-ai, moe, intelligence-density, huggingface, ollama, mtp, local-llm]
---
# Qwen3.8-27B (Alibaba) — Compact Frontier, "Intelligence Density"
> **Quelle:** HuggingFace-Release-Seite https://huggingface.co/Qwen/Qwen3.8-27B (Stand 2026-08-14, Countdown endet 14.08.2026). Geteilt von @PWeber (Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic.
## Kernidee
**Alibaba veröffentlicht ein kompaktes 27B-Modell der Qwen3.8-Generation mit dem Fokus auf "unmatched intelligence density"** (Leistung pro Parameter statt Rohe-Skala). Das Release lief als Countdown bis **14. August 2026** — 4.928 Nutzer warteten zum Abrufzeitpunkt.
## Einordnung in die Qwen-Familie
| Modell | Parameter | Status | Quelle |
|---|---|---|---|
| Qwen 3.8 | **2.4T (MoE)** | angekündigt 19.07.2026 | [[../../tools/qwen-3.8.md]] |
| **Qwen3.8-27B** | **27B** | Release 14.08.2026 | diese Seite |
| Qwen3.6-27B | 27B | Review 07.08.2026 (Fahd Mirza, Fable-Fusion) | `raw/youtube/2026-08-07_fahd-mirza-qwen36-27b-fable-fusion-711.md` |
## Einordnung
- **"Intelligence Density"-Ansatz:** 27B ist winzig gegenüber dem 2.4T-MoE von Qwen 3.8 — die Positionierung ist bewusst "viel Leistung pro Parameter" (Small-But-Mighty), nicht Skala
- **"Renewal of the beloved Qwen model"** — Fortsetzung einer beliebten Qwen-Linie
- **Chinesische Open-Weight-Welle:** Release am selben Tag wie das GLM-5.3-Review ([[glm-5.3-z-ai.md]]) — rasanter chinesischer Release-Zyklus ([[../chinese-ai-wave-july-2026.md]])
- **Lokal-relevant:** Ein 27B-Modell läuft deutlich leichter auf Consumer-/Laptop-Hardware als ein 2.4T-MoE ([[../hardware/lokale-ki-coding.md]], [[local-llm-laptop-guide.md]]) — falls Frontier-nahe Qualität, ein Kandidat für lokale Inferenz
## Relevanz für Hectors Stack
- **Ollama-Kompatibilität:** 27B ist typischerweise gut in Ollama lauffähig — Qwen3.8-27B könnte die lokale Open-Weight-Option im [[../../architecture/model-routing.md|Model-Routing]] ergänzen
- **Intelligence-Density-Kategorie:** Vergleichbar mit dem Trend zu kompakten, hochoptimierten Modellen — spannend für Barbell-Routing (Tier 0/1)
## Ollama-Verfügbarkeit (Update 2026-08-18)
Quelle: Video „Qwen 3.8 27B is NOW on Ollama… This is CRAZY!" von Julian Goldie SEO (geteilt von Kai im OME-Topic „Tips & Tricks"). Rohdaten: `raw/youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md`.
- **Qwen 3.8 27B läuft jetzt lokal über Ollama** — Start via `ollama run qwen3.8:27b`. Damit löst sich die frühere „Open Point"-Unsicherheit (Konkret-Specs + lokale Lauffähigkeit) teilweise auf.
- **Dichte 27,8B-Architektur** (nicht MoE): Hybrid-Attention (linear + full attention) für lange Kontexte und schnelle Inferenz.
- **Standard-Build:** 18 GB Q4_K_M, für ≥24 GB VRAM ausgelegt, CPU-Offload bei weniger VRAM.
- **Kontext:** nativ 262.144 Token, über YaRN-Scaling bis ~1M Token erweiterbar.
- **Multimodal:** native Bild- und Video-Understanding-Unterstützung.
- **MTP (Multi-Token Prediction):** Mehrere künftige Token werden parallel vorausgesagt und verifiziert — bei Treffern mehrere Token in einem Schritt akzeptiert → deutliche Inferenz-Beschleunigung ohne Qualitätsverlust. Bei Qwen 3.6 27B ~1.71× Durchsatz-Speedup demonstriert. In Ollama als **MTP-markierte Tags** verfügbar (Spezifikations-Kopf `--spec-type draft-mtp`).
- **Lokal-relevanz bestätigt:** passt zu [[local-llm-laptop-guide.md]] und dem Barbell-[[../../architecture/model-routing.md|Model-Routing]]-Gedanken (kompaktes, hochoptimiertes Modell als Tier-0/1-Option).
## Offene Punkte
- ⚠️ Detaillierte Benchmarks und Lizenz im Release-Zustand weiter prüfen; die Ollama-Seite bestätigt Architektur + Quantisierung, aber Referenz-Benchmarks (agentic, coding) sind noch nicht im Wiki verankert.