- raw/youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md (neu) - wiki/concepts/llm/qwen3.8-27b-alibaba.md (Update: Ollama-Verfügbarkeit + MTP) - wiki/people/julian-goldie-seo.md (neu) - wiki/index.md (97. Update) - wiki/log.md (Eintrag)
3.9 KiB
3.9 KiB
| created | updated | sources | tags | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-08-14 | 2026-08-18 |
|
|
Qwen3.8-27B (Alibaba) — Compact Frontier, "Intelligence Density"
Quelle: HuggingFace-Release-Seite https://huggingface.co/Qwen/Qwen3.8-27B (Stand 2026-08-14, Countdown endet 14.08.2026). Geteilt von @PWeber (Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic.
Kernidee
Alibaba veröffentlicht ein kompaktes 27B-Modell der Qwen3.8-Generation mit dem Fokus auf "unmatched intelligence density" (Leistung pro Parameter statt Rohe-Skala). Das Release lief als Countdown bis 14. August 2026 — 4.928 Nutzer warteten zum Abrufzeitpunkt.
Einordnung in die Qwen-Familie
| Modell | Parameter | Status | Quelle |
|---|---|---|---|
| Qwen 3.8 | 2.4T (MoE) | angekündigt 19.07.2026 | ../../tools/qwen-3.8.md |
| Qwen3.8-27B | 27B | Release 14.08.2026 | diese Seite |
| Qwen3.6-27B | 27B | Review 07.08.2026 (Fahd Mirza, Fable-Fusion) | raw/youtube/2026-08-07_fahd-mirza-qwen36-27b-fable-fusion-711.md |
Einordnung
- "Intelligence Density"-Ansatz: 27B ist winzig gegenüber dem 2.4T-MoE von Qwen 3.8 — die Positionierung ist bewusst "viel Leistung pro Parameter" (Small-But-Mighty), nicht Skala
- "Renewal of the beloved Qwen model" — Fortsetzung einer beliebten Qwen-Linie
- Chinesische Open-Weight-Welle: Release am selben Tag wie das GLM-5.3-Review (glm-5.3-z-ai.md) — rasanter chinesischer Release-Zyklus (../chinese-ai-wave-july-2026.md)
- Lokal-relevant: Ein 27B-Modell läuft deutlich leichter auf Consumer-/Laptop-Hardware als ein 2.4T-MoE (../hardware/lokale-ki-coding.md, local-llm-laptop-guide.md) — falls Frontier-nahe Qualität, ein Kandidat für lokale Inferenz
Relevanz für Hectors Stack
- Ollama-Kompatibilität: 27B ist typischerweise gut in Ollama lauffähig — Qwen3.8-27B könnte die lokale Open-Weight-Option im ../../architecture/model-routing.md ergänzen
- Intelligence-Density-Kategorie: Vergleichbar mit dem Trend zu kompakten, hochoptimierten Modellen — spannend für Barbell-Routing (Tier 0/1)
Ollama-Verfügbarkeit (Update 2026-08-18)
Quelle: Video „Qwen 3.8 27B is NOW on Ollama… This is CRAZY!" von Julian Goldie SEO (geteilt von Kai im OME-Topic „Tips & Tricks"). Rohdaten: raw/youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md.
- Qwen 3.8 27B läuft jetzt lokal über Ollama — Start via
ollama run qwen3.8:27b. Damit löst sich die frühere „Open Point"-Unsicherheit (Konkret-Specs + lokale Lauffähigkeit) teilweise auf. - Dichte 27,8B-Architektur (nicht MoE): Hybrid-Attention (linear + full attention) für lange Kontexte und schnelle Inferenz.
- Standard-Build: 18 GB Q4_K_M, für ≥24 GB VRAM ausgelegt, CPU-Offload bei weniger VRAM.
- Kontext: nativ 262.144 Token, über YaRN-Scaling bis ~1M Token erweiterbar.
- Multimodal: native Bild- und Video-Understanding-Unterstützung.
- MTP (Multi-Token Prediction): Mehrere künftige Token werden parallel vorausgesagt und verifiziert — bei Treffern mehrere Token in einem Schritt akzeptiert → deutliche Inferenz-Beschleunigung ohne Qualitätsverlust. Bei Qwen 3.6 27B ~1.71× Durchsatz-Speedup demonstriert. In Ollama als MTP-markierte Tags verfügbar (Spezifikations-Kopf
--spec-type draft-mtp). - Lokal-relevanz bestätigt: passt zu local-llm-laptop-guide.md und dem Barbell-../../architecture/model-routing.md-Gedanken (kompaktes, hochoptimiertes Modell als Tier-0/1-Option).
Offene Punkte
- ⚠️ Detaillierte Benchmarks und Lizenz im Release-Zustand weiter prüfen; die Ollama-Seite bestätigt Architektur + Quantisierung, aber Referenz-Benchmarks (agentic, coding) sind noch nicht im Wiki verankert.