knowledge-base/wiki/concepts/llm/qwen3.8-flash-next-qwen4-preview.md

53 lines
4.4 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-08-26
updated: 2026-09-22
sources:
- other/2026-08-26_qwen38-flash-next-qwen4-preview.md
- blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md
tags: [qwen, alibaba, moe, open-weights, qwen4, local-ai, preview, mlx, m5-ultra]
---
# Qwen 3.8-Flash-Next — Vorschau auf Qwen 4
## Faktenstand (Ankündigung, Stand 26.08.2026)
| Feld | Wert |
|------|------|
| Modell | Qwen 3.8-Flash-Next |
| Status | Ankündigung — Release „noch in dieser Woche" (laut Page vom 25./26.08.), noch nicht veröffentlicht bei Abruf |
| Architektur | Multimodales **Mixture-of-Experts** |
| Parameter | **125B gesamt, ~6B aktiv pro Token** (+51B N-Gramm-Embedding-Parameter) ⚠️ unverifiziert |
| Einordnung durch Qwen-Team | **Vorschau auf die Qwen-4-Architektur**, ausdrücklich kein fertiges Produkt — Community soll sich auf die volle Qwen-4-Familie vorbereiten |
| Claim | Near-Frontier-Performance zu einem Bruchteil der Compute-Kosten; laut NVIDIA-Forums-Post vergleichbar mit **Qwen 3.7-Plus bei ~1/9 der Trainingskosten**, Stärke **Coding** |
| Benchmarks | ⚠️ Keine publiziert; Parameterzahlen nicht unabhängig verifiziert |
## Finanzierungs-Kontext
Die Ankündigung fällt in Alibabas größte Kapitalbeschaffung für KI: eine **10,2 Mrd USD Aktienplatzierung** (710 Mio neue Aktien à HK$112,70, 8,4 %-Abschlag, ~3× überzeichnet mit 28 Mrd USD Nachfrage) — die größte primäre Folgeemission eines Hongkong-gelisteten Unternehmens überhaupt. 100 % der Mittel sollen in „full-stack AI capabilities" inkl. Infrastruktur fließen. Aktie fiel auf Verwässerungssorgen deutlich.
## Einordnung
- **Sparse-MoE in Consumer-Nähe:** 125B/6B-aktiv wäre lokal relevant, sofern GGUFs/Quants folgen — aktivierungsseitig in der Klasse der lokal diskutierten MoE-Laufzeitziele (vgl. [[../../concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md|M5 Ultra Unified Memory]] und DGX-Spark-Klasse). Die N-Gramm-Embedding-Parameter deuten auf ein MTP-/Speculative-Decoding-freundliches Design (vgl. [[speculative-decoding.md]], DFlash 2).
- **Reihe in der Qwen3.8-Familie:** Flaggschiff Qwen 3.8-Max (2,4T MoE, 03.08.) → Dense [[qwen3.8-27b-alibaba.md]] (Apache 2.0) → jetzt Flash-Next als Qwen-4-Vorschau. Chinesische Labs (Alibaba, DeepSeek) halten das Open-Weight-Tempo; Perplexity-Pages berichten zudem >3 Mrd Qwen-Downloads und eine geplante Revenue-Sharing-Pflicht für große kommerzielle Nutzer der Max-Open-Weights.
- **Vorsicht:** Alle Kernzahlen stammen aus zweiter Hand (NVIDIA-Developer-Forum + Presse); das Qwen-Team selbst hat keine Benchmarks freigegeben. Glaubwürdigkeitstest wie immer am Release Day: HF-Model-Karte, Config.json, erste unabhängige Quants/Benchmarks.
- Geteilt von Kai (@PWeber) in OME Topic "News & Infos" (#12773).
## Unabhängiger Praxistest (MacStories, 2026-09-21)
Erster dokumentierter **Praxis-Einsatz** des Modells: [[../../people/federico-viticci.md|Federico Viticci]] ([[../../institutions/macstories.md|MacStories]]) betreibt Flash-Next auf einem **M5 Ultra Mac Studio (256 GB)** und hat es zum **Standardmodell** in beiden von ihm primär genutzten Assistenten gemacht — Open Minis (iOS) und Hermes Agent. Gemessene Werte auf dieser Hardware:
| Metrik | Wert |
|--------|------|
| Kurze Prompts | **>100 tok/s** |
| 64K256K Kontext | **6085 tok/s** |
| Quantisierung | 5-Bit vollständig im RAM („Sweet Spot"); 6-/8-Bit mit SSD-Offloading der N-Gramm-Tabellen |
| Parallelität | bis zu **3 gleichzeitige Flash-Next-Sessions** mit Subagenten (oMLX, 256 GB) |
Wichtig für die Einordnung: Der Test belastet genau die Punkte, die hier unter „Vorsicht" offen waren — **agentische Last** (Harness-Kontext, Tool-Calls, Subagenten, wachsende Threads) statt Chat-Benchmarks. Viticci nutzt das Modell auch in der Codex-App als lokales Modell unter einem GPT-Orchestrator. Details und vollständige Messreihe: [[../hardware/apple-m6-m5-ultra-mac-mini-studio-update.md|M5 Ultra Benchmarks]]. ⚠️ Einzelsetup (n=1), kein unabhängiges Benchmark-Suite-Ergebnis.
## Quellen
- Perplexity-Page (Aggregation): https://www.perplexity.ai/page/75dfdb0f-3b9c-4158-874a-84587a567c76
- Yahoo Tech: https://tech.yahoo.com/ai/gemini/articles/alibaba-release-qwen-3-8-211604965.html
- NVIDIA Developer Forums: https://forums.developer.nvidia.com/t/qwen3-8-flash-next/381228
- Reuters: https://www.reuters.com/business/retail-consumer/alibaba-set-open-down-8-hong-kong-after-102-billion-share-placement-plan-2026-08-24/