53 lines
4.4 KiB
Markdown
53 lines
4.4 KiB
Markdown
---
|
||
created: 2026-08-26
|
||
updated: 2026-09-22
|
||
sources:
|
||
- other/2026-08-26_qwen38-flash-next-qwen4-preview.md
|
||
- blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md
|
||
tags: [qwen, alibaba, moe, open-weights, qwen4, local-ai, preview, mlx, m5-ultra]
|
||
---
|
||
|
||
# Qwen 3.8-Flash-Next — Vorschau auf Qwen 4
|
||
|
||
## Faktenstand (Ankündigung, Stand 26.08.2026)
|
||
|
||
| Feld | Wert |
|
||
|------|------|
|
||
| Modell | Qwen 3.8-Flash-Next |
|
||
| Status | Ankündigung — Release „noch in dieser Woche" (laut Page vom 25./26.08.), noch nicht veröffentlicht bei Abruf |
|
||
| Architektur | Multimodales **Mixture-of-Experts** |
|
||
| Parameter | **125B gesamt, ~6B aktiv pro Token** (+51B N-Gramm-Embedding-Parameter) ⚠️ unverifiziert |
|
||
| Einordnung durch Qwen-Team | **Vorschau auf die Qwen-4-Architektur**, ausdrücklich kein fertiges Produkt — Community soll sich auf die volle Qwen-4-Familie vorbereiten |
|
||
| Claim | Near-Frontier-Performance zu einem Bruchteil der Compute-Kosten; laut NVIDIA-Forums-Post vergleichbar mit **Qwen 3.7-Plus bei ~1/9 der Trainingskosten**, Stärke **Coding** |
|
||
| Benchmarks | ⚠️ Keine publiziert; Parameterzahlen nicht unabhängig verifiziert |
|
||
|
||
## Finanzierungs-Kontext
|
||
|
||
Die Ankündigung fällt in Alibabas größte Kapitalbeschaffung für KI: eine **10,2 Mrd USD Aktienplatzierung** (710 Mio neue Aktien à HK$112,70, 8,4 %-Abschlag, ~3× überzeichnet mit 28 Mrd USD Nachfrage) — die größte primäre Folgeemission eines Hongkong-gelisteten Unternehmens überhaupt. 100 % der Mittel sollen in „full-stack AI capabilities" inkl. Infrastruktur fließen. Aktie fiel auf Verwässerungssorgen deutlich.
|
||
|
||
## Einordnung
|
||
|
||
- **Sparse-MoE in Consumer-Nähe:** 125B/6B-aktiv wäre lokal relevant, sofern GGUFs/Quants folgen — aktivierungsseitig in der Klasse der lokal diskutierten MoE-Laufzeitziele (vgl. [[../../concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md|M5 Ultra Unified Memory]] und DGX-Spark-Klasse). Die N-Gramm-Embedding-Parameter deuten auf ein MTP-/Speculative-Decoding-freundliches Design (vgl. [[speculative-decoding.md]], DFlash 2).
|
||
- **Reihe in der Qwen3.8-Familie:** Flaggschiff Qwen 3.8-Max (2,4T MoE, 03.08.) → Dense [[qwen3.8-27b-alibaba.md]] (Apache 2.0) → jetzt Flash-Next als Qwen-4-Vorschau. Chinesische Labs (Alibaba, DeepSeek) halten das Open-Weight-Tempo; Perplexity-Pages berichten zudem >3 Mrd Qwen-Downloads und eine geplante Revenue-Sharing-Pflicht für große kommerzielle Nutzer der Max-Open-Weights.
|
||
- **Vorsicht:** Alle Kernzahlen stammen aus zweiter Hand (NVIDIA-Developer-Forum + Presse); das Qwen-Team selbst hat keine Benchmarks freigegeben. Glaubwürdigkeitstest wie immer am Release Day: HF-Model-Karte, Config.json, erste unabhängige Quants/Benchmarks.
|
||
- Geteilt von Kai (@PWeber) in OME Topic "News & Infos" (#12773).
|
||
|
||
## Unabhängiger Praxistest (MacStories, 2026-09-21)
|
||
|
||
Erster dokumentierter **Praxis-Einsatz** des Modells: [[../../people/federico-viticci.md|Federico Viticci]] ([[../../institutions/macstories.md|MacStories]]) betreibt Flash-Next auf einem **M5 Ultra Mac Studio (256 GB)** und hat es zum **Standardmodell** in beiden von ihm primär genutzten Assistenten gemacht — Open Minis (iOS) und Hermes Agent. Gemessene Werte auf dieser Hardware:
|
||
|
||
| Metrik | Wert |
|
||
|--------|------|
|
||
| Kurze Prompts | **>100 tok/s** |
|
||
| 64K–256K Kontext | **60–85 tok/s** |
|
||
| Quantisierung | 5-Bit vollständig im RAM („Sweet Spot"); 6-/8-Bit mit SSD-Offloading der N-Gramm-Tabellen |
|
||
| Parallelität | bis zu **3 gleichzeitige Flash-Next-Sessions** mit Subagenten (oMLX, 256 GB) |
|
||
|
||
Wichtig für die Einordnung: Der Test belastet genau die Punkte, die hier unter „Vorsicht" offen waren — **agentische Last** (Harness-Kontext, Tool-Calls, Subagenten, wachsende Threads) statt Chat-Benchmarks. Viticci nutzt das Modell auch in der Codex-App als lokales Modell unter einem GPT-Orchestrator. Details und vollständige Messreihe: [[../hardware/apple-m6-m5-ultra-mac-mini-studio-update.md|M5 Ultra Benchmarks]]. ⚠️ Einzelsetup (n=1), kein unabhängiges Benchmark-Suite-Ergebnis.
|
||
|
||
## Quellen
|
||
|
||
- Perplexity-Page (Aggregation): https://www.perplexity.ai/page/75dfdb0f-3b9c-4158-874a-84587a567c76
|
||
- Yahoo Tech: https://tech.yahoo.com/ai/gemini/articles/alibaba-release-qwen-3-8-211604965.html
|
||
- NVIDIA Developer Forums: https://forums.developer.nvidia.com/t/qwen3-8-flash-next/381228
|
||
- Reuters: https://www.reuters.com/business/retail-consumer/alibaba-set-open-down-8-hong-kong-after-102-billion-share-placement-plan-2026-08-24/
|