4.5 KiB
| created | updated | sources | tags | ||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-09-10 | 2026-09-10 |
|
|
DeepSeek-V4.1-Flash
Quelle: Offizielle Ankündigung von @deepseek_ai (X-Post, 10.09.2026, https://x.com/deepseek_ai/status/2097930608790167907) + offizielle DeepSeek-API-Docs (https://api-docs.deepseek.com/news/news260910). Primärquelle, offiziell.
Kernidee
DeepSeek-V4.1-Flash ist das kleinste Modell einer neuen Architektur-Familie von DeepSeek, mit nativem visuellen Verständnis (multimodal, ohne separate Vision-Adapter). Design-Ziele: höhere Capability, schnellere Inferenz, höherer Durchsatz, Skalierung auf größere Modelle. Release: 10.09.2026.
Architektur
- 552B-Parameter-MoE (Mixture-of-Experts).
- Neue Causal-Encoder–Decoder-Architektur (CED), asymmetrisch: nur 8B aktive Parameter für Input, 16B für Output.
- Neue Pre-Training-Methoden + größer skaliertes RL-Post-Training → Benchmark-Ergebnisse vor Flaggschiff-Modellen, inkl. DeepSeek-V4-Pro (deepseek-v4-pro-ga-harness-open-source.md).
- KV-Cache: nur 1/4 des HBM und 1/8 des SSD-Speichers gegenüber Vorgängergeneration — senkt Cache-Hit-Kosten (großer Anteil der Agent-Kosten).
API & Verfügbarkeit
- Live auf der DeepSeek-API mit nativem Multimodal-Support — Modellname:
deepseek-flash. - V4-Flash & V4-Flash-Vision-Exp retired;
deepseek-v4-flash/deepseek-v4-flash-vision-exprouten temporär auf V4.1-Flash. - V4-Pro wird ausphasen: ab 04:00 UTC, 14.09.2026 routen alle
deepseek-v4-pro-Requests auf V4.1-Flash zu V4.1-Flash-Raten — bis V4.1-Pro launcht. - Pricing: Peak/Off-Peak, Off-Peak = 50 % der Peak-Raten; neue Preise ab 04:00 UTC, 10.09.2026.
- Offizielle Partner: WorkBuddy (inkl. CodeBuddy) und OpenCode unterstützen V4.1-Flash vollständig.
Open Source
- Modell (Hugging Face): https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
- Paper (Tech Report): https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
- Zusammenarbeit mit der Open-Source-Community für Inference-Support; großskalige Deployments (2.000 GPUs + Storage-Cluster) ansprechbar.
Einordnung
- Neue Modell-Version gegenüber dem V4-Flash im aktiven Stack (../../tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md).
- AICodeKing-Review (10.09.2026, ⚠️ Metadata-only): „Deepseek V4.1 Flash (Fully Tested): 200 TPS & Beats Astra!? (+New Architecture Overview)" — https://www.youtube.com/watch?v=lpC5X6o3VJE (../../people/aicodeking.md). Titel-Claims (200 TPS, schlägt Astra) nicht unabhängig verifiziert; die offizielle Ankündigung bestätigt die neue Architektur-Familie.
- Chinesische Open-Weight-Welle: DeepSeek liefert im Wochenrhythmus (../chinese-ai-wave-july-2026.md); V4.1-Flash setzt die Open-Weight-Strategie fort (open-weights-economics.md).
- Relevanz für Hectors Stack: DeepSeek-Modelle im Setup (
ollama/deepseek-v4-pro:cloud,ollama/deepseek-v4-flash:cloudals Fallback) — V4.1-Flash könnte den V4-Flash-Fallback ablösen (../../tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md).
Offizielle Benchmark-Zahlen (Changelog, 10.09.2026)
Quelle: Offizielle DeepSeek-API-Changelog-Seite (https://api-docs.deepseek.com/updates/),
raw/other/2026-09-10_deepseek-api-updates-changelog.md. Damit sind die zuvor offenen Benchmark-Zahlen aus der offiziellen Quelle belegt.
| Benchmark | Wert |
|---|---|
| GPQA Diamond | 90.9 |
| HLE | 36.8 (39.1*) |
| Codeforces (Rating) | 3471 |
| MathArena Apex | 65.6 |
| Terminal-Bench 2.1 | 90.6 |
| Terminal-Bench 3.0 | 30.0 |
| Terminal-Bench 4.0 | 31.2 |
| DeepSWE v1.1 | 74.2 |
| ProgramBench | 20.3 |
| NL2Repo-Bench | 65.4 |
| CyberGym | 88.1 |
| SEC-Bench Pro | 62.8 |
| ExploitGym | 15.3 |
| HLE (w/tools) | 63.9 |
| Automation-Bench | 54.8 |
| Agents' Last Exam | 31.8 |
| Chartography (w/tools) | 78.9 |
| BabyVision (w/tools) | 89.6 |
| ZeroBench-main (w/tools) | 49.0 |
* HLE nur auf dem reinen Text-Subset des HLE-Benchmark-Sets getestet.
Offene Punkte
- ⚠️ AICodeKing-Review-Claims (200 TPS, schlägt Astra) nicht unabhängig verifiziert.