- raw/xpost/2026-09-10_deepseek-v41-flash-official-release.md (neu) - raw/other/2026-09-10_deepseek-v41-flash-official-announcement.md (neu) - wiki/concepts/llm/deepseek-v4.1-flash.md (neu) - wiki/concepts/llm/deepseek-v4-pro-ga-harness-open-source.md (V4.1-Flash-Nachtrag + Einordnung) - wiki/people/aicodeking.md (Review durch offizielles Release bestätigt) - wiki/index.md (199. Update), wiki/log.md
3.7 KiB
3.7 KiB
| created | updated | sources | tags | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-09-10 | 2026-09-10 |
|
|
DeepSeek-V4.1-Flash
Quelle: Offizielle Ankündigung von @deepseek_ai (X-Post, 10.09.2026, https://x.com/deepseek_ai/status/2097930608790167907) + offizielle DeepSeek-API-Docs (https://api-docs.deepseek.com/news/news260910). Primärquelle, offiziell.
Kernidee
DeepSeek-V4.1-Flash ist das kleinste Modell einer neuen Architektur-Familie von DeepSeek, mit nativem visuellen Verständnis (multimodal, ohne separate Vision-Adapter). Design-Ziele: höhere Capability, schnellere Inferenz, höherer Durchsatz, Skalierung auf größere Modelle. Release: 10.09.2026.
Architektur
- 552B-Parameter-MoE (Mixture-of-Experts).
- Neue Causal-Encoder–Decoder-Architektur (CED), asymmetrisch: nur 8B aktive Parameter für Input, 16B für Output.
- Neue Pre-Training-Methoden + größer skaliertes RL-Post-Training → Benchmark-Ergebnisse vor Flaggschiff-Modellen, inkl. DeepSeek-V4-Pro (deepseek-v4-pro-ga-harness-open-source.md).
- KV-Cache: nur 1/4 des HBM und 1/8 des SSD-Speichers gegenüber Vorgängergeneration — senkt Cache-Hit-Kosten (großer Anteil der Agent-Kosten).
API & Verfügbarkeit
- Live auf der DeepSeek-API mit nativem Multimodal-Support — Modellname:
deepseek-flash. - V4-Flash & V4-Flash-Vision-Exp retired;
deepseek-v4-flash/deepseek-v4-flash-vision-exprouten temporär auf V4.1-Flash. - V4-Pro wird ausphasen: ab 04:00 UTC, 14.09.2026 routen alle
deepseek-v4-pro-Requests auf V4.1-Flash zu V4.1-Flash-Raten — bis V4.1-Pro launcht. - Pricing: Peak/Off-Peak, Off-Peak = 50 % der Peak-Raten; neue Preise ab 04:00 UTC, 10.09.2026.
- Offizielle Partner: WorkBuddy (inkl. CodeBuddy) und OpenCode unterstützen V4.1-Flash vollständig.
Open Source
- Modell (Hugging Face): https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
- Paper (Tech Report): https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
- Zusammenarbeit mit der Open-Source-Community für Inference-Support; großskalige Deployments (2.000 GPUs + Storage-Cluster) ansprechbar.
Einordnung
- Neue Modell-Version gegenüber dem V4-Flash im aktiven Stack (../../tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md).
- AICodeKing-Review (10.09.2026, ⚠️ Metadata-only): „Deepseek V4.1 Flash (Fully Tested): 200 TPS & Beats Astra!? (+New Architecture Overview)" — https://www.youtube.com/watch?v=lpC5X6o3VJE (../../people/aicodeking.md). Titel-Claims (200 TPS, schlägt Astra) nicht unabhängig verifiziert; die offizielle Ankündigung bestätigt die neue Architektur-Familie.
- Chinesische Open-Weight-Welle: DeepSeek liefert im Wochenrhythmus (../chinese-ai-wave-july-2026.md); V4.1-Flash setzt die Open-Weight-Strategie fort (open-weights-economics.md).
- Relevanz für Hectors Stack: DeepSeek-Modelle im Setup (
ollama/deepseek-v4-pro:cloud,ollama/deepseek-v4-flash:cloudals Fallback) — V4.1-Flash könnte den V4-Flash-Fallback ablösen (../../tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md).
Offene Punkte
- ⚠️ Konkrete Benchmark-Zahlen (GPQA, Codeforces, Terminal-Bench, Vision-Benchmarks) laut Web-Suche berichtet, aber nicht aus der offiziellen Ankündigung selbst extrahiert — bei Gelegenheit am Tech-Report (Hugging Face) verifizieren.
- ⚠️ AICodeKing-Review-Claims (200 TPS, schlägt Astra) nicht unabhängig verifiziert.