--- created: 2026-09-10 updated: 2026-09-10 sources: [xpost/2026-09-10_deepseek-v41-flash-official-release.md, other/2026-09-10_deepseek-v41-flash-official-announcement.md, youtube/2026-09-10_deepseek-v41-flash-aicodeking.md] tags: [concept, deepseek, deepseek-v4.1-flash, architecture, moe, causal-encoder-decoder, multimodal, visual-understanding, kv-cache, api, open-weights, chinese-ai] --- # DeepSeek-V4.1-Flash > **Quelle:** Offizielle Ankündigung von @deepseek_ai (X-Post, 10.09.2026, https://x.com/deepseek_ai/status/2097930608790167907) + offizielle DeepSeek-API-Docs (https://api-docs.deepseek.com/news/news260910). Primärquelle, offiziell. ## Kernidee **DeepSeek-V4.1-Flash** ist das **kleinste Modell einer neuen Architektur-Familie** von DeepSeek, mit **nativem visuellen Verständnis** (multimodal, ohne separate Vision-Adapter). Design-Ziele: höhere Capability, schnellere Inferenz, höherer Durchsatz, Skalierung auf größere Modelle. Release: 10.09.2026. ## Architektur - **552B-Parameter-MoE** (Mixture-of-Experts). - **Neue Causal-Encoder–Decoder-Architektur (CED), asymmetrisch:** nur **8B aktive Parameter für Input**, **16B für Output**. - Neue Pre-Training-Methoden + größer skaliertes RL-Post-Training → Benchmark-Ergebnisse vor Flaggschiff-Modellen, inkl. **DeepSeek-V4-Pro** ([[deepseek-v4-pro-ga-harness-open-source.md]]). - **KV-Cache:** nur **1/4 des HBM** und **1/8 des SSD-Speichers** gegenüber Vorgängergeneration — senkt Cache-Hit-Kosten (großer Anteil der Agent-Kosten). ## API & Verfügbarkeit - **Live auf der DeepSeek-API mit nativem Multimodal-Support** — Modellname: `deepseek-flash`. - **V4-Flash & V4-Flash-Vision-Exp retired**; `deepseek-v4-flash` / `deepseek-v4-flash-vision-exp` routen temporär auf V4.1-Flash. - **V4-Pro wird ausphasen:** ab 04:00 UTC, 14.09.2026 routen alle `deepseek-v4-pro`-Requests auf V4.1-Flash zu V4.1-Flash-Raten — bis V4.1-Pro launcht. - **Pricing:** Peak/Off-Peak, Off-Peak = 50 % der Peak-Raten; neue Preise ab 04:00 UTC, 10.09.2026. - **Offizielle Partner:** WorkBuddy (inkl. CodeBuddy) und OpenCode unterstützen V4.1-Flash vollständig. ## Open Source - **Modell (Hugging Face):** https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash - **Paper (Tech Report):** https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf - Zusammenarbeit mit der Open-Source-Community für Inference-Support; großskalige Deployments (2.000 GPUs + Storage-Cluster) ansprechbar. ## Einordnung - **Neue Modell-Version** gegenüber dem V4-Flash im aktiven Stack ([[../../tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md]]). - **AICodeKing-Review** (10.09.2026, ⚠️ Metadata-only): „Deepseek V4.1 Flash (Fully Tested): 200 TPS & Beats Astra!? (+New Architecture Overview)" — https://www.youtube.com/watch?v=lpC5X6o3VJE ([[../../people/aicodeking.md|AICodeKing]]). Titel-Claims (200 TPS, schlägt Astra) nicht unabhängig verifiziert; die offizielle Ankündigung bestätigt die neue Architektur-Familie. - **Chinesische Open-Weight-Welle:** DeepSeek liefert im Wochenrhythmus ([[../chinese-ai-wave-july-2026.md]]); V4.1-Flash setzt die Open-Weight-Strategie fort ([[open-weights-economics.md]]). - **Relevanz für Hectors Stack:** DeepSeek-Modelle im Setup (`ollama/deepseek-v4-pro:cloud`, `ollama/deepseek-v4-flash:cloud` als Fallback) — V4.1-Flash könnte den V4-Flash-Fallback ablösen ([[../../tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md]]). ## Offene Punkte - ⚠️ Konkrete Benchmark-Zahlen (GPQA, Codeforces, Terminal-Bench, Vision-Benchmarks) laut Web-Suche berichtet, aber nicht aus der offiziellen Ankündigung selbst extrahiert — bei Gelegenheit am Tech-Report (Hugging Face) verifizieren. - ⚠️ AICodeKing-Review-Claims (200 TPS, schlägt Astra) nicht unabhängig verifiziert.