knowledge-base/wiki/concepts/llm/deepseek-v4.1-flash.md
Hector bfacf8050e ingest(raw): DeepSeek-V4.1-Flash offizielles Release (X-Post + API-Docs)
- raw/xpost/2026-09-10_deepseek-v41-flash-official-release.md (neu)
- raw/other/2026-09-10_deepseek-v41-flash-official-announcement.md (neu)
- wiki/concepts/llm/deepseek-v4.1-flash.md (neu)
- wiki/concepts/llm/deepseek-v4-pro-ga-harness-open-source.md (V4.1-Flash-Nachtrag + Einordnung)
- wiki/people/aicodeking.md (Review durch offizielles Release bestätigt)
- wiki/index.md (199. Update), wiki/log.md
2026-09-10 13:35:03 +02:00

47 lines
3.7 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-09-10
updated: 2026-09-10
sources: [xpost/2026-09-10_deepseek-v41-flash-official-release.md, other/2026-09-10_deepseek-v41-flash-official-announcement.md, youtube/2026-09-10_deepseek-v41-flash-aicodeking.md]
tags: [concept, deepseek, deepseek-v4.1-flash, architecture, moe, causal-encoder-decoder, multimodal, visual-understanding, kv-cache, api, open-weights, chinese-ai]
---
# DeepSeek-V4.1-Flash
> **Quelle:** Offizielle Ankündigung von @deepseek_ai (X-Post, 10.09.2026, https://x.com/deepseek_ai/status/2097930608790167907) + offizielle DeepSeek-API-Docs (https://api-docs.deepseek.com/news/news260910). Primärquelle, offiziell.
## Kernidee
**DeepSeek-V4.1-Flash** ist das **kleinste Modell einer neuen Architektur-Familie** von DeepSeek, mit **nativem visuellen Verständnis** (multimodal, ohne separate Vision-Adapter). Design-Ziele: höhere Capability, schnellere Inferenz, höherer Durchsatz, Skalierung auf größere Modelle. Release: 10.09.2026.
## Architektur
- **552B-Parameter-MoE** (Mixture-of-Experts).
- **Neue Causal-EncoderDecoder-Architektur (CED), asymmetrisch:** nur **8B aktive Parameter für Input**, **16B für Output**.
- Neue Pre-Training-Methoden + größer skaliertes RL-Post-Training → Benchmark-Ergebnisse vor Flaggschiff-Modellen, inkl. **DeepSeek-V4-Pro** ([[deepseek-v4-pro-ga-harness-open-source.md]]).
- **KV-Cache:** nur **1/4 des HBM** und **1/8 des SSD-Speichers** gegenüber Vorgängergeneration — senkt Cache-Hit-Kosten (großer Anteil der Agent-Kosten).
## API & Verfügbarkeit
- **Live auf der DeepSeek-API mit nativem Multimodal-Support** — Modellname: `deepseek-flash`.
- **V4-Flash & V4-Flash-Vision-Exp retired**; `deepseek-v4-flash` / `deepseek-v4-flash-vision-exp` routen temporär auf V4.1-Flash.
- **V4-Pro wird ausphasen:** ab 04:00 UTC, 14.09.2026 routen alle `deepseek-v4-pro`-Requests auf V4.1-Flash zu V4.1-Flash-Raten — bis V4.1-Pro launcht.
- **Pricing:** Peak/Off-Peak, Off-Peak = 50 % der Peak-Raten; neue Preise ab 04:00 UTC, 10.09.2026.
- **Offizielle Partner:** WorkBuddy (inkl. CodeBuddy) und OpenCode unterstützen V4.1-Flash vollständig.
## Open Source
- **Modell (Hugging Face):** https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
- **Paper (Tech Report):** https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
- Zusammenarbeit mit der Open-Source-Community für Inference-Support; großskalige Deployments (2.000 GPUs + Storage-Cluster) ansprechbar.
## Einordnung
- **Neue Modell-Version** gegenüber dem V4-Flash im aktiven Stack ([[../../tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md]]).
- **AICodeKing-Review** (10.09.2026, ⚠️ Metadata-only): „Deepseek V4.1 Flash (Fully Tested): 200 TPS & Beats Astra!? (+New Architecture Overview)" — https://www.youtube.com/watch?v=lpC5X6o3VJE ([[../../people/aicodeking.md|AICodeKing]]). Titel-Claims (200 TPS, schlägt Astra) nicht unabhängig verifiziert; die offizielle Ankündigung bestätigt die neue Architektur-Familie.
- **Chinesische Open-Weight-Welle:** DeepSeek liefert im Wochenrhythmus ([[../chinese-ai-wave-july-2026.md]]); V4.1-Flash setzt die Open-Weight-Strategie fort ([[open-weights-economics.md]]).
- **Relevanz für Hectors Stack:** DeepSeek-Modelle im Setup (`ollama/deepseek-v4-pro:cloud`, `ollama/deepseek-v4-flash:cloud` als Fallback) — V4.1-Flash könnte den V4-Flash-Fallback ablösen ([[../../tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md]]).
## Offene Punkte
- ⚠️ Konkrete Benchmark-Zahlen (GPQA, Codeforces, Terminal-Bench, Vision-Benchmarks) laut Web-Suche berichtet, aber nicht aus der offiziellen Ankündigung selbst extrahiert — bei Gelegenheit am Tech-Report (Hugging Face) verifizieren.
- ⚠️ AICodeKing-Review-Claims (200 TPS, schlägt Astra) nicht unabhängig verifiziert.