knowledge-base/wiki/concepts/llm/deepseek-v4.1-flash.md
Hector bfacf8050e ingest(raw): DeepSeek-V4.1-Flash offizielles Release (X-Post + API-Docs)
- raw/xpost/2026-09-10_deepseek-v41-flash-official-release.md (neu)
- raw/other/2026-09-10_deepseek-v41-flash-official-announcement.md (neu)
- wiki/concepts/llm/deepseek-v4.1-flash.md (neu)
- wiki/concepts/llm/deepseek-v4-pro-ga-harness-open-source.md (V4.1-Flash-Nachtrag + Einordnung)
- wiki/people/aicodeking.md (Review durch offizielles Release bestätigt)
- wiki/index.md (199. Update), wiki/log.md
2026-09-10 13:35:03 +02:00

3.7 KiB
Raw Blame History

created updated sources tags
2026-09-10 2026-09-10
xpost/2026-09-10_deepseek-v41-flash-official-release.md
other/2026-09-10_deepseek-v41-flash-official-announcement.md
youtube/2026-09-10_deepseek-v41-flash-aicodeking.md
concept
deepseek
deepseek-v4.1-flash
architecture
moe
causal-encoder-decoder
multimodal
visual-understanding
kv-cache
api
open-weights
chinese-ai

DeepSeek-V4.1-Flash

Quelle: Offizielle Ankündigung von @deepseek_ai (X-Post, 10.09.2026, https://x.com/deepseek_ai/status/2097930608790167907) + offizielle DeepSeek-API-Docs (https://api-docs.deepseek.com/news/news260910). Primärquelle, offiziell.

Kernidee

DeepSeek-V4.1-Flash ist das kleinste Modell einer neuen Architektur-Familie von DeepSeek, mit nativem visuellen Verständnis (multimodal, ohne separate Vision-Adapter). Design-Ziele: höhere Capability, schnellere Inferenz, höherer Durchsatz, Skalierung auf größere Modelle. Release: 10.09.2026.

Architektur

  • 552B-Parameter-MoE (Mixture-of-Experts).
  • Neue Causal-EncoderDecoder-Architektur (CED), asymmetrisch: nur 8B aktive Parameter für Input, 16B für Output.
  • Neue Pre-Training-Methoden + größer skaliertes RL-Post-Training → Benchmark-Ergebnisse vor Flaggschiff-Modellen, inkl. DeepSeek-V4-Pro (deepseek-v4-pro-ga-harness-open-source.md).
  • KV-Cache: nur 1/4 des HBM und 1/8 des SSD-Speichers gegenüber Vorgängergeneration — senkt Cache-Hit-Kosten (großer Anteil der Agent-Kosten).

API & Verfügbarkeit

  • Live auf der DeepSeek-API mit nativem Multimodal-Support — Modellname: deepseek-flash.
  • V4-Flash & V4-Flash-Vision-Exp retired; deepseek-v4-flash / deepseek-v4-flash-vision-exp routen temporär auf V4.1-Flash.
  • V4-Pro wird ausphasen: ab 04:00 UTC, 14.09.2026 routen alle deepseek-v4-pro-Requests auf V4.1-Flash zu V4.1-Flash-Raten — bis V4.1-Pro launcht.
  • Pricing: Peak/Off-Peak, Off-Peak = 50 % der Peak-Raten; neue Preise ab 04:00 UTC, 10.09.2026.
  • Offizielle Partner: WorkBuddy (inkl. CodeBuddy) und OpenCode unterstützen V4.1-Flash vollständig.

Open Source

Einordnung

Offene Punkte

  • ⚠️ Konkrete Benchmark-Zahlen (GPQA, Codeforces, Terminal-Bench, Vision-Benchmarks) laut Web-Suche berichtet, aber nicht aus der offiziellen Ankündigung selbst extrahiert — bei Gelegenheit am Tech-Report (Hugging Face) verifizieren.
  • ⚠️ AICodeKing-Review-Claims (200 TPS, schlägt Astra) nicht unabhängig verifiziert.