knowledge-base/wiki/concepts/llm/deepseek-v4.1-flash.md

4.5 KiB
Raw Blame History

created updated sources tags
2026-09-10 2026-09-10
xpost/2026-09-10_deepseek-v41-flash-official-release.md
other/2026-09-10_deepseek-v41-flash-official-announcement.md
other/2026-09-10_deepseek-api-updates-changelog.md
youtube/2026-09-10_deepseek-v41-flash-aicodeking.md
concept
deepseek
deepseek-v4.1-flash
architecture
moe
causal-encoder-decoder
multimodal
visual-understanding
kv-cache
api
open-weights
chinese-ai

DeepSeek-V4.1-Flash

Quelle: Offizielle Ankündigung von @deepseek_ai (X-Post, 10.09.2026, https://x.com/deepseek_ai/status/2097930608790167907) + offizielle DeepSeek-API-Docs (https://api-docs.deepseek.com/news/news260910). Primärquelle, offiziell.

Kernidee

DeepSeek-V4.1-Flash ist das kleinste Modell einer neuen Architektur-Familie von DeepSeek, mit nativem visuellen Verständnis (multimodal, ohne separate Vision-Adapter). Design-Ziele: höhere Capability, schnellere Inferenz, höherer Durchsatz, Skalierung auf größere Modelle. Release: 10.09.2026.

Architektur

  • 552B-Parameter-MoE (Mixture-of-Experts).
  • Neue Causal-EncoderDecoder-Architektur (CED), asymmetrisch: nur 8B aktive Parameter für Input, 16B für Output.
  • Neue Pre-Training-Methoden + größer skaliertes RL-Post-Training → Benchmark-Ergebnisse vor Flaggschiff-Modellen, inkl. DeepSeek-V4-Pro (deepseek-v4-pro-ga-harness-open-source.md).
  • KV-Cache: nur 1/4 des HBM und 1/8 des SSD-Speichers gegenüber Vorgängergeneration — senkt Cache-Hit-Kosten (großer Anteil der Agent-Kosten).

API & Verfügbarkeit

  • Live auf der DeepSeek-API mit nativem Multimodal-Support — Modellname: deepseek-flash.
  • V4-Flash & V4-Flash-Vision-Exp retired; deepseek-v4-flash / deepseek-v4-flash-vision-exp routen temporär auf V4.1-Flash.
  • V4-Pro wird ausphasen: ab 04:00 UTC, 14.09.2026 routen alle deepseek-v4-pro-Requests auf V4.1-Flash zu V4.1-Flash-Raten — bis V4.1-Pro launcht.
  • Pricing: Peak/Off-Peak, Off-Peak = 50 % der Peak-Raten; neue Preise ab 04:00 UTC, 10.09.2026.
  • Offizielle Partner: WorkBuddy (inkl. CodeBuddy) und OpenCode unterstützen V4.1-Flash vollständig.

Open Source

Einordnung

Offizielle Benchmark-Zahlen (Changelog, 10.09.2026)

Quelle: Offizielle DeepSeek-API-Changelog-Seite (https://api-docs.deepseek.com/updates/), raw/other/2026-09-10_deepseek-api-updates-changelog.md. Damit sind die zuvor offenen Benchmark-Zahlen aus der offiziellen Quelle belegt.

Benchmark Wert
GPQA Diamond 90.9
HLE 36.8 (39.1*)
Codeforces (Rating) 3471
MathArena Apex 65.6
Terminal-Bench 2.1 90.6
Terminal-Bench 3.0 30.0
Terminal-Bench 4.0 31.2
DeepSWE v1.1 74.2
ProgramBench 20.3
NL2Repo-Bench 65.4
CyberGym 88.1
SEC-Bench Pro 62.8
ExploitGym 15.3
HLE (w/tools) 63.9
Automation-Bench 54.8
Agents' Last Exam 31.8
Chartography (w/tools) 78.9
BabyVision (w/tools) 89.6
ZeroBench-main (w/tools) 49.0

* HLE nur auf dem reinen Text-Subset des HLE-Benchmark-Sets getestet.

Offene Punkte

  • ⚠️ AICodeKing-Review-Claims (200 TPS, schlägt Astra) nicht unabhängig verifiziert.