4.6 KiB
| type | source_url | retrieved | title | author | tags | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| other | https://api-docs.deepseek.com/updates/ | 2026-09-10 | DeepSeek API Updates / Change Log (offizielle Changelog-Seite) | DeepSeek |
|
DeepSeek API Updates / Change Log
Quelle: Offizielle DeepSeek-API-Docs-Changelog-Seite (https://api-docs.deepseek.com/updates/), abgerufen 10.09.2026. Primärquelle für Release- und Benchmark-Daten der DeepSeek-V4-Modellfamilie.
2026-09-10 — DeepSeek-V4.1-Flash Release
Offizielles Release des DeepSeek-V4.1-Flash, kleinstes Modell einer neuen Architektur-Familie mit nativem multimodalen visuellen Verständnis. Neue Architektur: höhere Capability-Decke, schnellere Inferenz, höherer Durchsatz, Skalierung auf größere Modelle.
Offizielle Benchmark-Zahlen (V4.1-Flash):
- GPQA Diamond: 90.9
- HLE: 36.8 (39.1*)
- Codeforces (Rating): 3471
- MathArena Apex: 65.6
- Terminal-Bench 2.1: 90.6
- Terminal-Bench 3.0: 30.0
- Terminal-Bench 4.0: 31.2
- DeepSWE v1.1: 74.2
- ProgramBench: 20.3
- NL2Repo-Bench: 65.4
- CyberGym: 88.1
- SEC-Bench Pro: 62.8
- ExploitGym: 15.3
- HLE (w/tools): 63.9
- Automation-Bench: 54.8
- Agents' Last Exam: 31.8
- Chartography (w/tools): 78.9
- BabyVision (w/tools): 89.6
- ZeroBench-main (w/tools): 49.0
* HLE nur auf dem reinen Text-Subset des HLE-Benchmark-Sets getestet.
API-Änderungen:
- V4.1-Flash live auf der DeepSeek-API mit nativem Multimodal-Support; Modellname
deepseek-flash. - Vorgängergenerationen V4-Flash und V4-Flash-Vision-Exp retired; für Kompatibilität routen
deepseek-v4-flashunddeepseek-v4-flash-vision-exptemporär auf V4.1-Flash. - Umfangreiche Tests zeigen: V4.1-Flash übertrifft V4-Pro bei Performance, Kosten, Speed und Gesamtlaufzeit → V4-Pro wird geordnet ausphasen. Ab 12:00 Beijing-Zeit, 14.09.2026 (bis zum Release von V4.1-Pro) routen alle
deepseek-v4-pro-Requests auf V4.1-Flash und werden zu V4.1-Flash-Raten abgerechnet. - API-Preissenkung mit dem V4.1-Flash-Release (Details: https://api-docs.deepseek.com/quick_start/pricing).
- Details: https://api-docs.deepseek.com/news/news260910
2026-08-21 — DeepSeek-V4-Flash-Vision-Exp Release
Experimentelles multimodales Vision-Verständnis-Modell, verfügbar via model='deepseek-v4-flash-vision-exp'.
Benchmark-Zahlen (V4-Flash-Vision-Exp):
-
Terminal Bench 2.1: 83.9
-
NL2Repo: 57.7
-
DeepSWE: 59.3
-
DSBench-Hard: 63.6
-
AutomationBench (Public): 25.7
-
ApexBench (Pass@1): 36.5
-
Agents' Last Exam: 27.3
-
Chartography: 64.3
-
ZeroBench (Pass@5): 35.0
-
Bei reinen Text-Fähigkeiten (Agent, Reasoning, Weltwissen) auf Augenhöhe mit dem offiziellen DeepSeek-V4-Flash.
-
Bei Agent-Benchmarks mit visuellem Verständnis ein deutlicher Sprung über V4-Flash — multimodale Agent-Fähigkeiten nahe Opus-4.8.
-
Evaluations-Hinweis: Code-Agent-Text-Tasks mit DeepSeek-Harness-Minimalmodus, max effort, topp=0.95, temperature=1.0; in ApexBench/Agents' Last Exam ignoriert das Textmodell V4-Flash die multimodalen Elemente.
-
Vision-Guide: https://api-docs.deepseek.com/guides/vision
2026-08-13 — DeepSeek-V4-Pro Update (GA)
GA-Release von DeepSeek-V4-Pro auf APP, Web und API. API-Aufruf unverändert: Modellname deepseek-v4-pro.
Benchmark-Zahlen (V4-Pro GA):
- HLE (wo / w tools): 42.7 / 60.0
- Terminal Bench 2.1: 87.9
- NL2Repo: 61.5
- Cybergym: 83.3
- DeepSWE: 62.7
- Toolathlon-Verified: 74.1
- Agents' Last Exam: 25.7
- AutomationBench (Public): 31.8
- DSBench-FullStack: 71.1
- DSBench-Hard: 67.2
Weitere Änderungen:
- Native Unterstützung der OpenAI Responses API, speziell für Codex adaptiert; One-Click-Konfigurationsskript (https://api-docs.deepseek.com/quick_start/agent_integrations/codex).
- Flexiblere Thinking-Effort-Steuerung: V4-Pro und V4-Flash unterstützen drei Stufen
low/high/max(https://api-docs.deepseek.com/guides/thinking_mode). - API-Preisanpassung: Peak/Off-Peak-Pricing, Off-Peak = 50 % der Peak-Raten; greift 16:00 UTC, 16.08.2026.
- Details: https://api-docs.deepseek.com/news/news260813
2026-07-31 — DeepSeek-V4-Flash Update (Public Beta)
Offizielles Release der DeepSeek-V4-Flash-API in Public Beta. API-Aufruf unverändert: Modellname deepseek-v4-flash.
Benchmark-Zahlen (V4-Flash, Public Beta):
-
Terminal Bench 2.1: 82.7
-
NL2Repo: 54.2
-
Cybergym: 76.7
-
DeepSWE: 54.4
-
Toolathlon verified: 70.3
-
Agent Last Exam: 25.2
-
Automation Bench (Public): 25.1
-
DSBench-FullStack: 68.7
-
DSBench-Hard: 59.6
-
Deutlich gesteigerte Agent-Fähigkeiten, Benchmark-Ergebnisse weit über V4-Pro-Preview.