knowledge-base/raw/other/2026-09-10_deepseek-api-updates-changelog.md

4.6 KiB

type source_url retrieved title author tags
other https://api-docs.deepseek.com/updates/ 2026-09-10 DeepSeek API Updates / Change Log (offizielle Changelog-Seite) DeepSeek
deepseek
deepseek-v4.1-flash
deepseek-v4-pro
deepseek-v4-flash
deepseek-v4-flash-vision-exp
changelog
api
benchmarks
release

DeepSeek API Updates / Change Log

Quelle: Offizielle DeepSeek-API-Docs-Changelog-Seite (https://api-docs.deepseek.com/updates/), abgerufen 10.09.2026. Primärquelle für Release- und Benchmark-Daten der DeepSeek-V4-Modellfamilie.

2026-09-10 — DeepSeek-V4.1-Flash Release

Offizielles Release des DeepSeek-V4.1-Flash, kleinstes Modell einer neuen Architektur-Familie mit nativem multimodalen visuellen Verständnis. Neue Architektur: höhere Capability-Decke, schnellere Inferenz, höherer Durchsatz, Skalierung auf größere Modelle.

Offizielle Benchmark-Zahlen (V4.1-Flash):

  • GPQA Diamond: 90.9
  • HLE: 36.8 (39.1*)
  • Codeforces (Rating): 3471
  • MathArena Apex: 65.6
  • Terminal-Bench 2.1: 90.6
  • Terminal-Bench 3.0: 30.0
  • Terminal-Bench 4.0: 31.2
  • DeepSWE v1.1: 74.2
  • ProgramBench: 20.3
  • NL2Repo-Bench: 65.4
  • CyberGym: 88.1
  • SEC-Bench Pro: 62.8
  • ExploitGym: 15.3
  • HLE (w/tools): 63.9
  • Automation-Bench: 54.8
  • Agents' Last Exam: 31.8
  • Chartography (w/tools): 78.9
  • BabyVision (w/tools): 89.6
  • ZeroBench-main (w/tools): 49.0

* HLE nur auf dem reinen Text-Subset des HLE-Benchmark-Sets getestet.

API-Änderungen:

  • V4.1-Flash live auf der DeepSeek-API mit nativem Multimodal-Support; Modellname deepseek-flash.
  • Vorgängergenerationen V4-Flash und V4-Flash-Vision-Exp retired; für Kompatibilität routen deepseek-v4-flash und deepseek-v4-flash-vision-exp temporär auf V4.1-Flash.
  • Umfangreiche Tests zeigen: V4.1-Flash übertrifft V4-Pro bei Performance, Kosten, Speed und Gesamtlaufzeit → V4-Pro wird geordnet ausphasen. Ab 12:00 Beijing-Zeit, 14.09.2026 (bis zum Release von V4.1-Pro) routen alle deepseek-v4-pro-Requests auf V4.1-Flash und werden zu V4.1-Flash-Raten abgerechnet.
  • API-Preissenkung mit dem V4.1-Flash-Release (Details: https://api-docs.deepseek.com/quick_start/pricing).
  • Details: https://api-docs.deepseek.com/news/news260910

2026-08-21 — DeepSeek-V4-Flash-Vision-Exp Release

Experimentelles multimodales Vision-Verständnis-Modell, verfügbar via model='deepseek-v4-flash-vision-exp'.

Benchmark-Zahlen (V4-Flash-Vision-Exp):

  • Terminal Bench 2.1: 83.9

  • NL2Repo: 57.7

  • DeepSWE: 59.3

  • DSBench-Hard: 63.6

  • AutomationBench (Public): 25.7

  • ApexBench (Pass@1): 36.5

  • Agents' Last Exam: 27.3

  • Chartography: 64.3

  • ZeroBench (Pass@5): 35.0

  • Bei reinen Text-Fähigkeiten (Agent, Reasoning, Weltwissen) auf Augenhöhe mit dem offiziellen DeepSeek-V4-Flash.

  • Bei Agent-Benchmarks mit visuellem Verständnis ein deutlicher Sprung über V4-Flash — multimodale Agent-Fähigkeiten nahe Opus-4.8.

  • Evaluations-Hinweis: Code-Agent-Text-Tasks mit DeepSeek-Harness-Minimalmodus, max effort, topp=0.95, temperature=1.0; in ApexBench/Agents' Last Exam ignoriert das Textmodell V4-Flash die multimodalen Elemente.

  • Vision-Guide: https://api-docs.deepseek.com/guides/vision

2026-08-13 — DeepSeek-V4-Pro Update (GA)

GA-Release von DeepSeek-V4-Pro auf APP, Web und API. API-Aufruf unverändert: Modellname deepseek-v4-pro.

Benchmark-Zahlen (V4-Pro GA):

  • HLE (wo / w tools): 42.7 / 60.0
  • Terminal Bench 2.1: 87.9
  • NL2Repo: 61.5
  • Cybergym: 83.3
  • DeepSWE: 62.7
  • Toolathlon-Verified: 74.1
  • Agents' Last Exam: 25.7
  • AutomationBench (Public): 31.8
  • DSBench-FullStack: 71.1
  • DSBench-Hard: 67.2

Weitere Änderungen:

2026-07-31 — DeepSeek-V4-Flash Update (Public Beta)

Offizielles Release der DeepSeek-V4-Flash-API in Public Beta. API-Aufruf unverändert: Modellname deepseek-v4-flash.

Benchmark-Zahlen (V4-Flash, Public Beta):

  • Terminal Bench 2.1: 82.7

  • NL2Repo: 54.2

  • Cybergym: 76.7

  • DeepSWE: 54.4

  • Toolathlon verified: 70.3

  • Agent Last Exam: 25.2

  • Automation Bench (Public): 25.1

  • DSBench-FullStack: 68.7

  • DSBench-Hard: 59.6

  • Deutlich gesteigerte Agent-Fähigkeiten, Benchmark-Ergebnisse weit über V4-Pro-Preview.