diff --git a/raw/other/2026-09-10_deepseek-api-updates-changelog.md b/raw/other/2026-09-10_deepseek-api-updates-changelog.md new file mode 100644 index 0000000..bcef550 --- /dev/null +++ b/raw/other/2026-09-10_deepseek-api-updates-changelog.md @@ -0,0 +1,105 @@ +--- +type: other +source_url: https://api-docs.deepseek.com/updates/ +retrieved: 2026-09-10 +title: "DeepSeek API Updates / Change Log (offizielle Changelog-Seite)" +author: "DeepSeek" +tags: [deepseek, deepseek-v4.1-flash, deepseek-v4-pro, deepseek-v4-flash, deepseek-v4-flash-vision-exp, changelog, api, benchmarks, release] +--- + +# DeepSeek API Updates / Change Log + +> **Quelle:** Offizielle DeepSeek-API-Docs-Changelog-Seite (https://api-docs.deepseek.com/updates/), abgerufen 10.09.2026. Primärquelle für Release- und Benchmark-Daten der DeepSeek-V4-Modellfamilie. + +## 2026-09-10 — DeepSeek-V4.1-Flash Release + +Offizielles Release des **DeepSeek-V4.1-Flash**, kleinstes Modell einer neuen Architektur-Familie mit nativem multimodalen visuellen Verständnis. Neue Architektur: höhere Capability-Decke, schnellere Inferenz, höherer Durchsatz, Skalierung auf größere Modelle. + +**Offizielle Benchmark-Zahlen (V4.1-Flash):** +- GPQA Diamond: 90.9 +- HLE: 36.8 (39.1*) +- Codeforces (Rating): 3471 +- MathArena Apex: 65.6 +- Terminal-Bench 2.1: 90.6 +- Terminal-Bench 3.0: 30.0 +- Terminal-Bench 4.0: 31.2 +- DeepSWE v1.1: 74.2 +- ProgramBench: 20.3 +- NL2Repo-Bench: 65.4 +- CyberGym: 88.1 +- SEC-Bench Pro: 62.8 +- ExploitGym: 15.3 +- HLE (w/tools): 63.9 +- Automation-Bench: 54.8 +- Agents' Last Exam: 31.8 +- Chartography (w/tools): 78.9 +- BabyVision (w/tools): 89.6 +- ZeroBench-main (w/tools): 49.0 + +\* HLE nur auf dem reinen Text-Subset des HLE-Benchmark-Sets getestet. + +**API-Änderungen:** +- V4.1-Flash live auf der DeepSeek-API mit nativem Multimodal-Support; Modellname `deepseek-flash`. +- Vorgängergenerationen **V4-Flash und V4-Flash-Vision-Exp retired**; für Kompatibilität routen `deepseek-v4-flash` und `deepseek-v4-flash-vision-exp` temporär auf V4.1-Flash. +- Umfangreiche Tests zeigen: V4.1-Flash übertrifft V4-Pro bei Performance, Kosten, Speed und Gesamtlaufzeit → V4-Pro wird geordnet ausphasen. **Ab 12:00 Beijing-Zeit, 14.09.2026** (bis zum Release von V4.1-Pro) routen alle `deepseek-v4-pro`-Requests auf V4.1-Flash und werden zu V4.1-Flash-Raten abgerechnet. +- **API-Preissenkung** mit dem V4.1-Flash-Release (Details: https://api-docs.deepseek.com/quick_start/pricing). +- Details: https://api-docs.deepseek.com/news/news260910 + +## 2026-08-21 — DeepSeek-V4-Flash-Vision-Exp Release + +Experimentelles multimodales Vision-Verständnis-Modell, verfügbar via `model='deepseek-v4-flash-vision-exp'`. + +**Benchmark-Zahlen (V4-Flash-Vision-Exp):** +- Terminal Bench 2.1: 83.9 +- NL2Repo: 57.7 +- DeepSWE: 59.3 +- DSBench-Hard: 63.6 +- AutomationBench (Public): 25.7 +- ApexBench (Pass@1): 36.5 +- Agents' Last Exam: 27.3 +- Chartography: 64.3 +- ZeroBench (Pass@5): 35.0 + +- Bei reinen Text-Fähigkeiten (Agent, Reasoning, Weltwissen) auf Augenhöhe mit dem offiziellen DeepSeek-V4-Flash. +- Bei Agent-Benchmarks mit visuellem Verständnis ein deutlicher Sprung über V4-Flash — multimodale Agent-Fähigkeiten nahe **Opus-4.8**. +- Evaluations-Hinweis: Code-Agent-Text-Tasks mit DeepSeek-Harness-Minimalmodus, max effort, topp=0.95, temperature=1.0; in ApexBench/Agents' Last Exam ignoriert das Textmodell V4-Flash die multimodalen Elemente. +- Vision-Guide: https://api-docs.deepseek.com/guides/vision + +## 2026-08-13 — DeepSeek-V4-Pro Update (GA) + +GA-Release von DeepSeek-V4-Pro auf APP, Web und API. API-Aufruf unverändert: Modellname `deepseek-v4-pro`. + +**Benchmark-Zahlen (V4-Pro GA):** +- HLE (wo / w tools): 42.7 / 60.0 +- Terminal Bench 2.1: 87.9 +- NL2Repo: 61.5 +- Cybergym: 83.3 +- DeepSWE: 62.7 +- Toolathlon-Verified: 74.1 +- Agents' Last Exam: 25.7 +- AutomationBench (Public): 31.8 +- DSBench-FullStack: 71.1 +- DSBench-Hard: 67.2 + +**Weitere Änderungen:** +- **Native Unterstützung der OpenAI Responses API**, speziell für Codex adaptiert; One-Click-Konfigurationsskript (https://api-docs.deepseek.com/quick_start/agent_integrations/codex). +- **Flexiblere Thinking-Effort-Steuerung:** V4-Pro und V4-Flash unterstützen drei Stufen `low` / `high` / `max` (https://api-docs.deepseek.com/guides/thinking_mode). +- **API-Preisanpassung:** Peak/Off-Peak-Pricing, Off-Peak = 50 % der Peak-Raten; greift 16:00 UTC, 16.08.2026. +- Details: https://api-docs.deepseek.com/news/news260813 + +## 2026-07-31 — DeepSeek-V4-Flash Update (Public Beta) + +Offizielles Release der DeepSeek-V4-Flash-API in Public Beta. API-Aufruf unverändert: Modellname `deepseek-v4-flash`. + +**Benchmark-Zahlen (V4-Flash, Public Beta):** +- Terminal Bench 2.1: 82.7 +- NL2Repo: 54.2 +- Cybergym: 76.7 +- DeepSWE: 54.4 +- Toolathlon verified: 70.3 +- Agent Last Exam: 25.2 +- Automation Bench (Public): 25.1 +- DSBench-FullStack: 68.7 +- DSBench-Hard: 59.6 + +- Deutlich gesteigerte Agent-Fähigkeiten, Benchmark-Ergebnisse weit über V4-Pro-Preview. diff --git a/wiki/concepts/llm/deepseek-v4-pro-ga-harness-open-source.md b/wiki/concepts/llm/deepseek-v4-pro-ga-harness-open-source.md index 54edb1a..f0251f9 100644 --- a/wiki/concepts/llm/deepseek-v4-pro-ga-harness-open-source.md +++ b/wiki/concepts/llm/deepseek-v4-pro-ga-harness-open-source.md @@ -1,7 +1,7 @@ --- created: 2026-08-14 updated: 2026-09-02 -sources: [other/2026-08-14_deepseek-v4-pro-ga-harness-open-source.md, youtube/2026-08-13_deepseek-v4-pro-0813-aicodeking.md, youtube/2026-08-21_deepseek-agent-harness-explained.md, youtube/2026-08-21_deepseek-harness-end-of-coding-agents.md, youtube/2026-09-02_worldofai-deepseek-harness-claude-code-codex-killer.md, other/2026-09-02_herman-deepseek-harness-dsh-summary.md] +sources: [other/2026-08-14_deepseek-v4-pro-ga-harness-open-source.md, other/2026-09-10_deepseek-api-updates-changelog.md, youtube/2026-08-13_deepseek-v4-pro-0813-aicodeking.md, youtube/2026-08-21_deepseek-agent-harness-explained.md, youtube/2026-08-21_deepseek-harness-end-of-coding-agents.md, youtube/2026-09-02_worldofai-deepseek-harness-claude-code-codex-killer.md, other/2026-09-02_herman-deepseek-harness-dsh-summary.md] tags: [concept, deepseek, deepseek-v4-pro, deepseek-harness, open-source, agent-harness, mit-license, chinese-ai, api, codex, claude-code, reasoning-effort] --- @@ -23,6 +23,8 @@ tags: [concept, deepseek, deepseek-v4-pro, deepseek-harness, open-source, agent- - **API-Pricing:** Neue Peak/Off-Peak-Raten, Off-Peak **50% günstiger**; greift 16:00 UTC, 16.08.2026 - **Kontext:** Unabhängiges Review von AICodeKing am selben Tag ([[../../people/aicodeking.md|AICodeKing]], `raw/youtube/2026-08-13_deepseek-v4-pro-0813-aicodeking.md`) +**Offizielle GA-Benchmark-Zahlen (Changelog, 10.09.2026):** Quelle https://api-docs.deepseek.com/updates/ (`raw/other/2026-09-10_deepseek-api-updates-changelog.md`). HLE (wo/w tools) 42.7/60.0, Terminal Bench 2.1 87.9, NL2Repo 61.5, Cybergym 83.3, DeepSWE 62.7, Toolathlon-Verified 74.1, Agents' Last Exam 25.7, AutomationBench (Public) 31.8, DSBench-FullStack 71.1, DSBench-Hard 67.2. + ## DeepSeek Harness v0.1 (Open-Source Agent Harness) - **Lizenz:** MIT diff --git a/wiki/concepts/llm/deepseek-v4.1-flash.md b/wiki/concepts/llm/deepseek-v4.1-flash.md index 0483d17..7e4aacd 100644 --- a/wiki/concepts/llm/deepseek-v4.1-flash.md +++ b/wiki/concepts/llm/deepseek-v4.1-flash.md @@ -1,7 +1,7 @@ --- created: 2026-09-10 updated: 2026-09-10 -sources: [xpost/2026-09-10_deepseek-v41-flash-official-release.md, other/2026-09-10_deepseek-v41-flash-official-announcement.md, youtube/2026-09-10_deepseek-v41-flash-aicodeking.md] +sources: [xpost/2026-09-10_deepseek-v41-flash-official-release.md, other/2026-09-10_deepseek-v41-flash-official-announcement.md, other/2026-09-10_deepseek-api-updates-changelog.md, youtube/2026-09-10_deepseek-v41-flash-aicodeking.md] tags: [concept, deepseek, deepseek-v4.1-flash, architecture, moe, causal-encoder-decoder, multimodal, visual-understanding, kv-cache, api, open-weights, chinese-ai] --- @@ -41,7 +41,34 @@ tags: [concept, deepseek, deepseek-v4.1-flash, architecture, moe, causal-encoder - **Chinesische Open-Weight-Welle:** DeepSeek liefert im Wochenrhythmus ([[../chinese-ai-wave-july-2026.md]]); V4.1-Flash setzt die Open-Weight-Strategie fort ([[open-weights-economics.md]]). - **Relevanz für Hectors Stack:** DeepSeek-Modelle im Setup (`ollama/deepseek-v4-pro:cloud`, `ollama/deepseek-v4-flash:cloud` als Fallback) — V4.1-Flash könnte den V4-Flash-Fallback ablösen ([[../../tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md]]). +## Offizielle Benchmark-Zahlen (Changelog, 10.09.2026) + +> Quelle: Offizielle DeepSeek-API-Changelog-Seite (https://api-docs.deepseek.com/updates/), `raw/other/2026-09-10_deepseek-api-updates-changelog.md`. Damit sind die zuvor offenen Benchmark-Zahlen aus der offiziellen Quelle belegt. + +| Benchmark | Wert | +|---|---| +| GPQA Diamond | 90.9 | +| HLE | 36.8 (39.1*) | +| Codeforces (Rating) | 3471 | +| MathArena Apex | 65.6 | +| Terminal-Bench 2.1 | 90.6 | +| Terminal-Bench 3.0 | 30.0 | +| Terminal-Bench 4.0 | 31.2 | +| DeepSWE v1.1 | 74.2 | +| ProgramBench | 20.3 | +| NL2Repo-Bench | 65.4 | +| CyberGym | 88.1 | +| SEC-Bench Pro | 62.8 | +| ExploitGym | 15.3 | +| HLE (w/tools) | 63.9 | +| Automation-Bench | 54.8 | +| Agents' Last Exam | 31.8 | +| Chartography (w/tools) | 78.9 | +| BabyVision (w/tools) | 89.6 | +| ZeroBench-main (w/tools) | 49.0 | + +\* HLE nur auf dem reinen Text-Subset des HLE-Benchmark-Sets getestet. + ## Offene Punkte -- ⚠️ Konkrete Benchmark-Zahlen (GPQA, Codeforces, Terminal-Bench, Vision-Benchmarks) laut Web-Suche berichtet, aber nicht aus der offiziellen Ankündigung selbst extrahiert — bei Gelegenheit am Tech-Report (Hugging Face) verifizieren. - ⚠️ AICodeKing-Review-Claims (200 TPS, schlägt Astra) nicht unabhängig verifiziert. diff --git a/wiki/index.md b/wiki/index.md index ef2aabc..fc228f5 100644 --- a/wiki/index.md +++ b/wiki/index.md @@ -2,7 +2,8 @@ *Auto-generated: 2026-07-07* -*Letzte Aktualisierung: 2026-09-10 (199. Update — Offizielles DeepSeek-V4.1-Flash-Release (X-Post @deepseek_ai, 10.09.2026, https://x.com/deepseek_ai/status/2097930608790167907 + API-Docs https://api-docs.deepseek.com/news/news260910): kleinstes Modell einer neuen Architektur-Familie mit nativem visuellen Verständnis; 552B-MoE, neue Causal-Encoder–Decoder-Architektur (8B aktiv Input / 16B Output), KV-Cache 1/4 HBM + 1/8 SSD; live auf API als `deepseek-flash`; V4-Flash/V4-Flash-Vision-Exp retired, V4-Pro wird ab 14.09.2026 auf V4.1-Flash geroutet; Open Weights + Tech-Report auf Hugging Face; Partner WorkBuddy/CodeBuddy + OpenCode. Raw: `raw/xpost/2026-09-10_deepseek-v41-flash-official-release.md` (neu), `raw/other/2026-09-10_deepseek-v41-flash-official-announcement.md` (neu). Wiki-Update: `concepts/llm/deepseek-v4.1-flash.md` (neu), `concepts/llm/deepseek-v4-pro-ga-harness-open-source.md` (V4.1-Flash-Nachtrag auf offizielles Release aktualisiert + Einordnung-Tabelle), `people/aicodeking.md` (Review durch offizielles Release bestätigt).)* +*Letzte Aktualisierung: 2026-09-10 (200. Update — Offizielle DeepSeek-API-Changelog-Seite (https://api-docs.deepseek.com/updates/): offizielle Benchmark-Zahlen der V4-Modellfamilie. V4.1-Flash: GPQA Diamond 90.9, HLE 36.8 (39.1*), Codeforces 3471, MathArena Apex 65.6, Terminal-Bench 2.1/3.0/4.0 90.6/30.0/31.2, DeepSWE v1.1 74.2, CyberGym 88.1, SEC-Bench Pro 62.8, HLE w/tools 63.9, Automation-Bench 54.8, Agents' Last Exam 31.8, Chartography w/tools 78.9, BabyVision w/tools 89.6, ZeroBench-main w/tools 49.0. Dazu V4-Flash-Vision-Exp (21.08., nahe Opus-4.8 bei visuellen Agent-Benchmarks), V4-Pro-GA (13.08., HLE 42.7/60.0, Terminal-Bench 2.1 87.9, Cybergym 83.3, DeepSWE 62.7, Toolathlon-Verified 74.1, DSBench-FullStack/Hard 71.1/67.2) und V4-Flash-Public-Beta (31.07.). Raw: `raw/other/2026-09-10_deepseek-api-updates-changelog.md` (neu). Wiki-Update: `concepts/llm/deepseek-v4.1-flash.md` (offizielle Benchmark-Tabelle ergänzt, offener Punkt zu Benchmark-Zahlen aufgelöst), `concepts/llm/deepseek-v4-pro-ga-harness-open-source.md` (offizielle GA-Benchmark-Zahlen ergänzt).)* +*Vorherige Aktualisierung: Letzte Aktualisierung: 2026-09-10 (199. Update — Offizielles DeepSeek-V4.1-Flash-Release (X-Post @deepseek_ai, 10.09.2026, https://x.com/deepseek_ai/status/2097930608790167907 + API-Docs https://api-docs.deepseek.com/news/news260910): kleinstes Modell einer neuen Architektur-Familie mit nativem visuellen Verständnis; 552B-MoE, neue Causal-Encoder–Decoder-Architektur (8B aktiv Input / 16B Output), KV-Cache 1/4 HBM + 1/8 SSD; live auf API als `deepseek-flash`; V4-Flash/V4-Flash-Vision-Exp retired, V4-Pro wird ab 14.09.2026 auf V4.1-Flash geroutet; Open Weights + Tech-Report auf Hugging Face; Partner WorkBuddy/CodeBuddy + OpenCode. Raw: `raw/xpost/2026-09-10_deepseek-v41-flash-official-release.md` (neu), `raw/other/2026-09-10_deepseek-v41-flash-official-announcement.md` (neu). Wiki-Update: `concepts/llm/deepseek-v4.1-flash.md` (neu), `concepts/llm/deepseek-v4-pro-ga-harness-open-source.md` (V4.1-Flash-Nachtrag auf offizielles Release aktualisiert + Einordnung-Tabelle), `people/aicodeking.md` (Review durch offizielles Release bestätigt).)* *Vorherige Aktualisierung: Letzte Aktualisierung: 2026-09-10 (198. Update — YouTube: „Deepseek V4.1 Flash (Fully Tested): 200 TPS & Beats Astra!? (+New Architecture Overview)“ (Kanal AICodeKing, @AICodeKing; metadata-only, kein Transcript — YouTube bot-check/consent wall). Raw: `raw/youtube/2026-09-10_deepseek-v41-flash-aicodeking.md` (neu). Titel-Claims (DeepSeek V4.1 Flash, 200 TPS, schlägt Astra, neue Architektur) nicht verifiziert; Benchmark-Methodik/Architektur-Details nicht dokumentiert. Wiki-Update: `concepts/llm/deepseek-v4-pro-ga-harness-open-source.md` (V4.1-Flash-Nachtrag, Abgrenzung zum V4-Flash im aktiven Stack), `people/aicodeking.md` (Review ergänzt).)* *Vorherige Aktualisierung: Letzte Aktualisierung: 2026-09-10 (197. Update — OME-Beitrag plebcoach Andreas (Topic 22, #14312): „Praktische Beispiele für meine Projekte zur Kombination von Technik und Hypnose. KI gestützte Gesten & Abstandserkennung und IR kamera zur Erkennung von unbewussten fingersignalen“. Zwei Bilder zeigen einen kamerabestückten, seil-/schienengeführt wirkenden Prototyp (mechanische Einordnung unsicher, keine Videoanalyse verfügbar). Raw: `raw/other/2026-09-10_ki-gestuetzte-hypnose-gestenerkennung.md` (neu). Wiki-Update: `concepts/hardware/ki-gestuetzte-hypnose-gestenerkennung.md` (neu — intendierte Funktion getrennt von demonstriertem Stand; keine Spezifikationen, Wirksamkeits- oder Sicherheitsclaims). ⚠️ Reine Selbstbeschreibung des Senders, nicht unabhängig validiert.)* *Vorherige Aktualisierung: Letzte Aktualisierung: 2026-09-09 (196. Update — X-Post von @sopharicks „I've interviewed dozens of scientists about AI consciousness“: Kompilation aller Pro-/Contra-Argumente zum KI-Bewusstsein aus Interviews (Friston, Hameroff, Hoffman, Koch, Levin, Solms, Weist, Schneider, Schwitzgebel, Luppi, de Lange, Thomason, Graziano, Goff, Papineau, Lemoine, Poggio, Hammond, Shevlin, Anthis). Contra: Substrat/Material, Selbst/Markov-Blanket, Bindung/Einheit, Leben/Verkörperung, Mimikry/Projektion. Offen/Pro: Anti-biologischer Chauvinismus, Kontinuum, Funktionsarchitektur, potenzielle Signale. Dazu epistemische Demut und bedingte Pro-Pfade. Raw: `raw/xpost/2026-09-09_sophia-ai-consciousness-arguments.md` (neu). Wiki-Update: `concepts/agi/ai-consciousness.md` (neu — Interview-Claims getrennt von theoretischen Positionen und empirischer Evidenz; „Mike Weist“ = Michael Wiest; Cross-Refs zu openai-an-alien-mind, parasoziale-ki-bindungen, menschenwuerde-art1-gg-ai-ethics, neuromorphic-chips, llm-knowledge-base). ⚠️ Social-Media-Kompilation, keine peer-reviewte Quelle; Zuschreibungen nicht unabhängig verifiziert; Liste laut Post von Claude, Visuals von GPT 5.6.)* diff --git a/wiki/log.md b/wiki/log.md index 8d64232..63641a0 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -2,6 +2,20 @@ *Append-only changelog. Start: 2026-06-05* +## 2026-09-10 — Offizielle DeepSeek-API-Changelog-Seite (Benchmark-Zahlen V4-Modellfamilie) + +**Type:** ingest | **Scope:** raw/other, wiki/concepts/llm, wiki/index, wiki/log +**Source:** Offizielle DeepSeek-API-Docs-Changelog https://api-docs.deepseek.com/updates/ (abgerufen 10.09.2026) + +**Inhalt:** Offizielle Benchmark-Zahlen der DeepSeek-V4-Modellfamilie aus der Changelog-Seite. **V4.1-Flash** (10.09.): GPQA Diamond 90.9, HLE 36.8 (39.1*), Codeforces 3471, MathArena Apex 65.6, Terminal-Bench 2.1/3.0/4.0 90.6/30.0/31.2, DeepSWE v1.1 74.2, ProgramBench 20.3, NL2Repo-Bench 65.4, CyberGym 88.1, SEC-Bench Pro 62.8, ExploitGym 15.3, HLE w/tools 63.9, Automation-Bench 54.8, Agents' Last Exam 31.8, Chartography w/tools 78.9, BabyVision w/tools 89.6, ZeroBench-main w/tools 49.0. **V4-Flash-Vision-Exp** (21.08.): nahe Opus-4.8 bei visuellen Agent-Benchmarks, Text-Fähigkeiten auf V4-Flash-Niveau. **V4-Pro GA** (13.08.): HLE 42.7/60.0, Terminal-Bench 2.1 87.9, NL2Repo 61.5, Cybergym 83.3, DeepSWE 62.7, Toolathlon-Verified 74.1, Agents' Last Exam 25.7, AutomationBench 31.8, DSBench-FullStack/Hard 71.1/67.2. **V4-Flash Public Beta** (31.07.): Terminal-Bench 2.1 82.7, NL2Repo 54.2, Cybergym 76.7, DeepSWE 54.4, Toolathlon 70.3, Agent Last Exam 25.2, AutomationBench 25.1, DSBench-FullStack/Hard 68.7/59.6. + +**Quellenlage / Transparenz:** Primärquelle (offiziell). Damit sind die zuvor offenen V4.1-Flash-Benchmark-Zahlen aus der offiziellen Quelle belegt (vorher nur laut Web-Suche berichtet). +- raw (NEW): `raw/other/2026-09-10_deepseek-api-updates-changelog.md` — neutrale Faktenzusammenfassung der Changelog-Seite. +- wiki (UPD): `wiki/concepts/llm/deepseek-v4.1-flash.md` — offizielle Benchmark-Tabelle ergänzt, offener Punkt zu Benchmark-Zahlen aufgelöst. +- wiki (UPD): `wiki/concepts/llm/deepseek-v4-pro-ga-harness-open-source.md` — offizielle GA-Benchmark-Zahlen ergänzt. +- `wiki/index.md` (200. Update) +- `wiki/log.md` (dieser Eintrag) + ## 2026-09-10 — DeepSeek-V4.1-Flash offizielles Release (X-Post @deepseek_ai + API-Docs) **Type:** ingest | **Scope:** raw/xpost, raw/other, wiki/concepts/llm, wiki/people, wiki/index, wiki/log