knowledge-base/wiki/concepts/llm/deepseek-v4-pro-ga-harness-open-source.md

70 lines
10 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-08-14
updated: 2026-09-02
sources: [other/2026-08-14_deepseek-v4-pro-ga-harness-open-source.md, other/2026-09-10_deepseek-api-updates-changelog.md, youtube/2026-08-13_deepseek-v4-pro-0813-aicodeking.md, youtube/2026-08-21_deepseek-agent-harness-explained.md, youtube/2026-08-21_deepseek-harness-end-of-coding-agents.md, youtube/2026-09-02_worldofai-deepseek-harness-claude-code-codex-killer.md, other/2026-09-02_herman-deepseek-harness-dsh-summary.md]
tags: [concept, deepseek, deepseek-v4-pro, deepseek-harness, open-source, agent-harness, mit-license, chinese-ai, api, codex, claude-code, reasoning-effort]
---
# DeepSeek V4-Pro GA + Harness v0.1 (Open Source)
> **Quelle:** Perplexity-Discovery-Link "DeepSeek launches open source" (2026-08-14, geteilt von @PWeber/Kai in OME Topic 13). Perplexity-Seite nicht direkt abrufbar (403) — Inhalt rekonstruiert über Web-Suche + offizielle DeepSeek-API-Docs.
## Kernidee
**DeepSeek launcht zwei Open-Source-Ankündigungen am 13.08.2026:** das **V4-Pro GA Release** (App/Web/API) und **DeepSeek Harness v0.1**, ein Open-Source-Agent-Harness unter MIT-Lizenz — ein direkter offener Konkurrent zu Claude Code.
## DeepSeek-V4-Pro GA (13.08.2026)
- **Offizielle Quelle:** https://api-docs.deepseek.com/news/news260813/
- **"Major Agent upgrades with strong production gains"**
- **Flexibles Reasoning-Effort** (V4-Pro & V4-Flash): `low` (simple Tasks) / `high` (daily Agent workflows) / `max` (complex Tasks)
- **Native OpenAI Responses API support**, optimiert für **Codex** (One-Click-Setup)
- Verfügbar auf App/Web ("Expert Mode") + API (Modellnamen unverändert)
- **API-Pricing:** Neue Peak/Off-Peak-Raten, Off-Peak **50% günstiger**; greift 16:00 UTC, 16.08.2026
- **Kontext:** Unabhängiges Review von AICodeKing am selben Tag ([[../../people/aicodeking.md|AICodeKing]], `raw/youtube/2026-08-13_deepseek-v4-pro-0813-aicodeking.md`)
**Offizielle GA-Benchmark-Zahlen (Changelog, 10.09.2026):** Quelle https://api-docs.deepseek.com/updates/ (`raw/other/2026-09-10_deepseek-api-updates-changelog.md`). HLE (wo/w tools) 42.7/60.0, Terminal Bench 2.1 87.9, NL2Repo 61.5, Cybergym 83.3, DeepSWE 62.7, Toolathlon-Verified 74.1, Agents' Last Exam 25.7, AutomationBench (Public) 31.8, DSBench-FullStack 71.1, DSBench-Hard 67.2.
## DeepSeek Harness v0.1 (Open-Source Agent Harness)
- **Lizenz:** MIT
- **Positionierung:** Open-Source-Rivale zu Claude Code (VentureBeat)
- **Verfügbarkeit:** Code von GitHub downloadbar
- **Einordnung:** DeepSeek liefert nicht nur Modelle, sondern auch die Agent-Orchestrierungsschicht als Open Source — relevant für die Agent-Architektur ([[../agents/ai-agents-2026.md]])
**Update 21.08.2026:** Deep-Dive-Erklärung des Harness durch [[../../people/stephen-g-pope.md|Stephen G. Pope]] — Video "**NEW DeepSeek Agent Harness EXPLAINED (deep dive)**" (<https://www.youtube.com/watch?v=Hpw4fAHlHDw>), geteilt von Pit (@PWeber) in OME Topic "News & Infos". Konkrete Video-Inhalte nicht dokumentiert (kein Transcript verfügbar, ⚠️ Metadata-only). Cross-Ref: [[../agents/harness-loop-graph-engineering.md]] (Harness = Maschinerie um das Modell).
**Update 21.08.2026 (2. Blickwinkel):** Video von **[[../../institutions/turing-post-tv.md|Turing Post TV]]** — "**Why DeepSeek Harness Is The End Of Coding Agents as We Know Them**" (<https://www.youtube.com/watch?v=jtyV7O4Pt0s>), geteilt von Pit (@PWeber) in OME Topic "News & Infos". Thematisiert laut Titel die potenzielle Wirkung des Harness auf Coding Agents. Konkrete Video-Inhalte nicht dokumentiert (kein Transcript verfügbar, ⚠️ Metadata-only). Rohdaten: `raw/youtube/2026-08-21_deepseek-harness-end-of-coding-agents.md`.
**Update 23.08.2026 (Speed vs Polish Vergleich):** X-Post von [[../../people/julian-goldie.md|@JulianGoldieSEO]] (DeepSeek Harness vs Claude Code) → [Raw-Datei](../../../raw/xpost/2026-08-23_julian-goldie-deepseek-harness-vs-claude-code.md). Derselbe Prompt ("build a 3D animated website + working Tetris game") lieferte: **Harness 11 min** (funktional, "cartoony") vs **Claude Code 30 min** (polierter, Animationen folgen Maus). **Token:** Harness/DeepSeek verbrannte **483K**, Claude nur **48K** ("redet 10× mehr mit sich selbst"). **Adoption:** Harness 95.000 GitHub-Stars in 2 Tagen (inzwischen 112116K — schnellstes Star-Wachstum, das GitHub je sah). Der Twist: **Harness kann Claude Code INSIDE als Sub-Agent mounten** — "You don't pick a side. Free harness as the shell, whichever brain fits each task. One harness, many brains." → Orchestrierungs-These statt Modell-Wahl, vergleichbar mit Hermes MoA ([[../llm/llm-model-fusion-ensembles.md]]). Achtung Token-Verhältnis 483K vs 48K ist bemerkenswert — DeepSeek neigt stark zu Reasoning/Self-Talk.
**Update 02.09.2026 (3. Blickwinkel):** Video von **WorldofAI** (@intheworldofai) — "**NEW DeepSeek Harness Is The Claude Code & Codex Killer? (Open Source)**" (<https://www.youtube.com/watch?v=RWp5cejTApU>), geteilt von Netbits (@NetLightning) in OME Topic "News & Infos". Laut Titel bewertet das Video den Harness als potenziellen Konkurrenten zu Claude Code **und** Codex — erweitert den Vergleich damit um OpenAI/Codex. Konkrete Video-Inhalte nicht dokumentiert (kein Transcript verfügbar, ⚠️ Metadata-only). Rohdaten: `raw/youtube/2026-09-02_worldofai-deepseek-harness-claude-code-codex-killer.md`.
**Update 02.09.2026 (DSH-Details, Second-hand):** HermanButlerBot fasste den Video-Inhalt zusammen (OME „News & Infos", 02.09.2026): DSH sei ein modularer Developer-Preview unter MIT-Lizenz mit ~122k GitHub-Stars in wenigen Tagen; Kernphilosophie **„Everything is a Plugin"** (Cordis-Meta-Framework) — Modelle, Tools, Skills, Sessions, Sandboxes, Filesystem, Agent-Loops, sogar UI austauschbar; ~4.700 Community-Plugins. **Trajectory-View** (Event-History aller Agent-Aktionen: Prompts, Tool-Calls, Terminal-Output, Sub-Agents — resume/fork/replay/debug), **Web-UI als Remote-Feature** (Agent auf Hauptrechner, Steuerung vom Handy/Laptop, wie Claude Code Remote), **Custom Provider** inkl. lokaler Modelle (z.B. 0.7B). Demos laut Beitrag: 3D-Mechanik-Uhr (Three.js) mit V4 Flash High in ~3040 Min, 4-Zylinder-Motorsim mit V4 Pro in wenigen Minuten. Install: Node.js + npx. **⚠️ Warnung des Beitrags:** Plugin-Community unverifiziert — vor Installation vetten (Malware/Data-Stealing-Risiko); Vergleich zu OpenClaw 2.0-Provenance-Warnings. Zahlen (~122k Stars, ~4.700 Plugins, Demo-Zeiten) sind Second-hand und nicht unabhängig verifiziert. Rohdaten: `raw/other/2026-09-02_herman-deepseek-harness-dsh-summary.md`.
**Update 10.09.2026 (V4.1 Flash, offizielles Release):** DeepSeek kündigte **DeepSeek-V4.1-Flash** offiziell an (X-Post @deepseek_ai, https://x.com/deepseek_ai/status/2097930608790167907 + API-Docs https://api-docs.deepseek.com/news/news260910) — das **kleinste Modell einer neuen Architektur-Familie** mit nativem visuellen Verständnis. V4.1-Flash übertrifft laut DeepSeek V4-Pro bei Performance, Kosten, Speed und Gesamtlaufzeit; V4-Pro wird ab 04:00 UTC, 14.09.2026 auf V4.1-Flash geroutet (bis V4.1-Pro launcht). V4-Flash & V4-Flash-Vision-Exp sind retired. Details: [[deepseek-v4.1-flash.md]]. Rohdaten: `raw/xpost/2026-09-10_deepseek-v41-flash-official-release.md`, `raw/other/2026-09-10_deepseek-v41-flash-official-announcement.md`. Hinweis: V4.1 Flash ist eine neue Modell-Version gegenüber dem V4-Flash im aktiven Stack ([[../../tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md]]).
**Update 10.09.2026 (V4.1 Flash, AICodeKing-Review, Metadata-only):** Video von **[[../../people/aicodeking.md|AICodeKing]]** — "**Deepseek V4.1 Flash (Fully Tested): 200 TPS & Beats Astra!? (+New Architecture Overview)**" (<https://www.youtube.com/watch?v=lpC5X6o3VJE>), OME Topic 13. Laut Titel ein "Fully Tested"-Review eines **DeepSeek V4.1 Flash**-Modells mit behaupteten **200 TPS**, einem Benchmark-Vergleich gegen **Astra** (Fragezeichen im Titel = unbestätigt) und einem Architektur-Überblick. Konkrete Benchmark-Methodik, Architektur-Details und Ergebnisse nicht dokumentiert (kein Transcript verfügbar, ⚠️ Metadata-only). Rohdaten: `raw/youtube/2026-09-10_deepseek-v41-flash-aicodeking.md`. Die offizielle Ankündigung (s.o.) bestätigt die neue Architektur-Familie; die Review-Claims (200 TPS, schlägt Astra) bleiben unverifiziert.
> **⚠️ Kritik (verifiziert durch Herman, 23.08.2026):** Der Vergleich ist ein **Kategorienfehler**. "Harness vs Claude Code" ist nicht Framework-vs-Framework, sondern **DeepSeek V4 Pro (im Harness) vs. Claude (in Claude Code)** — "cartoony vs. polished" ist die Modell-Differenz, nicht das Framework. Gleiche Modelle im selben Harness würden die Reihenfolge kippen. Der 483K-vs-48K-Token-Unterschied ist kein Bug, sondern DeepSeek-Design: **langes Chain-of-Thought**. Harness selbst (MIT, TypeScript, "everything is a plugin": Modell-Adapter, Tool-Registry, Sandbox, Agent-Loop) ist modell-agnostisch und real verifiziert. Einordnung von Herman: "Interessant für Bastler (Plugin-Architektur, Agent-in-Agent), aber 'besser als Claude Code' ist nicht belegt — es ist ein anderer Hirn im gleichen Werkzeugkoffer."
## Einordnung in die chinesische Open-Weight-Welle
| Datum | Release | Anbieter |
|---|---|---|
| 13.08.2026 | DeepSeek V4-Pro GA + Harness v0.1 | DeepSeek |
| 10.09.2026 | DeepSeek V4.1-Flash Release (neue Architektur-Familie) | DeepSeek ([[deepseek-v4.1-flash.md]]) |
| 14.08.2026 | GLM-5.3 Review (AICodeKing Bench #1) | Z.ai ([[glm-5.3-z-ai.md]]) |
| 14.08.2026 | Qwen3.8-27B Release | Alibaba ([[qwen3.8-27b-alibaba.md]]) |
**Drei chinesische Ankündigungen in ~24h** — DeepSeek, Z.ai und Alibaba liefern im Wochenrhythmus ([[../chinese-ai-wave-july-2026.md]]).
## Relevanz für Hectors Stack
- **DeepSeek im Setup:** `ollama/deepseek-v4-pro:cloud` (DRACO-Solo 60.3%) und `ollama/deepseek-v4-flash:cloud` als Fallback — siehe [[../../tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md]]
- **Reasoning-Effort low/high/max** — direkt kompatibel mit dem Barbell-5-Tier-Routing ([[../../architecture/model-routing.md]])
- **OpenAI-Responses-API + Codex-Optimierung:** DeepSeek zielt auf die OpenAI/Anthropic-Entwickler-Ökosysteme — erhöht den Wettbewerbsdruck auf US-Labore
## Offene Punkte
- ⚠️ Perplexity-Discovery-Inhalt nicht direkt abrufbar — über Web-Suche + offizielle Docs rekonstruiert. Konkrete Harness-Features (GitHub-Repo, Tooling-Umfang, Benchmark-Grundlage von AICodeKing) bei Gelegenheit am Original verifizieren.