10 KiB
| created | updated | sources | tags | |||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-08-14 | 2026-09-02 |
|
|
DeepSeek V4-Pro GA + Harness v0.1 (Open Source)
Quelle: Perplexity-Discovery-Link "DeepSeek launches open source" (2026-08-14, geteilt von @PWeber/Kai in OME Topic 13). Perplexity-Seite nicht direkt abrufbar (403) — Inhalt rekonstruiert über Web-Suche + offizielle DeepSeek-API-Docs.
Kernidee
DeepSeek launcht zwei Open-Source-Ankündigungen am 13.08.2026: das V4-Pro GA Release (App/Web/API) und DeepSeek Harness v0.1, ein Open-Source-Agent-Harness unter MIT-Lizenz — ein direkter offener Konkurrent zu Claude Code.
DeepSeek-V4-Pro GA (13.08.2026)
- Offizielle Quelle: https://api-docs.deepseek.com/news/news260813/
- "Major Agent upgrades with strong production gains"
- Flexibles Reasoning-Effort (V4-Pro & V4-Flash):
low(simple Tasks) /high(daily Agent workflows) /max(complex Tasks) - Native OpenAI Responses API support, optimiert für Codex (One-Click-Setup)
- Verfügbar auf App/Web ("Expert Mode") + API (Modellnamen unverändert)
- API-Pricing: Neue Peak/Off-Peak-Raten, Off-Peak 50% günstiger; greift 16:00 UTC, 16.08.2026
- Kontext: Unabhängiges Review von AICodeKing am selben Tag (../../people/aicodeking.md,
raw/youtube/2026-08-13_deepseek-v4-pro-0813-aicodeking.md)
Offizielle GA-Benchmark-Zahlen (Changelog, 10.09.2026): Quelle https://api-docs.deepseek.com/updates/ (raw/other/2026-09-10_deepseek-api-updates-changelog.md). HLE (wo/w tools) 42.7/60.0, Terminal Bench 2.1 87.9, NL2Repo 61.5, Cybergym 83.3, DeepSWE 62.7, Toolathlon-Verified 74.1, Agents' Last Exam 25.7, AutomationBench (Public) 31.8, DSBench-FullStack 71.1, DSBench-Hard 67.2.
DeepSeek Harness v0.1 (Open-Source Agent Harness)
- Lizenz: MIT
- Positionierung: Open-Source-Rivale zu Claude Code (VentureBeat)
- Verfügbarkeit: Code von GitHub downloadbar
- Einordnung: DeepSeek liefert nicht nur Modelle, sondern auch die Agent-Orchestrierungsschicht als Open Source — relevant für die Agent-Architektur (../agents/ai-agents-2026.md)
Update 21.08.2026: Deep-Dive-Erklärung des Harness durch ../../people/stephen-g-pope.md — Video "NEW DeepSeek Agent Harness EXPLAINED (deep dive)" (https://www.youtube.com/watch?v=Hpw4fAHlHDw), geteilt von Pit (@PWeber) in OME Topic "News & Infos". Konkrete Video-Inhalte nicht dokumentiert (kein Transcript verfügbar, ⚠️ Metadata-only). Cross-Ref: ../agents/harness-loop-graph-engineering.md (Harness = Maschinerie um das Modell).
Update 21.08.2026 (2. Blickwinkel): Video von ../../institutions/turing-post-tv.md — "Why DeepSeek Harness Is The End Of Coding Agents as We Know Them" (https://www.youtube.com/watch?v=jtyV7O4Pt0s), geteilt von Pit (@PWeber) in OME Topic "News & Infos". Thematisiert laut Titel die potenzielle Wirkung des Harness auf Coding Agents. Konkrete Video-Inhalte nicht dokumentiert (kein Transcript verfügbar, ⚠️ Metadata-only). Rohdaten: raw/youtube/2026-08-21_deepseek-harness-end-of-coding-agents.md.
Update 23.08.2026 (Speed vs Polish Vergleich): X-Post von ../../people/julian-goldie.md (DeepSeek Harness vs Claude Code) → Raw-Datei. Derselbe Prompt ("build a 3D animated website + working Tetris game") lieferte: Harness 11 min (funktional, "cartoony") vs Claude Code 30 min (polierter, Animationen folgen Maus). Token: Harness/DeepSeek verbrannte 483K, Claude nur 48K ("redet 10× mehr mit sich selbst"). Adoption: Harness 95.000 GitHub-Stars in 2 Tagen (inzwischen 112–116K — schnellstes Star-Wachstum, das GitHub je sah). Der Twist: Harness kann Claude Code INSIDE als Sub-Agent mounten — "You don't pick a side. Free harness as the shell, whichever brain fits each task. One harness, many brains." → Orchestrierungs-These statt Modell-Wahl, vergleichbar mit Hermes MoA (../llm/llm-model-fusion-ensembles.md). Achtung Token-Verhältnis 483K vs 48K ist bemerkenswert — DeepSeek neigt stark zu Reasoning/Self-Talk.
Update 02.09.2026 (3. Blickwinkel): Video von WorldofAI (@intheworldofai) — "NEW DeepSeek Harness Is The Claude Code & Codex Killer? (Open Source)" (https://www.youtube.com/watch?v=RWp5cejTApU), geteilt von Netbits (@NetLightning) in OME Topic "News & Infos". Laut Titel bewertet das Video den Harness als potenziellen Konkurrenten zu Claude Code und Codex — erweitert den Vergleich damit um OpenAI/Codex. Konkrete Video-Inhalte nicht dokumentiert (kein Transcript verfügbar, ⚠️ Metadata-only). Rohdaten: raw/youtube/2026-09-02_worldofai-deepseek-harness-claude-code-codex-killer.md.
Update 02.09.2026 (DSH-Details, Second-hand): HermanButlerBot fasste den Video-Inhalt zusammen (OME „News & Infos", 02.09.2026): DSH sei ein modularer Developer-Preview unter MIT-Lizenz mit ~122k GitHub-Stars in wenigen Tagen; Kernphilosophie „Everything is a Plugin" (Cordis-Meta-Framework) — Modelle, Tools, Skills, Sessions, Sandboxes, Filesystem, Agent-Loops, sogar UI austauschbar; ~4.700 Community-Plugins. Trajectory-View (Event-History aller Agent-Aktionen: Prompts, Tool-Calls, Terminal-Output, Sub-Agents — resume/fork/replay/debug), Web-UI als Remote-Feature (Agent auf Hauptrechner, Steuerung vom Handy/Laptop, wie Claude Code Remote), Custom Provider inkl. lokaler Modelle (z.B. 0.7B). Demos laut Beitrag: 3D-Mechanik-Uhr (Three.js) mit V4 Flash High in ~30–40 Min, 4-Zylinder-Motorsim mit V4 Pro in wenigen Minuten. Install: Node.js + npx. ⚠️ Warnung des Beitrags: Plugin-Community unverifiziert — vor Installation vetten (Malware/Data-Stealing-Risiko); Vergleich zu OpenClaw 2.0-Provenance-Warnings. Zahlen (~122k Stars, ~4.700 Plugins, Demo-Zeiten) sind Second-hand und nicht unabhängig verifiziert. Rohdaten: raw/other/2026-09-02_herman-deepseek-harness-dsh-summary.md.
Update 10.09.2026 (V4.1 Flash, offizielles Release): DeepSeek kündigte DeepSeek-V4.1-Flash offiziell an (X-Post @deepseek_ai, https://x.com/deepseek_ai/status/2097930608790167907 + API-Docs https://api-docs.deepseek.com/news/news260910) — das kleinste Modell einer neuen Architektur-Familie mit nativem visuellen Verständnis. V4.1-Flash übertrifft laut DeepSeek V4-Pro bei Performance, Kosten, Speed und Gesamtlaufzeit; V4-Pro wird ab 04:00 UTC, 14.09.2026 auf V4.1-Flash geroutet (bis V4.1-Pro launcht). V4-Flash & V4-Flash-Vision-Exp sind retired. Details: deepseek-v4.1-flash.md. Rohdaten: raw/xpost/2026-09-10_deepseek-v41-flash-official-release.md, raw/other/2026-09-10_deepseek-v41-flash-official-announcement.md. Hinweis: V4.1 Flash ist eine neue Modell-Version gegenüber dem V4-Flash im aktiven Stack (../../tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md).
Update 10.09.2026 (V4.1 Flash, AICodeKing-Review, Metadata-only): Video von ../../people/aicodeking.md — "Deepseek V4.1 Flash (Fully Tested): 200 TPS & Beats Astra!? (+New Architecture Overview)" (https://www.youtube.com/watch?v=lpC5X6o3VJE), OME Topic 13. Laut Titel ein "Fully Tested"-Review eines DeepSeek V4.1 Flash-Modells mit behaupteten 200 TPS, einem Benchmark-Vergleich gegen Astra (Fragezeichen im Titel = unbestätigt) und einem Architektur-Überblick. Konkrete Benchmark-Methodik, Architektur-Details und Ergebnisse nicht dokumentiert (kein Transcript verfügbar, ⚠️ Metadata-only). Rohdaten: raw/youtube/2026-09-10_deepseek-v41-flash-aicodeking.md. Die offizielle Ankündigung (s.o.) bestätigt die neue Architektur-Familie; die Review-Claims (200 TPS, schlägt Astra) bleiben unverifiziert.
⚠️ Kritik (verifiziert durch Herman, 23.08.2026): Der Vergleich ist ein Kategorienfehler. "Harness vs Claude Code" ist nicht Framework-vs-Framework, sondern DeepSeek V4 Pro (im Harness) vs. Claude (in Claude Code) — "cartoony vs. polished" ist die Modell-Differenz, nicht das Framework. Gleiche Modelle im selben Harness würden die Reihenfolge kippen. Der 483K-vs-48K-Token-Unterschied ist kein Bug, sondern DeepSeek-Design: langes Chain-of-Thought. Harness selbst (MIT, TypeScript, "everything is a plugin": Modell-Adapter, Tool-Registry, Sandbox, Agent-Loop) ist modell-agnostisch und real verifiziert. Einordnung von Herman: "Interessant für Bastler (Plugin-Architektur, Agent-in-Agent), aber 'besser als Claude Code' ist nicht belegt — es ist ein anderer Hirn im gleichen Werkzeugkoffer."
Einordnung in die chinesische Open-Weight-Welle
| Datum | Release | Anbieter |
|---|---|---|
| 13.08.2026 | DeepSeek V4-Pro GA + Harness v0.1 | DeepSeek |
| 10.09.2026 | DeepSeek V4.1-Flash Release (neue Architektur-Familie) | DeepSeek (deepseek-v4.1-flash.md) |
| 14.08.2026 | GLM-5.3 Review (AICodeKing Bench #1) | Z.ai (glm-5.3-z-ai.md) |
| 14.08.2026 | Qwen3.8-27B Release | Alibaba (qwen3.8-27b-alibaba.md) |
Drei chinesische Ankündigungen in ~24h — DeepSeek, Z.ai und Alibaba liefern im Wochenrhythmus (../chinese-ai-wave-july-2026.md).
Relevanz für Hectors Stack
- DeepSeek im Setup:
ollama/deepseek-v4-pro:cloud(DRACO-Solo 60.3%) undollama/deepseek-v4-flash:cloudals Fallback — siehe ../../tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md - Reasoning-Effort low/high/max — direkt kompatibel mit dem Barbell-5-Tier-Routing (../../architecture/model-routing.md)
- OpenAI-Responses-API + Codex-Optimierung: DeepSeek zielt auf die OpenAI/Anthropic-Entwickler-Ökosysteme — erhöht den Wettbewerbsdruck auf US-Labore
Offene Punkte
- ⚠️ Perplexity-Discovery-Inhalt nicht direkt abrufbar — über Web-Suche + offizielle Docs rekonstruiert. Konkrete Harness-Features (GitHub-Repo, Tooling-Umfang, Benchmark-Grundlage von AICodeKing) bei Gelegenheit am Original verifizieren.