3.5 KiB
| created | updated | sources | tags | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-08-15 | 2026-08-15 |
|
|
DeepSeek-V4-Pro: Umgebungs-Erkennung statt 3 Modelle
Quelle: Leak aus der chinesischen Community, diskutiert auf r/DeepSeek ("Down the rabbit hole of deepseek-v4-pro/0813"), OME-Gruppe Topic "Hermès Agents" → Raw-Datei
Ausgangsbeobachtung: 3 CoT-Fingerprints
Die API hinter deepseek-v4-pro zeigt angeblich 3 CoT-Fingerprints (Anfangsphrasen im Chain-of-Thought):
| CoT-Fingerprint (Anfangsphrase) | Interpretiert als |
|---|---|
| "Let me..." | ≈ V4 Pro Preview |
| "The user wants me..." | ≈ V4 Flash |
| "We..." | "God-tier" |
Naiver Schluss: 3 verschiedene Modelle hinter der API. Das ist die Oberflächen-Hypothese.
Zwei-Layer-Hypothese: 1 Modell, RL-Verteilungs-Shift
Die zentrale Analyse-Hypothese: Es sind NICHT 3 separate Checkpoints, sondern 1 Modell mit RL-Verteilungs-Shift (Reinforcement-Learning-Verteilungsverschiebung). Ein einziges Modell, dessen Verhalten je nach Inferenz-Umgebung in verschiedene Modi kippt.
Stärkster Beweis: Anchored-Standard-Experiment
- 98/99 mit vollem 25-Tool-Toolset
- Nur der erste Request war minimal
Wäre es wirklich 3 getrennte Modelle, dürfte dieser Effekt nicht auftreten — das volle Toolset über den ersten Request hinweg würde bei Modell-Splitting nicht konsistent abschneiden.
Kern-Insight: DER ERSTE REQUEST entscheidet
System-Prompt, Tool-Schema, Agent-Scaffold beim ersten Token bestimmen, ob das Modell in seiner Trainings-Verteilung arbeitet.
Modelle, die mit einem bestimmten Agent-Scaffold trainiert wurden, performen schlechter bei abweichender Inferenz-Umgebung. Das wird gestützt durch den Commit im Harness-Repo (10.08.): "align minimal agent with RL composition".
Ehrliche Kante
Verhaltens-Fingerprints sind Indizien, keine Beweise. Die 3-CoT-Diagnose ist eine plausible Beobachtung, keine verifizierte Architektur-Beschreibung.
Relevanz für Hectors Setup
Direkter Bezug zu unserem ollama/deepseek-v4-flash:0731-Setup: Wenn der erste Request (System-Prompt, Tool-Schema, Agent-Scaffold) bestimmt, ob das Modell in seiner Trainings-Verteilung arbeitet, dann ist der Agent-Harness-Setup beim ersten Token kritisch für die Antwortqualität.
Das hat direkte Konsequenzen für das ../../tools/model-routing.md: Routen wir einen Task an DeepSeek, muss der System-Prompt/Tool-Scaffold konsistent zur Trainings-Umgebung sein, sonst arbeiten wir außerhalb der Verteilung.
Verwandte Konzepte
- deepseek-v4-pro-ga-harness-open-source.md — DeepSeek V4-Pro GA + Harness v0.1 (Open Source)
- llm-model-catalog.md — Modell-Katalog
- llm-behavior-persistence.md — LLM-Verhaltens-Persistenz
- ../../tools/model-routing.md — Model-Routing (Cost-Saving Patterns)
- ../../architecture/model-routing.md — Barbell-5-Tier-Routing
Cross-References
- chinese-model-cost-routing.md — 87% Cost-Cut Playbook
- chinese-models-top-usage-charts.md — Chinesische Modelle dominieren Usage-Charts
- deepseek-v4-pro-ga-harness-open-source.md — Harness-Repo-Kontext