63 lines
3.5 KiB
Markdown
63 lines
3.5 KiB
Markdown
---
|
|
created: 2026-08-15
|
|
updated: 2026-08-15
|
|
sources: [other/2026-08-15_deepseek-v4-pro-environment-recognition.md]
|
|
tags: [concept, llm, deepseek, deepseek-v4-pro, environment-recognition, first-request, agent-scaffold, rl-composition, cot-fingerprint, reasoning, chinese-ai]
|
|
---
|
|
|
|
# DeepSeek-V4-Pro: Umgebungs-Erkennung statt 3 Modelle
|
|
|
|
> **Quelle:** Leak aus der chinesischen Community, diskutiert auf [r/DeepSeek](https://www.reddit.com/r/DeepSeek/comments/1votndx/down_the_rabbit_hole_of_deepseekv4pro0813/) ("Down the rabbit hole of deepseek-v4-pro/0813"), OME-Gruppe Topic "Hermès Agents" → [Raw-Datei](../../../raw/other/2026-08-15_deepseek-v4-pro-environment-recognition.md)
|
|
|
|
## Ausgangsbeobachtung: 3 CoT-Fingerprints
|
|
|
|
Die API hinter `deepseek-v4-pro` zeigt angeblich **3 CoT-Fingerprints** (Anfangsphrasen im Chain-of-Thought):
|
|
|
|
| CoT-Fingerprint (Anfangsphrase) | Interpretiert als |
|
|
|--------------------------------|-------------------|
|
|
| "Let me..." | ≈ V4 Pro Preview |
|
|
| "The user wants me..." | ≈ V4 Flash |
|
|
| "We..." | "God-tier" |
|
|
|
|
Naiver Schluss: 3 verschiedene Modelle hinter der API. Das ist die Oberflächen-Hypothese.
|
|
|
|
## Zwei-Layer-Hypothese: 1 Modell, RL-Verteilungs-Shift
|
|
|
|
Die zentrale Analyse-Hypothese: Es sind **NICHT 3 separate Checkpoints**, sondern **1 Modell mit RL-Verteilungs-Shift** (Reinforcement-Learning-Verteilungsverschiebung). Ein einziges Modell, dessen Verhalten je nach Inferenz-Umgebung in verschiedene Modi kippt.
|
|
|
|
## Stärkster Beweis: Anchored-Standard-Experiment
|
|
|
|
- **98/99 mit vollem 25-Tool-Toolset**
|
|
- **Nur der erste Request war minimal**
|
|
|
|
Wäre es wirklich 3 getrennte Modelle, dürfte dieser Effekt nicht auftreten — das volle Toolset über den ersten Request hinweg würde bei Modell-Splitting nicht konsistent abschneiden.
|
|
|
|
## Kern-Insight: DER ERSTE REQUEST entscheidet
|
|
|
|
> **System-Prompt, Tool-Schema, Agent-Scaffold beim ersten Token bestimmen, ob das Modell in seiner Trainings-Verteilung arbeitet.**
|
|
|
|
Modelle, die mit einem bestimmten **Agent-Scaffold** trainiert wurden, performen schlechter bei **abweichender Inferenz-Umgebung**. Das wird gestützt durch den Commit im Harness-Repo (10.08.): *"align minimal agent with RL composition"*.
|
|
|
|
## Ehrliche Kante
|
|
|
|
Verhaltens-Fingerprints sind **Indizien, keine Beweise**. Die 3-CoT-Diagnose ist eine plausible Beobachtung, keine verifizierte Architektur-Beschreibung.
|
|
|
|
## Relevanz für Hectors Setup
|
|
|
|
Direkter Bezug zu unserem `ollama/deepseek-v4-flash:0731`-Setup: Wenn der **erste Request** (System-Prompt, Tool-Schema, Agent-Scaffold) bestimmt, ob das Modell in seiner Trainings-Verteilung arbeitet, dann ist der **Agent-Harness-Setup beim ersten Token kritisch** für die Antwortqualität.
|
|
|
|
Das hat direkte Konsequenzen für das [[../../tools/model-routing.md|Model-Routing]]: Routen wir einen Task an DeepSeek, muss der System-Prompt/Tool-Scaffold konsistent zur Trainings-Umgebung sein, sonst arbeiten wir außerhalb der Verteilung.
|
|
|
|
## Verwandte Konzepte
|
|
|
|
- [[deepseek-v4-pro-ga-harness-open-source.md]] — DeepSeek V4-Pro GA + Harness v0.1 (Open Source)
|
|
- [[llm-model-catalog.md]] — Modell-Katalog
|
|
- [[llm-behavior-persistence.md]] — LLM-Verhaltens-Persistenz
|
|
- [[../../tools/model-routing.md]] — Model-Routing (Cost-Saving Patterns)
|
|
- [[../../architecture/model-routing.md]] — Barbell-5-Tier-Routing
|
|
|
|
## Cross-References
|
|
|
|
- [[chinese-model-cost-routing.md]] — 87% Cost-Cut Playbook
|
|
- [[chinese-models-top-usage-charts.md]] — Chinesische Modelle dominieren Usage-Charts
|
|
- [[deepseek-v4-pro-ga-harness-open-source.md]] — Harness-Repo-Kontext
|