knowledge-base/wiki/concepts/llm/deepseek-environment-recognition.md

3.5 KiB

created updated sources tags
2026-08-15 2026-08-15
other/2026-08-15_deepseek-v4-pro-environment-recognition.md
concept
llm
deepseek
deepseek-v4-pro
environment-recognition
first-request
agent-scaffold
rl-composition
cot-fingerprint
reasoning
chinese-ai

DeepSeek-V4-Pro: Umgebungs-Erkennung statt 3 Modelle

Quelle: Leak aus der chinesischen Community, diskutiert auf r/DeepSeek ("Down the rabbit hole of deepseek-v4-pro/0813"), OME-Gruppe Topic "Hermès Agents" → Raw-Datei

Ausgangsbeobachtung: 3 CoT-Fingerprints

Die API hinter deepseek-v4-pro zeigt angeblich 3 CoT-Fingerprints (Anfangsphrasen im Chain-of-Thought):

CoT-Fingerprint (Anfangsphrase) Interpretiert als
"Let me..." ≈ V4 Pro Preview
"The user wants me..." ≈ V4 Flash
"We..." "God-tier"

Naiver Schluss: 3 verschiedene Modelle hinter der API. Das ist die Oberflächen-Hypothese.

Zwei-Layer-Hypothese: 1 Modell, RL-Verteilungs-Shift

Die zentrale Analyse-Hypothese: Es sind NICHT 3 separate Checkpoints, sondern 1 Modell mit RL-Verteilungs-Shift (Reinforcement-Learning-Verteilungsverschiebung). Ein einziges Modell, dessen Verhalten je nach Inferenz-Umgebung in verschiedene Modi kippt.

Stärkster Beweis: Anchored-Standard-Experiment

  • 98/99 mit vollem 25-Tool-Toolset
  • Nur der erste Request war minimal

Wäre es wirklich 3 getrennte Modelle, dürfte dieser Effekt nicht auftreten — das volle Toolset über den ersten Request hinweg würde bei Modell-Splitting nicht konsistent abschneiden.

Kern-Insight: DER ERSTE REQUEST entscheidet

System-Prompt, Tool-Schema, Agent-Scaffold beim ersten Token bestimmen, ob das Modell in seiner Trainings-Verteilung arbeitet.

Modelle, die mit einem bestimmten Agent-Scaffold trainiert wurden, performen schlechter bei abweichender Inferenz-Umgebung. Das wird gestützt durch den Commit im Harness-Repo (10.08.): "align minimal agent with RL composition".

Ehrliche Kante

Verhaltens-Fingerprints sind Indizien, keine Beweise. Die 3-CoT-Diagnose ist eine plausible Beobachtung, keine verifizierte Architektur-Beschreibung.

Relevanz für Hectors Setup

Direkter Bezug zu unserem ollama/deepseek-v4-flash:0731-Setup: Wenn der erste Request (System-Prompt, Tool-Schema, Agent-Scaffold) bestimmt, ob das Modell in seiner Trainings-Verteilung arbeitet, dann ist der Agent-Harness-Setup beim ersten Token kritisch für die Antwortqualität.

Das hat direkte Konsequenzen für das ../../tools/model-routing.md: Routen wir einen Task an DeepSeek, muss der System-Prompt/Tool-Scaffold konsistent zur Trainings-Umgebung sein, sonst arbeiten wir außerhalb der Verteilung.

Verwandte Konzepte

Cross-References