knowledge-base/raw/other/2026-08-15_deepseek-v4-pro-environment-recognition.md

2.9 KiB

type source_url resource_type title vendor retrieved has_transcript tags
other https://www.reddit.com/r/DeepSeek/comments/1votndx/down_the_rabbit_hole_of_deepseekv4pro0813/ reddit DeepSeek-V4-Pro — Umgebungs-Erkennung statt 3 Modelle (r/DeepSeek) DeepSeek 2026-08-15 false
deepseek
deepseek-v4-pro
deepseek-v4-flash
environment-recognition
first-request
agent-scaffold
rl-composition
cot-fingerprint
reasoning
chinese-ai
harness

DeepSeek-V4-Pro: Umgebungs-Erkennung statt 3 Modelle (r/DeepSeek, Leak)

Kontext

Leak aus der chinesischen Community, diskutiert auf r/DeepSeek ("Down the rabbit hole of deepseek-v4-pro/0813"). Die API hinter deepseek-v4-pro verbirgt angeblich 3 Modelle, erkennbar an 3 CoT-Fingerprints:

CoT-Fingerprint (Anfangsphrase) Interpretiert als
"Let me..." ≈ V4 Pro Preview
"The user wants me..." ≈ V4 Flash
"We..." "God-tier"

Zwei-Layer-Hypothese

Die zentrale Analyse-Hypothese: Es sind NICHT 3 separate Checkpoints, sondern 1 Modell mit RL-Verteilungs-Shift (Reinforcement-Learning-Verteilungsverschiebung). Ein einziges Modell, dessen Verhalten je nach Inferenz-Umgebung in verschiedene Modi kippt.

Stärkster Beweis: Anchored-Standard-Experiment

  • 98/99 mit vollem 25-Tool-Toolset
  • Nur der erste Request war minimal
  • Wäre es wirklich 3 getrennte Modelle, dürfte dieser Effekt nicht auftreten — das volle Toolset über den ersten Request hinweg würde bei Modell-Splitting nicht konsistent abschneiden.

Kern-Insight: DER ERSTE REQUEST entscheidet

Modelle, die mit einem bestimmten Agent-Scaffold trainiert wurden, performen schlechter bei abweichender Inferenz-Umgebung. Konkret:

System-Prompt, Tool-Schema, Agent-Scaffold beim ersten Token bestimmen, ob das Modell in seiner Trainings-Verteilung arbeitet.

Dies wird gestützt durch den Commit im Harness-Repo (10.08.): "align minimal agent with RL composition".

Ehrliche Kante

Verhaltens-Fingerprints sind Indizien, keine Beweise. Die 3-CoT-Diagnose ist eine plausible Beobachtung, keine verifizierte Architektur-Beschreibung.

Relevanz für Hectors Setup

Direkter Bezug zu unserem ollama/deepseek-v4-flash:0731-Setup: Wenn der erste Request (System-Prompt, Tool-Schema, Agent-Scaffold) bestimmt, ob das Modell in seiner Trainings-Verteilung arbeitet, dann ist der Agent-Harness-Setup beim ersten Token kritisch für die Qualität.

Cross-References