knowledge-base/wiki/concepts/world-model-rl-training.md
Hector 4302e76175 ingest(raw/blog): binaryverseai-qwen-agentworld — AgentWorldBench scores, CPT/SFT/RL pipeline, 7 domains
wiki-update(concepts): world-model-rl-training.md augmented with benchmark table, training pipeline detail, GUI text representation, model variants

- raw: raw/blog/2026-06-25_binaryverseai-qwen-agentworld.md (new)
- wiki: concepts/world-model-rl-training.md (augmented — new sections: Training Pipeline, 7 Domains, AgentWorldBench, Modell-Varianten, GUI text representation)
- wiki: index.md (34. Update, World-Models row updated, new raw source)
- wiki: log.md (new entry)
2026-06-25 20:48:54 +02:00

9.9 KiB
Raw Blame History

created updated sources tags
2026-06-25 2026-06-25
youtube/2026-06-25_qwen-agentworld-world-model-rl.md
blog/2026-06-25_binaryverseai-qwen-agentworld.md
concept
world-models
rl
reinforcement-learning
agent-training
hallucinated-environments
qwen
synthetic-data
agi
agentworldbench
mcp
gui-automation

World Models for RL Training — Qwen-AgentWorld

Stand: 2026-06-25. Quellen: Sam Witteveen YouTube-Video „Qwen-AgentWorld: The World Model for RL Environments" (16:31, 2026-06-25) + BinaryVerse AI Blog „Qwen AgentWorld Explained: Predict Before Agents Act" (2026-06-25).

Kernidee

Qwen-AgentWorld (Alibaba/QwenLM) ist ein Language World Model — kein Chatbot. Es sagt den nächsten Umgebungs-Zustand nach einer Agenten-Aktion voraus. Normal LLM fragt „Was soll ich sagen oder tun?" → Qwen AgentWorld fragt „Wenn der Agent das tut, was wird die Welt zurückgeben?"

Es ist ein Weltmodell, das RL-Umgebungen halluziniert — anstatt Agenten in realen Umgebungen zu trainieren, generiert das Weltmodell synthetische Trainingsumgebungen. Agenten, die in diesen hallucinated environments trainiert wurden, schlagen Agenten, die in realen RL-Umgebungen trainiert wurden — auf der eigenen Benchmark des Teams, und auch beim Vergleich mit GPT-5.4 und Claude.

Pipeline

Weltmodell halluciniert Umgebung
        ↓
Agent trainiert in hallucinated environment
        ↓
Agent schlägt real-world RL training

Dies ist eine dritte Trainingsschiene jenseits der klassischen dichotomie:

  1. RLHF/RLAIF — Agent lernt aus menschlichem/AI-Feedback
  2. Self-Play — Agent lernt durch Spielen gegen sich selbst (AlphaGo, Dota-OpenAI)
  3. Hallucinated Environment Training (neu) — Agent lernt in einer vom Weltmodell generierten Simulation

Training Pipeline — „CPT injects, SFT activates, RL sharpens"

Qwen-AgentWorld wird in drei Phasen trainiert:

1. Continual Pre-Training (CPT) — injects environment knowledge

  • Ziel: Umgebungs-Wissen in das Modell injizieren. Das Modell lernt die Struktur und Dynamik der 7 Domänen (MCP, Search, Terminal, SWE, Web, OS, Android).
  • Daten: 10M+ reale Interaktions-Trajektorien aus echten Umgebungen.

2. Supervised Fine-Tuning (SFT) — activates next-state prediction

  • Ziel: Das Modell lernt, den nächsten Beobachtungs-Zustand vorherzusagen, gegeben eine Interaktions-Historie und eine Agenten-Aktion.
  • Paradigma-Wechsel: Das Modell wird vom Aktions-Generator zum Umgebungs-Simulator.

3. Reinforcement Learning (RL) — sharpens simulation fidelity

  • Ziel: Die Simulations-Genauigkeit wird durch RL weiter geschärft. Das Modell lernt, präzisere und nützlichere Welt-Zustände zu generieren.

Core Loop

Interaktions-Historie → Agenten-Aktion → Modell sagt nächsten Beobachtungs-Zustand voraus
    → Verwendung für: Evaluation / Planning / RL-Training

7 Domänen

Qwen-AgentWorld deckt sieben Agenten-Umgebungen ab:

Domäne Beschreibung Repräsentation
MCP Model Context Protocol Strukturierter Text
Search Web-Suche Strukturierter Text
Terminal Kommandozeile Strukturierter Text
SWE Software Engineering Strukturierter Text
Web Browser/GUI HTML
OS Betriebssystem/GUI Accessibility Trees
Android Mobile GUI XML-Layouts

GUI-Domänen: Strukturierte Text-Repräsentation, keine Pixel

Für die GUI-Domänen (Web, OS, Android) verwendet Qwen-AgentWorld keine rohen Pixel-Bilder, sondern strukturierte Text-Repräsentationen (HTML, Accessibility Trees, XML). Dies ist eine bewusste Design-Entscheidung: Text-Repräsentationen sind kompakter, deterministischer und lassen sich besser in einem Language World Model verarbeiten als Pixel-Arrays. Das Modell bleibt im Sprachraum — es „sieht" die GUI als strukturierten Text, nicht als Bild.

Modell-Varianten

Variante Parameter Typ
Qwen-AgentWorld-35B-A3B 35B total, 3B active (MoE) Open Weights
Qwen-AgentWorld-397B-A17B 397B total, 17B active (MoE) Research-only

Beide sind Mixture-of-Experts (MoE) Architekturen — die active-parameter-Counts (3B bzw. 17B) zeigen, dass bei Inference nur ein Bruchteil der Parameter aktiviert wird.

AgentWorldBench — Benchmark-Ergebnisse

Die AgentWorldBench misst, wie gut ein Modell den nächsten Umgebungs-Zustand nach einer Agenten-Aktion vorhersagt. Höher = bessere Welt-Simulation.

Modell Overall Score
Qwen-AgentWorld-397B-A17B (research) 58.71
GPT-5.4 58.25
Claude Opus 4.8 56.59
Qwen-AgentWorld-35B-A3B (open weights) 56.39
Claude Sonnet 4.6 56.04
Qwen3.5-35B-A3B (baseline, kein World-Model-Training) 47.73

Key Observations:

  • Das 397B-Research-Modell schlägt GPT-5.4 knapp (+0.46 Punkte).
  • Das offene 35B-Modell schlägt Claude Sonnet 4.6 (+0.35 Punkte) und liegt nah an Claude Opus 4.8 (0.20 Punkte).
  • Qwen3.5-35B-A3B (ohne World-Model-Training) fällt auf 47.73 ab — 8.66 Punkte hinter der open-weights AgentWorld-Variante. Das zeigt, dass der AgentWorld-Training-Pipeline den größten Teil des Gewinns liefert, nicht nur die Modellgröße.

Warum es bedeutsam ist

1. Weltmodelle als Trainings-Infrastruktur

Bisher: Weltmodelle (VEO, JEPA) wurden primär als Komponente des AGI-Pfads diskutiert — als Verständnis-Engine, die Physik, Kausalität, Objektpermanenz lernt (siehe world-models-jepa-vs-generative.md).

Qwen-AgentWorld dreht das um: Das Weltmodell ist nicht das zu trainierende Subjekt, sondern die Trainingsumgebung. Es generiert Erfahrungen für andere Agenten — eine völlig andere Anwendung desselben Konzepts.

2. Skalierbarkeit von RL-Training

Real-world RL-Umgebungen sind teuer: sie erfordern simulierte Physik-Engines, definierte Reward-Funktionen und unzählige Episoden. Wenn ein Weltmodell diese Umgebungen halluzinieren kann, wird RL-Training so billig wie Inference — das Weltmodell generiert unendlich viele Umgebungen bei marginalen Kosten.

3. Fine-Tuning für spezifische Aufgaben

Der Ansatz erlaubt task-spezifische Umgebungsgenerierung: statt eine allgemeine RL-Benchmark zu bauen, kann das Weltmodell eine Umgebung generieren, die genau auf die gewünschte Fähigkeit zugeschnitten ist. Dies könnte eine neue Form des Fine-Tuning werden — eine Alternative zu SFT und RLHF für domänenspezifische Modelle.

4. Beziehung zu Synthetic Data und Self-Play

Qwen-AgentWorld steht im Kontext weiterer Trends:

Ansatz Was wird synthetisiert Lernsignal
Synthetic Data (SFT) Trainingsbeispiele Imitation
Self-Play Gegner Win/Loss
Constitutional AI Verfassung/Regeln Kritik-Feedback
Hallucinated Environments RL-Umgebung Reward in generierter Sim

Die Erkenntnis, dass Agenten aus hallucinated environments echte RL-Agenten schlagen, deutet darauf hin, dass die generierte Umgebung relevantere Trainings-Signale enthält als die echte Umgebung — möglicherweise, weil das Weltmodell schwierige/kritische Szenarien gezielt generieren kann (Curriculum Learning durch Halluzination).

Einordnung in die Weltmodell-Debatte

Dimension JEPA (LeCun) Generativ (Hassabis) Qwen-AgentWorld
Ziel Welt-Verständnis Welt-Generation Welt-Simulation für Training
Output Embeddings Pixel/Video RL-Umgebungen
Nutzung Reasoning/Planning Video-Generation Agent-Training
Evaluation Downstream-Tasks „Schau das Video" Agent-Performance in real RL

Qwen-AgentWorld ist orthogonal zur JEPA-vs-Generativ-Debatte: es geht um die Anwendung eines Weltmodells (Trainingsumgebung generieren), nicht um die Architektur des Weltmodells. Das Qwen-Team hat nicht öffentlich spezifiziert, ob AgentWorld ein generatives oder JEPA-artiges Modell ist.

Beziehung zu AGI-Pfaden

  • Aschenbrenner-These (../agi/aschenbrenner-situational-awareness.md): „The Project" skaliert Compute für AR-LLMs. Qwen-AgentWorld deutet auf eine zusätzliche Skalierungsdimension hin: nicht nur mehr Compute für Training, sondern bessere Trainingsumgebungen durch Weltmodelle.
  • DeepMind-Strategie (../../architecture/deepmind-beyond-transformer.md): DeepMind investiert in Weltmodelle als AGI-Komponente. Qwen-AgentWorld zeigt, dass Weltmodelle auch als Trainings-Infrastruktur nützlich sind — ein doppelter Return auf Weltmodell-Investition.

Offene Fragen

  1. Welche Art von Weltmodell ist AgentWorld? (Generativ, JEPA, hybrid?)
  2. Wie wird verhindert, dass das Weltmodell unrealistische Umgebungen generiert? (Reward-Hacking in der Simulation)
  3. Generalisierung: Funktioniert dies für beliebige RL-Domänen (Robotik, Atari, Multi-Agent)?
  4. Open-Source-Effekt: GitHub-Repo und HuggingFace-Collection sind verfügbar — wie schnell wird dies adaptiert?

Externe Primärquellen

Verwandte Wiki-Seiten

  • [[world-models-jepa-vs-generative.md]] — JEPA vs. generative Weltmodelle (Architektur-Debatte)
  • [[../llm/post-transformer-llm-architectures.md]] — Post-Transformer-Architekturen inkl. Weltmodell-Sektion
  • [[../llm/llm-model-catalog.md]] — Qwen-Modelle im Katalog
  • [[../../architecture/deepmind-beyond-transformer.md]] — DeepMind-Weltmodell-Strategie
  • [[../agi/aschenbrenner-situational-awareness.md]] — AGI-Compute-Skalierung