knowledge-base/wiki/concepts/world-model-rl-training.md
Hector 4302e76175 ingest(raw/blog): binaryverseai-qwen-agentworld — AgentWorldBench scores, CPT/SFT/RL pipeline, 7 domains
wiki-update(concepts): world-model-rl-training.md augmented with benchmark table, training pipeline detail, GUI text representation, model variants

- raw: raw/blog/2026-06-25_binaryverseai-qwen-agentworld.md (new)
- wiki: concepts/world-model-rl-training.md (augmented — new sections: Training Pipeline, 7 Domains, AgentWorldBench, Modell-Varianten, GUI text representation)
- wiki: index.md (34. Update, World-Models row updated, new raw source)
- wiki: log.md (new entry)
2026-06-25 20:48:54 +02:00

170 lines
No EOL
9.9 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-06-25
updated: 2026-06-25
sources:
- youtube/2026-06-25_qwen-agentworld-world-model-rl.md
- blog/2026-06-25_binaryverseai-qwen-agentworld.md
tags: [concept, world-models, rl, reinforcement-learning, agent-training, hallucinated-environments, qwen, synthetic-data, agi, agentworldbench, mcp, gui-automation]
---
# World Models for RL Training — Qwen-AgentWorld
> **Stand:** 2026-06-25. Quellen: Sam Witteveen YouTube-Video „Qwen-AgentWorld: The World Model for RL Environments" (16:31, 2026-06-25) + BinaryVerse AI Blog „Qwen AgentWorld Explained: Predict Before Agents Act" (2026-06-25).
## Kernidee
**Qwen-AgentWorld** (Alibaba/QwenLM) ist ein **Language World Model** — kein Chatbot. Es sagt den nächsten Umgebungs-Zustand nach einer Agenten-Aktion voraus. Normal LLM fragt „Was soll ich sagen oder tun?" → Qwen AgentWorld fragt „Wenn der Agent das tut, was wird die Welt zurückgeben?"
Es ist ein Weltmodell, das RL-Umgebungen **halluziniert** — anstatt Agenten in realen Umgebungen zu trainieren, generiert das Weltmodell synthetische Trainingsumgebungen. Agenten, die in diesen hallucinated environments trainiert wurden, **schlagen Agenten, die in realen RL-Umgebungen trainiert wurden** — auf der eigenen Benchmark des Teams, und auch beim Vergleich mit **GPT-5.4 und Claude**.
## Pipeline
```
Weltmodell halluciniert Umgebung
Agent trainiert in hallucinated environment
Agent schlägt real-world RL training
```
Dies ist eine **dritte Trainingsschiene** jenseits der klassischen dichotomie:
1. **RLHF/RLAIF** — Agent lernt aus menschlichem/AI-Feedback
2. **Self-Play** — Agent lernt durch Spielen gegen sich selbst (AlphaGo, Dota-OpenAI)
3. **Hallucinated Environment Training** (neu) — Agent lernt in einer vom Weltmodell generierten Simulation
## Training Pipeline — „CPT injects, SFT activates, RL sharpens"
Qwen-AgentWorld wird in drei Phasen trainiert:
### 1. Continual Pre-Training (CPT) — injects environment knowledge
- **Ziel:** Umgebungs-Wissen in das Modell injizieren. Das Modell lernt die Struktur und Dynamik der 7 Domänen (MCP, Search, Terminal, SWE, Web, OS, Android).
- **Daten:** 10M+ reale Interaktions-Trajektorien aus echten Umgebungen.
### 2. Supervised Fine-Tuning (SFT) — activates next-state prediction
- **Ziel:** Das Modell lernt, den *nächsten Beobachtungs-Zustand* vorherzusagen, gegeben eine Interaktions-Historie und eine Agenten-Aktion.
- **Paradigma-Wechsel:** Das Modell wird vom Aktions-Generator zum Umgebungs-Simulator.
### 3. Reinforcement Learning (RL) — sharpens simulation fidelity
- **Ziel:** Die Simulations-Genauigkeit wird durch RL weiter geschärft. Das Modell lernt, präzisere und nützlichere Welt-Zustände zu generieren.
### Core Loop
```
Interaktions-Historie → Agenten-Aktion → Modell sagt nächsten Beobachtungs-Zustand voraus
→ Verwendung für: Evaluation / Planning / RL-Training
```
## 7 Domänen
Qwen-AgentWorld deckt sieben Agenten-Umgebungen ab:
| Domäne | Beschreibung | Repräsentation |
|--------|-------------|----------------|
| **MCP** | Model Context Protocol | Strukturierter Text |
| **Search** | Web-Suche | Strukturierter Text |
| **Terminal** | Kommandozeile | Strukturierter Text |
| **SWE** | Software Engineering | Strukturierter Text |
| **Web** | Browser/GUI | HTML |
| **OS** | Betriebssystem/GUI | Accessibility Trees |
| **Android** | Mobile GUI | XML-Layouts |
### GUI-Domänen: Strukturierte Text-Repräsentation, keine Pixel
Für die GUI-Domänen (Web, OS, Android) verwendet Qwen-AgentWorld **keine rohen Pixel-Bilder**, sondern strukturierte Text-Repräsentationen (HTML, Accessibility Trees, XML). Dies ist eine bewusste Design-Entscheidung: Text-Repräsentationen sind kompakter, deterministischer und lassen sich besser in einem Language World Model verarbeiten als Pixel-Arrays. Das Modell bleibt im Sprachraum — es „sieht" die GUI als strukturierten Text, nicht als Bild.
## Modell-Varianten
| Variante | Parameter | Typ |
|---------|-----------|-----|
| Qwen-AgentWorld-35B-A3B | 35B total, 3B active (MoE) | Open Weights |
| Qwen-AgentWorld-397B-A17B | 397B total, 17B active (MoE) | Research-only |
Beide sind Mixture-of-Experts (MoE) Architekturen — die active-parameter-Counts (3B bzw. 17B) zeigen, dass bei Inference nur ein Bruchteil der Parameter aktiviert wird.
## AgentWorldBench — Benchmark-Ergebnisse
Die AgentWorldBench misst, wie gut ein Modell den nächsten Umgebungs-Zustand nach einer Agenten-Aktion vorhersagt. Höher = bessere Welt-Simulation.
| Modell | Overall Score |
|--------|--------------|
| **Qwen-AgentWorld-397B-A17B** (research) | **58.71** |
| GPT-5.4 | 58.25 |
| Claude Opus 4.8 | 56.59 |
| Qwen-AgentWorld-35B-A3B (open weights) | 56.39 |
| Claude Sonnet 4.6 | 56.04 |
| Qwen3.5-35B-A3B (baseline, kein World-Model-Training) | 47.73 |
**Key Observations:**
- Das 397B-Research-Modell schlägt GPT-5.4 knapp (+0.46 Punkte).
- Das offene 35B-Modell schlägt Claude Sonnet 4.6 (+0.35 Punkte) und liegt nah an Claude Opus 4.8 (0.20 Punkte).
- Qwen3.5-35B-A3B (ohne World-Model-Training) fällt auf 47.73 ab — **8.66 Punkte hinter der open-weights AgentWorld-Variante**. Das zeigt, dass der AgentWorld-Training-Pipeline den größten Teil des Gewinns liefert, nicht nur die Modellgröße.
## Warum es bedeutsam ist
### 1. Weltmodelle als Trainings-Infrastruktur
Bisher: Weltmodelle (VEO, JEPA) wurden primär als **Komponente des AGI-Pfads** diskutiert — als Verständnis-Engine, die Physik, Kausalität, Objektpermanenz lernt (siehe [[world-models-jepa-vs-generative.md]]).
Qwen-AgentWorld dreht das um: **Das Weltmodell ist nicht das zu trainierende Subjekt, sondern die Trainingsumgebung.** Es generiert Erfahrungen für andere Agenten — eine völlig andere Anwendung desselben Konzepts.
### 2. Skalierbarkeit von RL-Training
Real-world RL-Umgebungen sind teuer: sie erfordern simulierte Physik-Engines, definierte Reward-Funktionen und unzählige Episoden. Wenn ein Weltmodell diese Umgebungen halluzinieren kann, **wird RL-Training so billig wie Inference** — das Weltmodell generiert unendlich viele Umgebungen bei marginalen Kosten.
### 3. Fine-Tuning für spezifische Aufgaben
Der Ansatz erlaubt **task-spezifische Umgebungsgenerierung**: statt eine allgemeine RL-Benchmark zu bauen, kann das Weltmodell eine Umgebung generieren, die genau auf die gewünschte Fähigkeit zugeschnitten ist. Dies könnte eine neue Form des Fine-Tuning werden — eine Alternative zu SFT und RLHF für domänenspezifische Modelle.
### 4. Beziehung zu Synthetic Data und Self-Play
Qwen-AgentWorld steht im **Kontext** weiterer Trends:
| Ansatz | Was wird synthetisiert | Lernsignal |
|--------|----------------------|-----------|
| **Synthetic Data (SFT)** | Trainingsbeispiele | Imitation |
| **Self-Play** | Gegner | Win/Loss |
| **Constitutional AI** | Verfassung/Regeln | Kritik-Feedback |
| **Hallucinated Environments** | RL-Umgebung | Reward in generierter Sim |
Die Erkenntnis, dass Agenten aus hallucinated environments **echte RL-Agenten schlagen**, deutet darauf hin, dass die generierte Umgebung **relevantere Trainings-Signale** enthält als die echte Umgebung — möglicherweise, weil das Weltmodell schwierige/kritische Szenarien gezielt generieren kann (Curriculum Learning durch Halluzination).
## Einordnung in die Weltmodell-Debatte
| Dimension | JEPA (LeCun) | Generativ (Hassabis) | Qwen-AgentWorld |
|-----------|-------------|---------------------|-----------------|
| **Ziel** | Welt-Verständnis | Welt-Generation | Welt-Simulation für Training |
| **Output** | Embeddings | Pixel/Video | RL-Umgebungen |
| **Nutzung** | Reasoning/Planning | Video-Generation | Agent-Training |
| **Evaluation** | Downstream-Tasks | „Schau das Video" | Agent-Performance in real RL |
Qwen-AgentWorld ist **orthogonal zur JEPA-vs-Generativ-Debatte**: es geht um die *Anwendung* eines Weltmodells (Trainingsumgebung generieren), nicht um die *Architektur* des Weltmodells. Das Qwen-Team hat nicht öffentlich spezifiziert, ob AgentWorld ein generatives oder JEPA-artiges Modell ist.
## Beziehung zu AGI-Pfaden
- **Aschenbrenner-These** ([[../agi/aschenbrenner-situational-awareness.md]]): „The Project" skaliert Compute für AR-LLMs. Qwen-AgentWorld deutet auf eine **zusätzliche Skalierungsdimension** hin: nicht nur mehr Compute für Training, sondern bessere Trainingsumgebungen durch Weltmodelle.
- **DeepMind-Strategie** ([[../../architecture/deepmind-beyond-transformer.md]]): DeepMind investiert in Weltmodelle als AGI-Komponente. Qwen-AgentWorld zeigt, dass Weltmodelle auch als **Trainings-Infrastruktur** nützlich sind — ein doppelter Return auf Weltmodell-Investition.
## Offene Fragen
1. **Welche Art von Weltmodell** ist AgentWorld? (Generativ, JEPA, hybrid?)
2. **Wie wird verhindert, dass das Weltmodell unrealistische Umgebungen generiert?** (Reward-Hacking in der Simulation)
3. **Generalisierung:** Funktioniert dies für beliebige RL-Domänen (Robotik, Atari, Multi-Agent)?
4. **Open-Source-Effekt:** GitHub-Repo und HuggingFace-Collection sind verfügbar — wie schnell wird dies adaptiert?
## Externe Primärquellen
- **Paper:** [arXiv:2606.24597](https://arxiv.org/abs/2606.24597)
- **Blog (Qwen officiel):** https://qwen.ai/blog?id=qwen-agentworld
- **Blog (BinaryVerse AI):** https://binaryverseai.com/qwen-agentworld-language-world-model/
- **GitHub:** https://github.com/QwenLM/Qwen-AgentWorld
- **HuggingFace:** https://huggingface.co/collections/Qwen/qwen-agentworld
- **Video (Sam Witteveen):** https://www.youtube.com/watch?v=VzmMQWRhlBw
## Verwandte Wiki-Seiten
- `[[world-models-jepa-vs-generative.md]]` — JEPA vs. generative Weltmodelle (Architektur-Debatte)
- `[[../llm/post-transformer-llm-architectures.md]]` — Post-Transformer-Architekturen inkl. Weltmodell-Sektion
- `[[../llm/llm-model-catalog.md]]` — Qwen-Modelle im Katalog
- `[[../../architecture/deepmind-beyond-transformer.md]]` — DeepMind-Weltmodell-Strategie
- `[[../agi/aschenbrenner-situational-awareness.md]]` — AGI-Compute-Skalierung