--- created: 2026-06-25 updated: 2026-06-25 sources: - youtube/2026-06-25_qwen-agentworld-world-model-rl.md - blog/2026-06-25_binaryverseai-qwen-agentworld.md tags: [concept, world-models, rl, reinforcement-learning, agent-training, hallucinated-environments, qwen, synthetic-data, agi, agentworldbench, mcp, gui-automation] --- # World Models for RL Training — Qwen-AgentWorld > **Stand:** 2026-06-25. Quellen: Sam Witteveen YouTube-Video „Qwen-AgentWorld: The World Model for RL Environments" (16:31, 2026-06-25) + BinaryVerse AI Blog „Qwen AgentWorld Explained: Predict Before Agents Act" (2026-06-25). ## Kernidee **Qwen-AgentWorld** (Alibaba/QwenLM) ist ein **Language World Model** — kein Chatbot. Es sagt den nächsten Umgebungs-Zustand nach einer Agenten-Aktion voraus. Normal LLM fragt „Was soll ich sagen oder tun?" → Qwen AgentWorld fragt „Wenn der Agent das tut, was wird die Welt zurückgeben?" Es ist ein Weltmodell, das RL-Umgebungen **halluziniert** — anstatt Agenten in realen Umgebungen zu trainieren, generiert das Weltmodell synthetische Trainingsumgebungen. Agenten, die in diesen hallucinated environments trainiert wurden, **schlagen Agenten, die in realen RL-Umgebungen trainiert wurden** — auf der eigenen Benchmark des Teams, und auch beim Vergleich mit **GPT-5.4 und Claude**. ## Pipeline ``` Weltmodell halluciniert Umgebung ↓ Agent trainiert in hallucinated environment ↓ Agent schlägt real-world RL training ``` Dies ist eine **dritte Trainingsschiene** jenseits der klassischen dichotomie: 1. **RLHF/RLAIF** — Agent lernt aus menschlichem/AI-Feedback 2. **Self-Play** — Agent lernt durch Spielen gegen sich selbst (AlphaGo, Dota-OpenAI) 3. **Hallucinated Environment Training** (neu) — Agent lernt in einer vom Weltmodell generierten Simulation ## Training Pipeline — „CPT injects, SFT activates, RL sharpens" Qwen-AgentWorld wird in drei Phasen trainiert: ### 1. Continual Pre-Training (CPT) — injects environment knowledge - **Ziel:** Umgebungs-Wissen in das Modell injizieren. Das Modell lernt die Struktur und Dynamik der 7 Domänen (MCP, Search, Terminal, SWE, Web, OS, Android). - **Daten:** 10M+ reale Interaktions-Trajektorien aus echten Umgebungen. ### 2. Supervised Fine-Tuning (SFT) — activates next-state prediction - **Ziel:** Das Modell lernt, den *nächsten Beobachtungs-Zustand* vorherzusagen, gegeben eine Interaktions-Historie und eine Agenten-Aktion. - **Paradigma-Wechsel:** Das Modell wird vom Aktions-Generator zum Umgebungs-Simulator. ### 3. Reinforcement Learning (RL) — sharpens simulation fidelity - **Ziel:** Die Simulations-Genauigkeit wird durch RL weiter geschärft. Das Modell lernt, präzisere und nützlichere Welt-Zustände zu generieren. ### Core Loop ``` Interaktions-Historie → Agenten-Aktion → Modell sagt nächsten Beobachtungs-Zustand voraus → Verwendung für: Evaluation / Planning / RL-Training ``` ## 7 Domänen Qwen-AgentWorld deckt sieben Agenten-Umgebungen ab: | Domäne | Beschreibung | Repräsentation | |--------|-------------|----------------| | **MCP** | Model Context Protocol | Strukturierter Text | | **Search** | Web-Suche | Strukturierter Text | | **Terminal** | Kommandozeile | Strukturierter Text | | **SWE** | Software Engineering | Strukturierter Text | | **Web** | Browser/GUI | HTML | | **OS** | Betriebssystem/GUI | Accessibility Trees | | **Android** | Mobile GUI | XML-Layouts | ### GUI-Domänen: Strukturierte Text-Repräsentation, keine Pixel Für die GUI-Domänen (Web, OS, Android) verwendet Qwen-AgentWorld **keine rohen Pixel-Bilder**, sondern strukturierte Text-Repräsentationen (HTML, Accessibility Trees, XML). Dies ist eine bewusste Design-Entscheidung: Text-Repräsentationen sind kompakter, deterministischer und lassen sich besser in einem Language World Model verarbeiten als Pixel-Arrays. Das Modell bleibt im Sprachraum — es „sieht" die GUI als strukturierten Text, nicht als Bild. ## Modell-Varianten | Variante | Parameter | Typ | |---------|-----------|-----| | Qwen-AgentWorld-35B-A3B | 35B total, 3B active (MoE) | Open Weights | | Qwen-AgentWorld-397B-A17B | 397B total, 17B active (MoE) | Research-only | Beide sind Mixture-of-Experts (MoE) Architekturen — die active-parameter-Counts (3B bzw. 17B) zeigen, dass bei Inference nur ein Bruchteil der Parameter aktiviert wird. ## AgentWorldBench — Benchmark-Ergebnisse Die AgentWorldBench misst, wie gut ein Modell den nächsten Umgebungs-Zustand nach einer Agenten-Aktion vorhersagt. Höher = bessere Welt-Simulation. | Modell | Overall Score | |--------|--------------| | **Qwen-AgentWorld-397B-A17B** (research) | **58.71** | | GPT-5.4 | 58.25 | | Claude Opus 4.8 | 56.59 | | Qwen-AgentWorld-35B-A3B (open weights) | 56.39 | | Claude Sonnet 4.6 | 56.04 | | Qwen3.5-35B-A3B (baseline, kein World-Model-Training) | 47.73 | **Key Observations:** - Das 397B-Research-Modell schlägt GPT-5.4 knapp (+0.46 Punkte). - Das offene 35B-Modell schlägt Claude Sonnet 4.6 (+0.35 Punkte) und liegt nah an Claude Opus 4.8 (−0.20 Punkte). - Qwen3.5-35B-A3B (ohne World-Model-Training) fällt auf 47.73 ab — **8.66 Punkte hinter der open-weights AgentWorld-Variante**. Das zeigt, dass der AgentWorld-Training-Pipeline den größten Teil des Gewinns liefert, nicht nur die Modellgröße. ## Warum es bedeutsam ist ### 1. Weltmodelle als Trainings-Infrastruktur Bisher: Weltmodelle (VEO, JEPA) wurden primär als **Komponente des AGI-Pfads** diskutiert — als Verständnis-Engine, die Physik, Kausalität, Objektpermanenz lernt (siehe [[world-models-jepa-vs-generative.md]]). Qwen-AgentWorld dreht das um: **Das Weltmodell ist nicht das zu trainierende Subjekt, sondern die Trainingsumgebung.** Es generiert Erfahrungen für andere Agenten — eine völlig andere Anwendung desselben Konzepts. ### 2. Skalierbarkeit von RL-Training Real-world RL-Umgebungen sind teuer: sie erfordern simulierte Physik-Engines, definierte Reward-Funktionen und unzählige Episoden. Wenn ein Weltmodell diese Umgebungen halluzinieren kann, **wird RL-Training so billig wie Inference** — das Weltmodell generiert unendlich viele Umgebungen bei marginalen Kosten. ### 3. Fine-Tuning für spezifische Aufgaben Der Ansatz erlaubt **task-spezifische Umgebungsgenerierung**: statt eine allgemeine RL-Benchmark zu bauen, kann das Weltmodell eine Umgebung generieren, die genau auf die gewünschte Fähigkeit zugeschnitten ist. Dies könnte eine neue Form des Fine-Tuning werden — eine Alternative zu SFT und RLHF für domänenspezifische Modelle. ### 4. Beziehung zu Synthetic Data und Self-Play Qwen-AgentWorld steht im **Kontext** weiterer Trends: | Ansatz | Was wird synthetisiert | Lernsignal | |--------|----------------------|-----------| | **Synthetic Data (SFT)** | Trainingsbeispiele | Imitation | | **Self-Play** | Gegner | Win/Loss | | **Constitutional AI** | Verfassung/Regeln | Kritik-Feedback | | **Hallucinated Environments** | RL-Umgebung | Reward in generierter Sim | Die Erkenntnis, dass Agenten aus hallucinated environments **echte RL-Agenten schlagen**, deutet darauf hin, dass die generierte Umgebung **relevantere Trainings-Signale** enthält als die echte Umgebung — möglicherweise, weil das Weltmodell schwierige/kritische Szenarien gezielt generieren kann (Curriculum Learning durch Halluzination). ## Einordnung in die Weltmodell-Debatte | Dimension | JEPA (LeCun) | Generativ (Hassabis) | Qwen-AgentWorld | |-----------|-------------|---------------------|-----------------| | **Ziel** | Welt-Verständnis | Welt-Generation | Welt-Simulation für Training | | **Output** | Embeddings | Pixel/Video | RL-Umgebungen | | **Nutzung** | Reasoning/Planning | Video-Generation | Agent-Training | | **Evaluation** | Downstream-Tasks | „Schau das Video" | Agent-Performance in real RL | Qwen-AgentWorld ist **orthogonal zur JEPA-vs-Generativ-Debatte**: es geht um die *Anwendung* eines Weltmodells (Trainingsumgebung generieren), nicht um die *Architektur* des Weltmodells. Das Qwen-Team hat nicht öffentlich spezifiziert, ob AgentWorld ein generatives oder JEPA-artiges Modell ist. ## Beziehung zu AGI-Pfaden - **Aschenbrenner-These** ([[agi/aschenbrenner-situational-awareness.md]]): „The Project" skaliert Compute für AR-LLMs. Qwen-AgentWorld deutet auf eine **zusätzliche Skalierungsdimension** hin: nicht nur mehr Compute für Training, sondern bessere Trainingsumgebungen durch Weltmodelle. - **DeepMind-Strategie** ([[../architecture/deepmind-beyond-transformer.md]]): DeepMind investiert in Weltmodelle als AGI-Komponente. Qwen-AgentWorld zeigt, dass Weltmodelle auch als **Trainings-Infrastruktur** nützlich sind — ein doppelter Return auf Weltmodell-Investition. ## Offene Fragen 1. **Welche Art von Weltmodell** ist AgentWorld? (Generativ, JEPA, hybrid?) 2. **Wie wird verhindert, dass das Weltmodell unrealistische Umgebungen generiert?** (Reward-Hacking in der Simulation) 3. **Generalisierung:** Funktioniert dies für beliebige RL-Domänen (Robotik, Atari, Multi-Agent)? 4. **Open-Source-Effekt:** GitHub-Repo und HuggingFace-Collection sind verfügbar — wie schnell wird dies adaptiert? ## Externe Primärquellen - **Paper:** [arXiv:2606.24597](https://arxiv.org/abs/2606.24597) - **Blog (Qwen officiel):** https://qwen.ai/blog?id=qwen-agentworld - **Blog (BinaryVerse AI):** https://binaryverseai.com/qwen-agentworld-language-world-model/ - **GitHub:** https://github.com/QwenLM/Qwen-AgentWorld - **HuggingFace:** https://huggingface.co/collections/Qwen/qwen-agentworld - **Video (Sam Witteveen):** https://www.youtube.com/watch?v=VzmMQWRhlBw ## Verwandte Wiki-Seiten - `[[world-models-jepa-vs-generative.md]]` — JEPA vs. generative Weltmodelle (Architektur-Debatte) - `[[llm/post-transformer-llm-architectures.md]]` — Post-Transformer-Architekturen inkl. Weltmodell-Sektion - `[[llm/llm-model-catalog.md]]` — Qwen-Modelle im Katalog - `[[../architecture/deepmind-beyond-transformer.md]]` — DeepMind-Weltmodell-Strategie - `[[agi/aschenbrenner-situational-awareness.md]]` — AGI-Compute-Skalierung