- scripts/check-wiki-links.py: validates all [[...]] links source-relative (matching Forgejo behavior)
- scripts/fix-wiki-links.py: auto-rewrites broken links as source-relative paths
- scripts/.check-wiki-links-wrapper.sh: pre-commit hook wrapper
- .git/hooks/pre-commit: installs wrapper as Git hook
- Fixed 47 wiki files with broken links (mostly path-confusion and wiki/-prefix bugs)
- Total: 691 valid wiki links, 0 broken, 0 path confusion
- Manual fix: Wikipedia: Sleeper agent link → proper Markdown URL
- Manual fix: non-existent decision link → decisions-index
- Code-span and template-placeholder handling (ignores `[[example]]` and `[[{slug}]]`)
Trigger: k9ert noted https://.../concepts/llm/concepts/llm/... was 404 in wiki-catalog
9.9 KiB
| created | updated | sources | tags | ||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-06-25 | 2026-06-25 |
|
|
World Models for RL Training — Qwen-AgentWorld
Stand: 2026-06-25. Quellen: Sam Witteveen YouTube-Video „Qwen-AgentWorld: The World Model for RL Environments" (16:31, 2026-06-25) + BinaryVerse AI Blog „Qwen AgentWorld Explained: Predict Before Agents Act" (2026-06-25).
Kernidee
Qwen-AgentWorld (Alibaba/QwenLM) ist ein Language World Model — kein Chatbot. Es sagt den nächsten Umgebungs-Zustand nach einer Agenten-Aktion voraus. Normal LLM fragt „Was soll ich sagen oder tun?" → Qwen AgentWorld fragt „Wenn der Agent das tut, was wird die Welt zurückgeben?"
Es ist ein Weltmodell, das RL-Umgebungen halluziniert — anstatt Agenten in realen Umgebungen zu trainieren, generiert das Weltmodell synthetische Trainingsumgebungen. Agenten, die in diesen hallucinated environments trainiert wurden, schlagen Agenten, die in realen RL-Umgebungen trainiert wurden — auf der eigenen Benchmark des Teams, und auch beim Vergleich mit GPT-5.4 und Claude.
Pipeline
Weltmodell halluciniert Umgebung
↓
Agent trainiert in hallucinated environment
↓
Agent schlägt real-world RL training
Dies ist eine dritte Trainingsschiene jenseits der klassischen dichotomie:
- RLHF/RLAIF — Agent lernt aus menschlichem/AI-Feedback
- Self-Play — Agent lernt durch Spielen gegen sich selbst (AlphaGo, Dota-OpenAI)
- Hallucinated Environment Training (neu) — Agent lernt in einer vom Weltmodell generierten Simulation
Training Pipeline — „CPT injects, SFT activates, RL sharpens"
Qwen-AgentWorld wird in drei Phasen trainiert:
1. Continual Pre-Training (CPT) — injects environment knowledge
- Ziel: Umgebungs-Wissen in das Modell injizieren. Das Modell lernt die Struktur und Dynamik der 7 Domänen (MCP, Search, Terminal, SWE, Web, OS, Android).
- Daten: 10M+ reale Interaktions-Trajektorien aus echten Umgebungen.
2. Supervised Fine-Tuning (SFT) — activates next-state prediction
- Ziel: Das Modell lernt, den nächsten Beobachtungs-Zustand vorherzusagen, gegeben eine Interaktions-Historie und eine Agenten-Aktion.
- Paradigma-Wechsel: Das Modell wird vom Aktions-Generator zum Umgebungs-Simulator.
3. Reinforcement Learning (RL) — sharpens simulation fidelity
- Ziel: Die Simulations-Genauigkeit wird durch RL weiter geschärft. Das Modell lernt, präzisere und nützlichere Welt-Zustände zu generieren.
Core Loop
Interaktions-Historie → Agenten-Aktion → Modell sagt nächsten Beobachtungs-Zustand voraus
→ Verwendung für: Evaluation / Planning / RL-Training
7 Domänen
Qwen-AgentWorld deckt sieben Agenten-Umgebungen ab:
| Domäne | Beschreibung | Repräsentation |
|---|---|---|
| MCP | Model Context Protocol | Strukturierter Text |
| Search | Web-Suche | Strukturierter Text |
| Terminal | Kommandozeile | Strukturierter Text |
| SWE | Software Engineering | Strukturierter Text |
| Web | Browser/GUI | HTML |
| OS | Betriebssystem/GUI | Accessibility Trees |
| Android | Mobile GUI | XML-Layouts |
GUI-Domänen: Strukturierte Text-Repräsentation, keine Pixel
Für die GUI-Domänen (Web, OS, Android) verwendet Qwen-AgentWorld keine rohen Pixel-Bilder, sondern strukturierte Text-Repräsentationen (HTML, Accessibility Trees, XML). Dies ist eine bewusste Design-Entscheidung: Text-Repräsentationen sind kompakter, deterministischer und lassen sich besser in einem Language World Model verarbeiten als Pixel-Arrays. Das Modell bleibt im Sprachraum — es „sieht" die GUI als strukturierten Text, nicht als Bild.
Modell-Varianten
| Variante | Parameter | Typ |
|---|---|---|
| Qwen-AgentWorld-35B-A3B | 35B total, 3B active (MoE) | Open Weights |
| Qwen-AgentWorld-397B-A17B | 397B total, 17B active (MoE) | Research-only |
Beide sind Mixture-of-Experts (MoE) Architekturen — die active-parameter-Counts (3B bzw. 17B) zeigen, dass bei Inference nur ein Bruchteil der Parameter aktiviert wird.
AgentWorldBench — Benchmark-Ergebnisse
Die AgentWorldBench misst, wie gut ein Modell den nächsten Umgebungs-Zustand nach einer Agenten-Aktion vorhersagt. Höher = bessere Welt-Simulation.
| Modell | Overall Score |
|---|---|
| Qwen-AgentWorld-397B-A17B (research) | 58.71 |
| GPT-5.4 | 58.25 |
| Claude Opus 4.8 | 56.59 |
| Qwen-AgentWorld-35B-A3B (open weights) | 56.39 |
| Claude Sonnet 4.6 | 56.04 |
| Qwen3.5-35B-A3B (baseline, kein World-Model-Training) | 47.73 |
Key Observations:
- Das 397B-Research-Modell schlägt GPT-5.4 knapp (+0.46 Punkte).
- Das offene 35B-Modell schlägt Claude Sonnet 4.6 (+0.35 Punkte) und liegt nah an Claude Opus 4.8 (−0.20 Punkte).
- Qwen3.5-35B-A3B (ohne World-Model-Training) fällt auf 47.73 ab — 8.66 Punkte hinter der open-weights AgentWorld-Variante. Das zeigt, dass der AgentWorld-Training-Pipeline den größten Teil des Gewinns liefert, nicht nur die Modellgröße.
Warum es bedeutsam ist
1. Weltmodelle als Trainings-Infrastruktur
Bisher: Weltmodelle (VEO, JEPA) wurden primär als Komponente des AGI-Pfads diskutiert — als Verständnis-Engine, die Physik, Kausalität, Objektpermanenz lernt (siehe world-models-jepa-vs-generative.md).
Qwen-AgentWorld dreht das um: Das Weltmodell ist nicht das zu trainierende Subjekt, sondern die Trainingsumgebung. Es generiert Erfahrungen für andere Agenten — eine völlig andere Anwendung desselben Konzepts.
2. Skalierbarkeit von RL-Training
Real-world RL-Umgebungen sind teuer: sie erfordern simulierte Physik-Engines, definierte Reward-Funktionen und unzählige Episoden. Wenn ein Weltmodell diese Umgebungen halluzinieren kann, wird RL-Training so billig wie Inference — das Weltmodell generiert unendlich viele Umgebungen bei marginalen Kosten.
3. Fine-Tuning für spezifische Aufgaben
Der Ansatz erlaubt task-spezifische Umgebungsgenerierung: statt eine allgemeine RL-Benchmark zu bauen, kann das Weltmodell eine Umgebung generieren, die genau auf die gewünschte Fähigkeit zugeschnitten ist. Dies könnte eine neue Form des Fine-Tuning werden — eine Alternative zu SFT und RLHF für domänenspezifische Modelle.
4. Beziehung zu Synthetic Data und Self-Play
Qwen-AgentWorld steht im Kontext weiterer Trends:
| Ansatz | Was wird synthetisiert | Lernsignal |
|---|---|---|
| Synthetic Data (SFT) | Trainingsbeispiele | Imitation |
| Self-Play | Gegner | Win/Loss |
| Constitutional AI | Verfassung/Regeln | Kritik-Feedback |
| Hallucinated Environments | RL-Umgebung | Reward in generierter Sim |
Die Erkenntnis, dass Agenten aus hallucinated environments echte RL-Agenten schlagen, deutet darauf hin, dass die generierte Umgebung relevantere Trainings-Signale enthält als die echte Umgebung — möglicherweise, weil das Weltmodell schwierige/kritische Szenarien gezielt generieren kann (Curriculum Learning durch Halluzination).
Einordnung in die Weltmodell-Debatte
| Dimension | JEPA (LeCun) | Generativ (Hassabis) | Qwen-AgentWorld |
|---|---|---|---|
| Ziel | Welt-Verständnis | Welt-Generation | Welt-Simulation für Training |
| Output | Embeddings | Pixel/Video | RL-Umgebungen |
| Nutzung | Reasoning/Planning | Video-Generation | Agent-Training |
| Evaluation | Downstream-Tasks | „Schau das Video" | Agent-Performance in real RL |
Qwen-AgentWorld ist orthogonal zur JEPA-vs-Generativ-Debatte: es geht um die Anwendung eines Weltmodells (Trainingsumgebung generieren), nicht um die Architektur des Weltmodells. Das Qwen-Team hat nicht öffentlich spezifiziert, ob AgentWorld ein generatives oder JEPA-artiges Modell ist.
Beziehung zu AGI-Pfaden
- Aschenbrenner-These (agi/aschenbrenner-situational-awareness.md): „The Project" skaliert Compute für AR-LLMs. Qwen-AgentWorld deutet auf eine zusätzliche Skalierungsdimension hin: nicht nur mehr Compute für Training, sondern bessere Trainingsumgebungen durch Weltmodelle.
- DeepMind-Strategie (../architecture/deepmind-beyond-transformer.md): DeepMind investiert in Weltmodelle als AGI-Komponente. Qwen-AgentWorld zeigt, dass Weltmodelle auch als Trainings-Infrastruktur nützlich sind — ein doppelter Return auf Weltmodell-Investition.
Offene Fragen
- Welche Art von Weltmodell ist AgentWorld? (Generativ, JEPA, hybrid?)
- Wie wird verhindert, dass das Weltmodell unrealistische Umgebungen generiert? (Reward-Hacking in der Simulation)
- Generalisierung: Funktioniert dies für beliebige RL-Domänen (Robotik, Atari, Multi-Agent)?
- Open-Source-Effekt: GitHub-Repo und HuggingFace-Collection sind verfügbar — wie schnell wird dies adaptiert?
Externe Primärquellen
- Paper: arXiv:2606.24597
- Blog (Qwen officiel): https://qwen.ai/blog?id=qwen-agentworld
- Blog (BinaryVerse AI): https://binaryverseai.com/qwen-agentworld-language-world-model/
- GitHub: https://github.com/QwenLM/Qwen-AgentWorld
- HuggingFace: https://huggingface.co/collections/Qwen/qwen-agentworld
- Video (Sam Witteveen): https://www.youtube.com/watch?v=VzmMQWRhlBw
Verwandte Wiki-Seiten
[[world-models-jepa-vs-generative.md]]— JEPA vs. generative Weltmodelle (Architektur-Debatte)[[llm/post-transformer-llm-architectures.md]]— Post-Transformer-Architekturen inkl. Weltmodell-Sektion[[llm/llm-model-catalog.md]]— Qwen-Modelle im Katalog[[../architecture/deepmind-beyond-transformer.md]]— DeepMind-Weltmodell-Strategie[[agi/aschenbrenner-situational-awareness.md]]— AGI-Compute-Skalierung