ingest(youtube): qwen-agentworld-world-model-rl

- raw: youtube/2026-06-25_qwen-agentworld-world-model-rl.md
- wiki (new): concepts/world-model-rl-training.md
- wiki (update): concepts/world-models-jepa-vs-generative.md (cross-ref)
- index.md: 32. Update, new World Models entry
- log.md: appended
This commit is contained in:
Hector 2026-06-25 18:36:15 +02:00
parent 5a5ee9e289
commit f76310836e
5 changed files with 167 additions and 3 deletions

View file

@ -0,0 +1,50 @@
---
type: youtube
source_url: https://www.youtube.com/watch?v=VzmMQWRhlBw
retrieved: 2026-06-25
channel: "Sam Witteveen"
title: "Qwen-AgentWorld: The World Model for RL Environments"
duration_sec: 991
has_transcript: true
tags: [qwen, agentworld, world-model, rl, reinforcement-learning, agent-training, hallucinated-environments, qwen-lm]
---
# Qwen-AgentWorld: The World Model for RL Environments
**Channel:** Sam Witteveen
**Published:** 2026-06-25
**Duration:** 16:31
**URL:** https://www.youtube.com/watch?v=VzmMQWRhlBw
## Summary
Sam Witteveen covers Qwen-AgentWorld, a world model built by the Qwen team (Alibaba/QwenLM) that simulates RL (Reinforcement Learning) environments for training agents. The key insight: agents trained inside **hallucinated environments** (generated by the world model) can outperform agents trained in real RL environments.
## Key Points
- **Qwen-AgentWorld** is a world model designed to simulate RL environments — instead of training agents in real environments, you train them inside environments hallucinated by the world model.
- **Agents trained in hallucinated environments beat real-world RL training** on benchmarks.
- Topping **GPT-5.4 and Claude** on their own benchmark.
- **Pipeline:** Hallucinate environments → Train agents inside them → Agents beat real-world RL training.
- This could represent a **fundamentally different way of training models** going forward — potentially a new paradigm beyond standard RLHF/RLAIF.
- Could be used to **fine-tune models for specific tasks** by generating tailored synthetic environments.
## Links
- **Paper:** [arXiv:2606.24597](https://arxiv.org/abs/2606.24597)
- **Blog:** https://qwen.ai/blog?id=qwen-agentworld
- **GitHub:** https://github.com/QwenLM/Qwen-AgentWorld
- **HuggingFace:** https://huggingface.co/collections/Qwen/qwen-agentworld
## Relevance
This connects to the broader world-model discussion in the wiki (see [[world-models-jepa-vs-generative]]). While the JEPA vs. generative debate focuses on *what kind* of world model to build, Qwen-AgentWorld demonstrates a *use case*: world models as training environment generators for RL agents. This is orthogonal to the JEPA/generative debate — it's about applying world models to agent training rather than building world models from first principles.
The "hallucinated environments" paradigm also connects to the synthetic data / self-play discussion in AI training — agents learning from model-generated experiences rather than real-world interaction.
## Related Wiki Pages
- `[[wiki/concepts/world-models-jepa-vs-generative.md]]` — JEPA vs. generative world model debate
- `[[wiki/concepts/llm/post-transformer-llm-architectures.md]]` — Post-transformer architectures including world models
- `[[wiki/concepts/llm/llm-model-catalog.md]]` — Qwen models in the catalog
- `[[wiki/architecture/deepmind-beyond-transformer.md]]` — DeepMind's world model strategy

View file

@ -0,0 +1,99 @@
---
created: 2026-06-25
updated: 2026-06-25
sources:
- youtube/2026-06-25_qwen-agentworld-world-model-rl.md
tags: [concept, world-models, rl, reinforcement-learning, agent-training, hallucinated-environments, qwen, synthetic-data, agi]
---
# World Models for RL Training — Qwen-AgentWorld
> **Stand:** 2026-06-25. Quelle: Sam Witteveon YouTube-Video „Qwen-AgentWorld: The World Model for RL Environments" (16:31, 2026-06-25).
## Kernidee
**Qwen-AgentWorld** (Alibaba/QwenLM) ist ein Weltmodell, das RL-Umgebungen **halluziniert** — anstatt Agenten in realen Umgebungen zu trainieren, generiert das Weltmodell synthetische Trainingsumgebungen. Agenten, die in diesen hallucinated environments trainiert wurden, **schlagen Agenten, die in realen RL-Umgebungen trainiert wurden** — auf der eigenen Benchmark des Teams, und auch beim Vergleich mit **GPT-5.4 und Claude**.
## Pipeline
```
Weltmodell halluciniert Umgebung
Agent trainiert in hallucinated environment
Agent schlägt real-world RL training
```
Dies ist eine **dritte Trainingsschiene** jenseits der klassischen dichotomie:
1. **RLHF/RLAIF** — Agent lernt aus menschlichem/AI-Feedback
2. **Self-Play** — Agent lernt durch Spielen gegen sich selbst (AlphaGo, Dota-OpenAI)
3. **Hallucinated Environment Training** (neu) — Agent lernt in einer vom Weltmodell generierten Simulation
## Warum es bedeutsam ist
### 1. Weltmodelle als Trainings-Infrastruktur
Bisher: Weltmodelle (VEO, JEPA) wurden primär als **Komponente des AGI-Pfads** diskutiert — als Verständnis-Engine, die Physik, Kausalität, Objektpermanenz lernt (siehe [[world-models-jepa-vs-generative.md]]).
Qwen-AgentWorld dreht das um: **Das Weltmodell ist nicht das zu trainierende Subjekt, sondern die Trainingsumgebung.** Es generiert Erfahrungen für andere Agenten — eine völlig andere Anwendung desselben Konzepts.
### 2. Skalierbarkeit von RL-Training
Real-world RL-Umgebungen sind teuer: sie erfordern simulierte Physik-Engines, definierte Reward-Funktionen und unzählige Episoden. Wenn ein Weltmodell diese Umgebungen halluzinieren kann, **wird RL-Training so billig wie Inference** — das Weltmodell generiert unendlich viele Umgebungen bei marginalen Kosten.
### 3. Fine-Tuning für spezifische Aufgaben
Der Ansatz erlaubt **task-spezifische Umgebungsgenerierung**: statt eine allgemeine RL-Benchmark zu bauen, kann das Weltmodell eine Umgebung generieren, die genau auf die gewünschte Fähigkeit zugeschnitten ist. Dies könnte eine neue Form des Fine-Tuning werden — eine Alternative zu SFT und RLHF für domänenspezifische Modelle.
### 4. Beziehung zu Synthetic Data und Self-Play
Qwen-AgentWorld steht im **Kontext** weiterer Trends:
| Ansatz | Was wird synthetisiert | Lernsignal |
|--------|----------------------|-----------|
| **Synthetic Data (SFT)** | Trainingsbeispiele | Imitation |
| **Self-Play** | Gegner | Win/Loss |
| **Constitutional AI** | Verfassung/Regeln | Kritik-Feedback |
| **Hallucinated Environments** | RL-Umgebung | Reward in generierter Sim |
Die Erkenntnis, dass Agenten aus hallucinated environments **echte RL-Agenten schlagen**, deutet darauf hin, dass die generierte Umgebung **relevantere Trainings-Signale** enthält als die echte Umgebung — möglicherweise, weil das Weltmodell schwierige/kritische Szenarien gezielt generieren kann (Curriculum Learning durch Halluzination).
## Einordnung in die Weltmodell-Debatte
| Dimension | JEPA (LeCun) | Generativ (Hassabis) | Qwen-AgentWorld |
|-----------|-------------|---------------------|-----------------|
| **Ziel** | Welt-Verständnis | Welt-Generation | Welt-Simulation für Training |
| **Output** | Embeddings | Pixel/Video | RL-Umgebungen |
| **Nutzung** | Reasoning/Planning | Video-Generation | Agent-Training |
| **Evaluation** | Downstream-Tasks | „Schau das Video" | Agent-Performance in real RL |
Qwen-AgentWorld ist **orthogonal zur JEPA-vs-Generativ-Debatte**: es geht um die *Anwendung* eines Weltmodells (Trainingsumgebung generieren), nicht um die *Architektur* des Weltmodells. Das Qwen-Team hat nicht öffentlich spezifiziert, ob AgentWorld ein generatives oder JEPA-artiges Modell ist.
## Beziehung zu AGI-Pfaden
- **Aschenbrenner-These** ([[../agi/aschenbrenner-situational-awareness.md]]): „The Project" skaliert Compute für AR-LLMs. Qwen-AgentWorld deutet auf eine **zusätzliche Skalierungsdimension** hin: nicht nur mehr Compute für Training, sondern bessere Trainingsumgebungen durch Weltmodelle.
- **DeepMind-Strategie** ([[../../architecture/deepmind-beyond-transformer.md]]): DeepMind investiert in Weltmodelle als AGI-Komponente. Qwen-AgentWorld zeigt, dass Weltmodelle auch als **Trainings-Infrastruktur** nützlich sind — ein doppelter Return auf Weltmodell-Investition.
## Offene Fragen
1. **Welche Art von Weltmodell** ist AgentWorld? (Generativ, JEPA, hybrid?)
2. **Wie wird verhindert, dass das Weltmodell unrealistische Umgebungen generiert?** (Reward-Hacking in der Simulation)
3. **Generalisierung:** Funktioniert dies für beliebige RL-Domänen (Robotik, Atari, Multi-Agent)?
4. **Open-Source-Effekt:** GitHub-Repo und HuggingFace-Collection sind verfügbar — wie schnell wird dies adaptiert?
## Externe Primärquellen
- **Paper:** [arXiv:2606.24597](https://arxiv.org/abs/2606.24597)
- **Blog:** https://qwen.ai/blog?id=qwen-agentworld
- **GitHub:** https://github.com/QwenLM/Qwen-AgentWorld
- **HuggingFace:** https://huggingface.co/collections/Qwen/qwen-agentworld
- **Video:** https://www.youtube.com/watch?v=VzmMQWRhlBw
## Verwandte Wiki-Seiten
- `[[world-models-jepa-vs-generative.md]]` — JEPA vs. generative Weltmodelle (Architektur-Debatte)
- `[[../llm/post-transformer-llm-architectures.md]]` — Post-Transformer-Architekturen inkl. Weltmodell-Sektion
- `[[../llm/llm-model-catalog.md]]` — Qwen-Modelle im Katalog
- `[[../../architecture/deepmind-beyond-transformer.md]]` — DeepMind-Weltmodell-Strategie
- `[[../agi/aschenbrenner-situational-awareness.md]]` — AGI-Compute-Skalierung

View file

@ -1,10 +1,10 @@
---
created: 2026-06-18
updated: 2026-06-18
updated: 2026-06-25
sources:
- youtube/2026-06-18_deepmind-beyond-transformer.md
- youtube/2026-06-16_deepmind-two-steps-ahead.md
tags: [concept, world-models, jepa, hassabis, lecun, generative, video-generation, v-jepa, veo, agi, deepmind, meta]
tags: [concept, world-models, jepa, hassabis, lecun, generative, video-generation, v-jepa, veo, agi, deepmind, meta, rl-training, qwen-agentworld]
---
# Weltmodelle: JEPA vs. Generativ — Die Hassabis-LeCun-Debatte
@ -100,6 +100,7 @@ Zwei Antworten, zwei Lager, zwei verschiedene Trainingsziele.
- `[[../concepts/llm/post-transformer-llm-architectures.md]]` — Vier-Säulen-Übersicht inkl. Weltmodell-Sektion
- `[[transformer-foundation.md]]` — Klassischer Transformer als Vergleichsbasis
- `[[../concepts/agi/aschenbrenner-situational-awareness.md]]` — AGI-Realismus: „OOMs zählen" + The Project
- `[[world-model-rl-training.md]]`**NEU 2026-06-25:** Qwen-AgentWorld — Weltmodelle als RL-Trainingsumgebungen (orthogonal zur Architektur-Debatte)
## Externe Primärquellen

View file

@ -2,7 +2,7 @@
*Auto-generated: 2026-06-23*
*Letzte Aktualisierung: 2026-06-25 (31. Update — Hermes Agent Ingest: Peter Yangs Kurs hinzugefügt. Raw-Datei `youtube/2026-06-24_peter-yang-hermes-full-course.md`.)*
*Letzte Aktualisierung: 2026-06-25 (32. Update — Qwen-AgentWorld: Weltmodelle als RL-Trainingsumgebungen. Raw-Datei `youtube/2026-06-25_qwen-agentworld-world-model-rl.md`.)*
## Architecture
@ -44,6 +44,7 @@
| Seite | Beschreibung | Quellen |
|-------|-------------|---------|
| [Weltmodelle: JEPA vs. Generativ](concepts/world-models-jepa-vs-generative.md) | Hassabis-vs-LeCun-Debatte strukturiert: Generative Weltmodelle (VEO, Pixel-Rekonstruktion, Compute-intensiv) vs. JEPA (V-JEPA, Embedding-Konsistenz, theoretisch effizienter, empirisch noch nicht an der Spitze). AGI-Weltmodell-Wette bis 2028-2030 | youtube/2026-06-18_deepmind-beyond-transformer.md + youtube/2026-06-16_deepmind-two-steps-ahead.md |
| [World Models for RL Training — Qwen-AgentWorld](concepts/world-model-rl-training.md) | Qwen-AgentWorld: Weltmodell halluziniert RL-Umgebungen → Agenten trainieren darin → schlagen real-world RL + GPT-5.4/Claude. Dritte Trainingsschiene jenseits RLHF/Self-Play. Cross-Ref zu JEPA-Debatte. | youtube/2026-06-25_qwen-agentworld-world-model-rl.md |
### LLM
| Seite | Beschreibung | Quellen |

View file

@ -786,3 +786,16 @@ Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Über
- wiki: `index.md` (updated — Header auf "27. Update", neuer LLM-Eintrag unter Concepts/LLM Sektion)
- log: updated (dieser Eintrag)
**Hector-Hauptthese:** Der Katalog schließt eine Lücke im Wiki-System: Bisher waren Modell-Informationen über 11+ verstreute Wiki-Seiten verteilt (GLM-5.2-Seite, Kimi-K2.7-Seite, Claude-Seite, GPT-Seite, Cloud-Exit-Seite, Model-Routing-Seite, Showdown-Seite, Fusion-Seite, Post-Transformer-Seite, Flat-Curve-Seite, OME21-Briefing). Die Konsolidierungsseite macht alle Modelle auffindbar an einem Ort, mit klarem Fokus auf lokale Deployment-Optionen — passend zur Cloud-Exit-Strategie und Yegges Flat-Curve-These (Frontier-Lockdown → OSS-Modelle aufgewertet). Die Hector's Active Stack-Tabelle dokumentiert erstmals den vollständigen Provider-Bestand mit Rollen-Attribution.
## [2026-06-25] Ingest | Qwen-AgentWorld — Weltmodelle als RL-Trainingsumgebungen
**Type:** ingest | **Scope:** raw/youtube, wiki/concepts, wiki/index
**Source:** Sam Witteveen YouTube-Video "Qwen-AgentWorld: The World Model for RL Environments" (16:31, 2026-06-25) — https://www.youtube.com/watch?v=VzmMQWRhlBw
**Trigger:** Video-Link im Chat geteilt. Qwen-AgentWorld: Weltmodell halluziniert RL-Umgebungen → Agenten trainieren darin → schlagen real-world RL + GPT-5.4/Claude.
**Actions:**
- raw: `raw/youtube/2026-06-25_qwen-agentworld-world-model-rl.md` (created — 2.9 KB; Frontmatter + Summary + Key Points + Links + Relevance + Related Wiki Pages)
- wiki (NEU): `concepts/world-model-rl-training.md` (created — 6.0 KB; Kernidee, Pipeline, Warum bedeutsam [4 Sektionen: Trainings-Infrastruktur, Skalierbarkeit, Fine-Tuning, Synthetic Data Kontext], Einordnung in JEPA-Debatte mit Vergleichstabelle, AGI-Pfad-Bezüge, offene Fragen, externe Quellen, Cross-Refs zu 5 Wiki-Seiten)
- wiki (UPDATE): `concepts/world-models-jepa-vs-generative.md` — updated-Datum auf 2026-06-25, tags um `rl-training` + `qwen-agentworld` erweitert, neuen Cross-Ref zu `[[world-model-rl-training.md]]` in Verwandte Wiki-Seiten hinzugefügt
- wiki: `index.md` (updated — Header auf "32. Update", neue World-Models-Zeile unter Concepts Sektion)
- log: this entry
**Hector-Hauptthese:** Qwen-AgentWorld ist orthogonal zur JEPA-vs-Generativ-Debatte: es geht um die *Anwendung* eines Weltmodells (RL-Trainingsumgebung generieren), nicht um die *Architektur*. Die "dritte Trainingsschiene" (hallucinated environments) ergänzt RLHF und Self-Play — und deutet auf einen doppelten Return für Weltmodell-Investitionen hin: das Weltmodell ist nicht nur AGI-Komponente, sondern auch Trainings-Infrastruktur. Wenn Agenten aus hallucinated environments echte RL-Agenten schlagen, ist das RL-Training so billig wie Inference — eine mögliche Paradigmenverschiebung.
**Subagent-Modell:** ollama/glm-5.2:cloud