From f76310836eecaf52bcc5716806137f763f84bd92 Mon Sep 17 00:00:00 2001 From: Hector Date: Thu, 25 Jun 2026 18:36:15 +0200 Subject: [PATCH] ingest(youtube): qwen-agentworld-world-model-rl - raw: youtube/2026-06-25_qwen-agentworld-world-model-rl.md - wiki (new): concepts/world-model-rl-training.md - wiki (update): concepts/world-models-jepa-vs-generative.md (cross-ref) - index.md: 32. Update, new World Models entry - log.md: appended --- ...26-06-25_qwen-agentworld-world-model-rl.md | 50 ++++++++++ wiki/concepts/world-model-rl-training.md | 99 +++++++++++++++++++ .../world-models-jepa-vs-generative.md | 5 +- wiki/index.md | 3 +- wiki/log.md | 13 +++ 5 files changed, 167 insertions(+), 3 deletions(-) create mode 100644 raw/youtube/2026-06-25_qwen-agentworld-world-model-rl.md create mode 100644 wiki/concepts/world-model-rl-training.md diff --git a/raw/youtube/2026-06-25_qwen-agentworld-world-model-rl.md b/raw/youtube/2026-06-25_qwen-agentworld-world-model-rl.md new file mode 100644 index 0000000..a6f329a --- /dev/null +++ b/raw/youtube/2026-06-25_qwen-agentworld-world-model-rl.md @@ -0,0 +1,50 @@ +--- +type: youtube +source_url: https://www.youtube.com/watch?v=VzmMQWRhlBw +retrieved: 2026-06-25 +channel: "Sam Witteveen" +title: "Qwen-AgentWorld: The World Model for RL Environments" +duration_sec: 991 +has_transcript: true +tags: [qwen, agentworld, world-model, rl, reinforcement-learning, agent-training, hallucinated-environments, qwen-lm] +--- + +# Qwen-AgentWorld: The World Model for RL Environments + +**Channel:** Sam Witteveen +**Published:** 2026-06-25 +**Duration:** 16:31 +**URL:** https://www.youtube.com/watch?v=VzmMQWRhlBw + +## Summary + +Sam Witteveen covers Qwen-AgentWorld, a world model built by the Qwen team (Alibaba/QwenLM) that simulates RL (Reinforcement Learning) environments for training agents. The key insight: agents trained inside **hallucinated environments** (generated by the world model) can outperform agents trained in real RL environments. + +## Key Points + +- **Qwen-AgentWorld** is a world model designed to simulate RL environments — instead of training agents in real environments, you train them inside environments hallucinated by the world model. +- **Agents trained in hallucinated environments beat real-world RL training** on benchmarks. +- Topping **GPT-5.4 and Claude** on their own benchmark. +- **Pipeline:** Hallucinate environments → Train agents inside them → Agents beat real-world RL training. +- This could represent a **fundamentally different way of training models** going forward — potentially a new paradigm beyond standard RLHF/RLAIF. +- Could be used to **fine-tune models for specific tasks** by generating tailored synthetic environments. + +## Links + +- **Paper:** [arXiv:2606.24597](https://arxiv.org/abs/2606.24597) +- **Blog:** https://qwen.ai/blog?id=qwen-agentworld +- **GitHub:** https://github.com/QwenLM/Qwen-AgentWorld +- **HuggingFace:** https://huggingface.co/collections/Qwen/qwen-agentworld + +## Relevance + +This connects to the broader world-model discussion in the wiki (see [[world-models-jepa-vs-generative]]). While the JEPA vs. generative debate focuses on *what kind* of world model to build, Qwen-AgentWorld demonstrates a *use case*: world models as training environment generators for RL agents. This is orthogonal to the JEPA/generative debate — it's about applying world models to agent training rather than building world models from first principles. + +The "hallucinated environments" paradigm also connects to the synthetic data / self-play discussion in AI training — agents learning from model-generated experiences rather than real-world interaction. + +## Related Wiki Pages + +- `[[wiki/concepts/world-models-jepa-vs-generative.md]]` — JEPA vs. generative world model debate +- `[[wiki/concepts/llm/post-transformer-llm-architectures.md]]` — Post-transformer architectures including world models +- `[[wiki/concepts/llm/llm-model-catalog.md]]` — Qwen models in the catalog +- `[[wiki/architecture/deepmind-beyond-transformer.md]]` — DeepMind's world model strategy \ No newline at end of file diff --git a/wiki/concepts/world-model-rl-training.md b/wiki/concepts/world-model-rl-training.md new file mode 100644 index 0000000..4341718 --- /dev/null +++ b/wiki/concepts/world-model-rl-training.md @@ -0,0 +1,99 @@ +--- +created: 2026-06-25 +updated: 2026-06-25 +sources: + - youtube/2026-06-25_qwen-agentworld-world-model-rl.md +tags: [concept, world-models, rl, reinforcement-learning, agent-training, hallucinated-environments, qwen, synthetic-data, agi] +--- + +# World Models for RL Training — Qwen-AgentWorld + +> **Stand:** 2026-06-25. Quelle: Sam Witteveon YouTube-Video „Qwen-AgentWorld: The World Model for RL Environments" (16:31, 2026-06-25). + +## Kernidee + +**Qwen-AgentWorld** (Alibaba/QwenLM) ist ein Weltmodell, das RL-Umgebungen **halluziniert** — anstatt Agenten in realen Umgebungen zu trainieren, generiert das Weltmodell synthetische Trainingsumgebungen. Agenten, die in diesen hallucinated environments trainiert wurden, **schlagen Agenten, die in realen RL-Umgebungen trainiert wurden** — auf der eigenen Benchmark des Teams, und auch beim Vergleich mit **GPT-5.4 und Claude**. + +## Pipeline + +``` +Weltmodell halluciniert Umgebung + ↓ +Agent trainiert in hallucinated environment + ↓ +Agent schlägt real-world RL training +``` + +Dies ist eine **dritte Trainingsschiene** jenseits der klassischen dichotomie: + +1. **RLHF/RLAIF** — Agent lernt aus menschlichem/AI-Feedback +2. **Self-Play** — Agent lernt durch Spielen gegen sich selbst (AlphaGo, Dota-OpenAI) +3. **Hallucinated Environment Training** (neu) — Agent lernt in einer vom Weltmodell generierten Simulation + +## Warum es bedeutsam ist + +### 1. Weltmodelle als Trainings-Infrastruktur + +Bisher: Weltmodelle (VEO, JEPA) wurden primär als **Komponente des AGI-Pfads** diskutiert — als Verständnis-Engine, die Physik, Kausalität, Objektpermanenz lernt (siehe [[world-models-jepa-vs-generative.md]]). + +Qwen-AgentWorld dreht das um: **Das Weltmodell ist nicht das zu trainierende Subjekt, sondern die Trainingsumgebung.** Es generiert Erfahrungen für andere Agenten — eine völlig andere Anwendung desselben Konzepts. + +### 2. Skalierbarkeit von RL-Training + +Real-world RL-Umgebungen sind teuer: sie erfordern simulierte Physik-Engines, definierte Reward-Funktionen und unzählige Episoden. Wenn ein Weltmodell diese Umgebungen halluzinieren kann, **wird RL-Training so billig wie Inference** — das Weltmodell generiert unendlich viele Umgebungen bei marginalen Kosten. + +### 3. Fine-Tuning für spezifische Aufgaben + +Der Ansatz erlaubt **task-spezifische Umgebungsgenerierung**: statt eine allgemeine RL-Benchmark zu bauen, kann das Weltmodell eine Umgebung generieren, die genau auf die gewünschte Fähigkeit zugeschnitten ist. Dies könnte eine neue Form des Fine-Tuning werden — eine Alternative zu SFT und RLHF für domänenspezifische Modelle. + +### 4. Beziehung zu Synthetic Data und Self-Play + +Qwen-AgentWorld steht im **Kontext** weiterer Trends: + +| Ansatz | Was wird synthetisiert | Lernsignal | +|--------|----------------------|-----------| +| **Synthetic Data (SFT)** | Trainingsbeispiele | Imitation | +| **Self-Play** | Gegner | Win/Loss | +| **Constitutional AI** | Verfassung/Regeln | Kritik-Feedback | +| **Hallucinated Environments** | RL-Umgebung | Reward in generierter Sim | + +Die Erkenntnis, dass Agenten aus hallucinated environments **echte RL-Agenten schlagen**, deutet darauf hin, dass die generierte Umgebung **relevantere Trainings-Signale** enthält als die echte Umgebung — möglicherweise, weil das Weltmodell schwierige/kritische Szenarien gezielt generieren kann (Curriculum Learning durch Halluzination). + +## Einordnung in die Weltmodell-Debatte + +| Dimension | JEPA (LeCun) | Generativ (Hassabis) | Qwen-AgentWorld | +|-----------|-------------|---------------------|-----------------| +| **Ziel** | Welt-Verständnis | Welt-Generation | Welt-Simulation für Training | +| **Output** | Embeddings | Pixel/Video | RL-Umgebungen | +| **Nutzung** | Reasoning/Planning | Video-Generation | Agent-Training | +| **Evaluation** | Downstream-Tasks | „Schau das Video" | Agent-Performance in real RL | + +Qwen-AgentWorld ist **orthogonal zur JEPA-vs-Generativ-Debatte**: es geht um die *Anwendung* eines Weltmodells (Trainingsumgebung generieren), nicht um die *Architektur* des Weltmodells. Das Qwen-Team hat nicht öffentlich spezifiziert, ob AgentWorld ein generatives oder JEPA-artiges Modell ist. + +## Beziehung zu AGI-Pfaden + +- **Aschenbrenner-These** ([[../agi/aschenbrenner-situational-awareness.md]]): „The Project" skaliert Compute für AR-LLMs. Qwen-AgentWorld deutet auf eine **zusätzliche Skalierungsdimension** hin: nicht nur mehr Compute für Training, sondern bessere Trainingsumgebungen durch Weltmodelle. +- **DeepMind-Strategie** ([[../../architecture/deepmind-beyond-transformer.md]]): DeepMind investiert in Weltmodelle als AGI-Komponente. Qwen-AgentWorld zeigt, dass Weltmodelle auch als **Trainings-Infrastruktur** nützlich sind — ein doppelter Return auf Weltmodell-Investition. + +## Offene Fragen + +1. **Welche Art von Weltmodell** ist AgentWorld? (Generativ, JEPA, hybrid?) +2. **Wie wird verhindert, dass das Weltmodell unrealistische Umgebungen generiert?** (Reward-Hacking in der Simulation) +3. **Generalisierung:** Funktioniert dies für beliebige RL-Domänen (Robotik, Atari, Multi-Agent)? +4. **Open-Source-Effekt:** GitHub-Repo und HuggingFace-Collection sind verfügbar — wie schnell wird dies adaptiert? + +## Externe Primärquellen + +- **Paper:** [arXiv:2606.24597](https://arxiv.org/abs/2606.24597) +- **Blog:** https://qwen.ai/blog?id=qwen-agentworld +- **GitHub:** https://github.com/QwenLM/Qwen-AgentWorld +- **HuggingFace:** https://huggingface.co/collections/Qwen/qwen-agentworld +- **Video:** https://www.youtube.com/watch?v=VzmMQWRhlBw + +## Verwandte Wiki-Seiten + +- `[[world-models-jepa-vs-generative.md]]` — JEPA vs. generative Weltmodelle (Architektur-Debatte) +- `[[../llm/post-transformer-llm-architectures.md]]` — Post-Transformer-Architekturen inkl. Weltmodell-Sektion +- `[[../llm/llm-model-catalog.md]]` — Qwen-Modelle im Katalog +- `[[../../architecture/deepmind-beyond-transformer.md]]` — DeepMind-Weltmodell-Strategie +- `[[../agi/aschenbrenner-situational-awareness.md]]` — AGI-Compute-Skalierung \ No newline at end of file diff --git a/wiki/concepts/world-models-jepa-vs-generative.md b/wiki/concepts/world-models-jepa-vs-generative.md index ce66c1d..aeb1738 100644 --- a/wiki/concepts/world-models-jepa-vs-generative.md +++ b/wiki/concepts/world-models-jepa-vs-generative.md @@ -1,10 +1,10 @@ --- created: 2026-06-18 -updated: 2026-06-18 +updated: 2026-06-25 sources: - youtube/2026-06-18_deepmind-beyond-transformer.md - youtube/2026-06-16_deepmind-two-steps-ahead.md -tags: [concept, world-models, jepa, hassabis, lecun, generative, video-generation, v-jepa, veo, agi, deepmind, meta] +tags: [concept, world-models, jepa, hassabis, lecun, generative, video-generation, v-jepa, veo, agi, deepmind, meta, rl-training, qwen-agentworld] --- # Weltmodelle: JEPA vs. Generativ — Die Hassabis-LeCun-Debatte @@ -100,6 +100,7 @@ Zwei Antworten, zwei Lager, zwei verschiedene Trainingsziele. - `[[../concepts/llm/post-transformer-llm-architectures.md]]` — Vier-Säulen-Übersicht inkl. Weltmodell-Sektion - `[[transformer-foundation.md]]` — Klassischer Transformer als Vergleichsbasis - `[[../concepts/agi/aschenbrenner-situational-awareness.md]]` — AGI-Realismus: „OOMs zählen" + The Project +- `[[world-model-rl-training.md]]` — **NEU 2026-06-25:** Qwen-AgentWorld — Weltmodelle als RL-Trainingsumgebungen (orthogonal zur Architektur-Debatte) ## Externe Primärquellen diff --git a/wiki/index.md b/wiki/index.md index d71fbc9..e222027 100644 --- a/wiki/index.md +++ b/wiki/index.md @@ -2,7 +2,7 @@ *Auto-generated: 2026-06-23* -*Letzte Aktualisierung: 2026-06-25 (31. Update — Hermes Agent Ingest: Peter Yangs Kurs hinzugefügt. Raw-Datei `youtube/2026-06-24_peter-yang-hermes-full-course.md`.)* +*Letzte Aktualisierung: 2026-06-25 (32. Update — Qwen-AgentWorld: Weltmodelle als RL-Trainingsumgebungen. Raw-Datei `youtube/2026-06-25_qwen-agentworld-world-model-rl.md`.)* ## Architecture @@ -44,6 +44,7 @@ | Seite | Beschreibung | Quellen | |-------|-------------|---------| | [Weltmodelle: JEPA vs. Generativ](concepts/world-models-jepa-vs-generative.md) | Hassabis-vs-LeCun-Debatte strukturiert: Generative Weltmodelle (VEO, Pixel-Rekonstruktion, Compute-intensiv) vs. JEPA (V-JEPA, Embedding-Konsistenz, theoretisch effizienter, empirisch noch nicht an der Spitze). AGI-Weltmodell-Wette bis 2028-2030 | youtube/2026-06-18_deepmind-beyond-transformer.md + youtube/2026-06-16_deepmind-two-steps-ahead.md | +| [World Models for RL Training — Qwen-AgentWorld](concepts/world-model-rl-training.md) | Qwen-AgentWorld: Weltmodell halluziniert RL-Umgebungen → Agenten trainieren darin → schlagen real-world RL + GPT-5.4/Claude. Dritte Trainingsschiene jenseits RLHF/Self-Play. Cross-Ref zu JEPA-Debatte. | youtube/2026-06-25_qwen-agentworld-world-model-rl.md | ### LLM | Seite | Beschreibung | Quellen | diff --git a/wiki/log.md b/wiki/log.md index 8a0f3fb..19d241f 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -786,3 +786,16 @@ Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Über - wiki: `index.md` (updated — Header auf "27. Update", neuer LLM-Eintrag unter Concepts/LLM Sektion) - log: updated (dieser Eintrag) **Hector-Hauptthese:** Der Katalog schließt eine Lücke im Wiki-System: Bisher waren Modell-Informationen über 11+ verstreute Wiki-Seiten verteilt (GLM-5.2-Seite, Kimi-K2.7-Seite, Claude-Seite, GPT-Seite, Cloud-Exit-Seite, Model-Routing-Seite, Showdown-Seite, Fusion-Seite, Post-Transformer-Seite, Flat-Curve-Seite, OME21-Briefing). Die Konsolidierungsseite macht alle Modelle auffindbar an einem Ort, mit klarem Fokus auf lokale Deployment-Optionen — passend zur Cloud-Exit-Strategie und Yegges Flat-Curve-These (Frontier-Lockdown → OSS-Modelle aufgewertet). Die Hector's Active Stack-Tabelle dokumentiert erstmals den vollständigen Provider-Bestand mit Rollen-Attribution. + +## [2026-06-25] Ingest | Qwen-AgentWorld — Weltmodelle als RL-Trainingsumgebungen +**Type:** ingest | **Scope:** raw/youtube, wiki/concepts, wiki/index +**Source:** Sam Witteveen YouTube-Video "Qwen-AgentWorld: The World Model for RL Environments" (16:31, 2026-06-25) — https://www.youtube.com/watch?v=VzmMQWRhlBw +**Trigger:** Video-Link im Chat geteilt. Qwen-AgentWorld: Weltmodell halluziniert RL-Umgebungen → Agenten trainieren darin → schlagen real-world RL + GPT-5.4/Claude. +**Actions:** +- raw: `raw/youtube/2026-06-25_qwen-agentworld-world-model-rl.md` (created — 2.9 KB; Frontmatter + Summary + Key Points + Links + Relevance + Related Wiki Pages) +- wiki (NEU): `concepts/world-model-rl-training.md` (created — 6.0 KB; Kernidee, Pipeline, Warum bedeutsam [4 Sektionen: Trainings-Infrastruktur, Skalierbarkeit, Fine-Tuning, Synthetic Data Kontext], Einordnung in JEPA-Debatte mit Vergleichstabelle, AGI-Pfad-Bezüge, offene Fragen, externe Quellen, Cross-Refs zu 5 Wiki-Seiten) +- wiki (UPDATE): `concepts/world-models-jepa-vs-generative.md` — updated-Datum auf 2026-06-25, tags um `rl-training` + `qwen-agentworld` erweitert, neuen Cross-Ref zu `[[world-model-rl-training.md]]` in Verwandte Wiki-Seiten hinzugefügt +- wiki: `index.md` (updated — Header auf "32. Update", neue World-Models-Zeile unter Concepts Sektion) +- log: this entry +**Hector-Hauptthese:** Qwen-AgentWorld ist orthogonal zur JEPA-vs-Generativ-Debatte: es geht um die *Anwendung* eines Weltmodells (RL-Trainingsumgebung generieren), nicht um die *Architektur*. Die "dritte Trainingsschiene" (hallucinated environments) ergänzt RLHF und Self-Play — und deutet auf einen doppelten Return für Weltmodell-Investitionen hin: das Weltmodell ist nicht nur AGI-Komponente, sondern auch Trainings-Infrastruktur. Wenn Agenten aus hallucinated environments echte RL-Agenten schlagen, ist das RL-Training so billig wie Inference — eine mögliche Paradigmenverschiebung. +**Subagent-Modell:** ollama/glm-5.2:cloud