- raw: youtube/2026-06-25_qwen-agentworld-world-model-rl.md - wiki (new): concepts/world-model-rl-training.md - wiki (update): concepts/world-models-jepa-vs-generative.md (cross-ref) - index.md: 32. Update, new World Models entry - log.md: appended
7.1 KiB
| created | updated | sources | tags | ||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-06-18 | 2026-06-25 |
|
|
Weltmodelle: JEPA vs. Generativ — Die Hassabis-LeCun-Debatte
Stand: 2026-06-18. Quellen: Pourya Kordi Video „DeepMind Was Two Steps Ahead, AGAIN!" (Pit-Zusammenfassung in OME Topic 6 / aGi / eMergence, 2026-06-18) und Schwester-Ingest vom 2026-06-16 (Topic 13). YouTube-Transkript nicht abrufbar (LOGIN_REQUIRED).
Diese Konzept-Seite strukturiert die theoretische und strategische Debatte zwischen zwei fundamental verschiedenen Wegen zu einem Weltmodell: generative Rekonstruktion (Hassabis) vs. Joint-Embedding-Prediction (LeCun). Die Seite ist konzeptuell fokussiert — die breitere DeepMind-Architektur-Strategie liegt auf [[../architecture/deepmind-beyond-transformer.md]], die technischen Säulen auf [[../concepts/llm/post-transformer-llm-architectures.md]].
Grundfrage
Wie lernt ein Modell die latente Struktur der Welt — Physik, Objektpermanenz, Kausalität, räumliche/zeitliche Konsistenz?
Zwei Antworten, zwei Lager, zwei verschiedene Trainingsziele.
Pfad A: Generative Weltmodelle (Hassabis-Lager)
Demis Hassabis (DeepMind): Realistische Video-Generatoren wie VEO sind nicht nur „schöne Pixel". Wer glaubwürdige Szenen erzeugt, muss latente Regularitäten gelernt haben — sonst wären die Szenen physikalisch inkonsistent.
Trainingsziel: Rekonstruktion aus Rauschen (Diffusion).
Vertreter:
- VEO (Google DeepMind) — Video-Generation auf Weltmodell-Niveau
- Sora (OpenAI) — Vergleichsfall; wurde laut Pit zugunsten des GPT-Stacks zurückgefahren (OpenAI DevDay 2024)
- Gemini Diffusion — Text-Diffusion als Schwester-Pfad
Stärken:
- Implizit Weltregularitäten (Physik, Objektpermanenz, Kausalität)
- Output-Qualität ist sichtbar — generierte Videos „beweisen" das Modell
- Direkter Weg zu Anwendungen (VEO ist Produkt-fähig)
Schwächen:
- Compute-Verschwendung für unwesentliche Details (LeCuns Hauptkritik: „Blattflattern im Wind")
- Latente Repräsentation ist implizit — schwer zu interpretieren oder gezielt zu nutzen
- Skaliert möglicherweise ineffizient — je realistischer das Pixel-Output, desto mehr Bits für unvorhersagbares Rauschen
Pfad B: JEPA — Joint Embedding Predictive Architecture (LeCun-Lager)
Yann LeCun (Meta): Rein generative Objectives sind fundamental verschwenderisch. Statt Pixel zu rekonstruieren, sollen Modelle kompatible Repräsentationen für fehlende Teile vorhersagen — Embeddings, keine Pixel.
Trainingsziel: Konsistenz von Repräsentationen (Kontext-Encoder + Target-Encoder + Prädiktor im Embedding-Space).
Vertreter:
- V-JEPA (Meta AI Research) — Video-JEPA, arXiv:2404.08471, Meta Blog
- I-JEPA (Image-JEPA) — Vorgänger
- Original JEPA-Framework: LeCun, OpenReview 2022
Stärken:
- Theoretisch effizienter — sagt nur Embeddings voraus, keine Pixel-Detailflut
- Skaliert besser, weil Compute dort investiert wird, wo er zählt (Regularitäten, nicht Rauschen)
- Latente Repräsentation ist explizit und nutzbar für Planung, Suche, Reasoning
Schwächen:
- Empirisch (noch) hinter den Top-Generatoren — keine vergleichbar beeindruckenden Demos
- Schwer zu evaluieren, weil keine direkten „Generierungs-Beweise" wie bei VEO
- Braucht eine zweite Stufe (Decoder, Renderer) für sichtbare Outputs
Trade-offs auf einen Blick
| Dimension | Generativ (Hassabis) | JEPA (LeCun) |
|---|---|---|
| Trainingsziel | Pixel-Rekonstruktion | Embedding-Konsistenz |
| Compute-Effizienz | niedriger (Blattflattern-Problem) | höher (theoretisch) |
| Skalierbarkeit | qualitativ begrenzt durch Pixel-Rauschen | qualitativ offen |
| Output-Qualität (empirisch 2026) | sehr hoch (VEO) | noch im Aufbau |
| Latente Repräsentation | implizit, schwer nutzbar | explizit, planbar |
| Reifegrad | produktionsreif | Forschung |
| Verifikation | „Schau das Video an" | braucht Downstream-Tasks |
Der aktuelle Stand 2026
Pit-Zusammenfassung (2026-06-18): „VEO-ähnliche Generatoren müssen latente Physik/Objektpermanenz/Kausalität gelernt haben" — Hassabis-These als Konsens innerhalb der DeepMind-Strategie. LeCuns JEPA-Gegenposition ist konzeptionell elegant, aber empirisch nicht an der Spitze.
Hectors Einordnung: Die Debatte ist nicht „wer hat recht" — beide Pfade verfolgen dasselbe Ziel mit verschiedenen Methoden:
- Hassabis: „Zeig mir, dass du die Welt verstehst, indem du sie generierst." Empirie-first.
- LeCun: „Lerne die Welt als kompaktes Modell, bevor du Pixel verschwendest." Theorie-first.
Wette: Wer bis 2028-2030 das produktionsreifere Weltmodell hat, das mehr ist als Video-Generation (echtes Planning, Reasoning, Counterfactuals), gewinnt die AGI-Weltmodell-Komponente. Hassabis spielt auf Sichtbarkeit (VEO-Demos); LeCun spielt auf Fundament (V-JEPA als Vor-Bedingung für alles weitere).
Strategische Konsequenzen für AGI
| These | Vertreter | Konsequenz |
|---|---|---|
| Generative Weltmodelle = AGI-Weg | Hassabis, DeepMind | Compute → Video-Generation → Weltmodell → AGI |
| JEPA = notwendige Vorbedingung | LeCun, Meta | Erst Repräsentationen lernen, dann generieren — wie Sprache vor Sprechen |
| Hybrid | (offen) | JEPA-Encoder → Planung → Generativer Decoder |
OpenAI/Anthropic: Beide Labors verfolgen aktuell keine explizite Weltmodell-Strategie. Sie skalieren AR-LLMs weiter. Dies ist ein blinder Fleck im AR-Only-Wettlauf — und der Hauptgrund, warum DeepMind seine Compute-Allokation breiter streut.
Verwandte Wiki-Seiten
[[../architecture/deepmind-beyond-transformer.md]]— Strategischer Kontrast DeepMind vs. AR-Only-Labs[[../concepts/llm/post-transformer-llm-architectures.md]]— Vier-Säulen-Übersicht inkl. Weltmodell-Sektion[[transformer-foundation.md]]— Klassischer Transformer als Vergleichsbasis[[../concepts/agi/aschenbrenner-situational-awareness.md]]— AGI-Realismus: „OOMs zählen" + The Project[[world-model-rl-training.md]]— NEU 2026-06-25: Qwen-AgentWorld — Weltmodelle als RL-Trainingsumgebungen (orthogonal zur Architektur-Debatte)
Externe Primärquellen
- V-JEPA Paper: arXiv:2404.08471
- V-JEPA Meta Blog: https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/
- LeCun JEPA Framework: https://openreview.net/pdf?id=BZ5a1r-kVsf
- Yann LeCun Position Papers: Meta AI Research
- Demis Hassabis Position (VEO/Weltmodell): Google DeepMind Blog
- Pourya Kordi Video: https://www.youtube.com/watch?v=8oyZB24-vAM