- raw: youtube/2026-06-25_qwen-agentworld-world-model-rl.md - wiki (new): concepts/world-model-rl-training.md - wiki (update): concepts/world-models-jepa-vs-generative.md (cross-ref) - index.md: 32. Update, new World Models entry - log.md: appended
112 lines
No EOL
7.1 KiB
Markdown
112 lines
No EOL
7.1 KiB
Markdown
---
|
|
created: 2026-06-18
|
|
updated: 2026-06-25
|
|
sources:
|
|
- youtube/2026-06-18_deepmind-beyond-transformer.md
|
|
- youtube/2026-06-16_deepmind-two-steps-ahead.md
|
|
tags: [concept, world-models, jepa, hassabis, lecun, generative, video-generation, v-jepa, veo, agi, deepmind, meta, rl-training, qwen-agentworld]
|
|
---
|
|
|
|
# Weltmodelle: JEPA vs. Generativ — Die Hassabis-LeCun-Debatte
|
|
|
|
> **Stand:** 2026-06-18. Quellen: Pourya Kordi Video „DeepMind Was Two Steps Ahead, AGAIN!" (Pit-Zusammenfassung in OME Topic 6 / aGi / eMergence, 2026-06-18) und Schwester-Ingest vom 2026-06-16 (Topic 13). YouTube-Transkript nicht abrufbar (LOGIN_REQUIRED).
|
|
|
|
Diese Konzept-Seite strukturiert die **theoretische und strategische Debatte** zwischen zwei fundamental verschiedenen Wegen zu einem Weltmodell: **generative Rekonstruktion** (Hassabis) vs. **Joint-Embedding-Prediction** (LeCun). Die Seite ist konzeptuell fokussiert — die breitere DeepMind-Architektur-Strategie liegt auf `[[../architecture/deepmind-beyond-transformer.md]]`, die technischen Säulen auf `[[../concepts/llm/post-transformer-llm-architectures.md]]`.
|
|
|
|
## Grundfrage
|
|
|
|
> Wie lernt ein Modell die latente Struktur der Welt — Physik, Objektpermanenz, Kausalität, räumliche/zeitliche Konsistenz?
|
|
|
|
Zwei Antworten, zwei Lager, zwei verschiedene Trainingsziele.
|
|
|
|
## Pfad A: Generative Weltmodelle (Hassabis-Lager)
|
|
|
|
**Demis Hassabis (DeepMind):** Realistische Video-Generatoren wie VEO sind nicht nur „schöne Pixel". Wer glaubwürdige Szenen erzeugt, **muss** latente Regularitäten gelernt haben — sonst wären die Szenen physikalisch inkonsistent.
|
|
|
|
**Trainingsziel:** Rekonstruktion aus Rauschen (Diffusion).
|
|
|
|
**Vertreter:**
|
|
- **VEO** (Google DeepMind) — Video-Generation auf Weltmodell-Niveau
|
|
- **Sora** (OpenAI) — Vergleichsfall; wurde laut Pit zugunsten des GPT-Stacks zurückgefahren (OpenAI DevDay 2024)
|
|
- **Gemini Diffusion** — Text-Diffusion als Schwester-Pfad
|
|
|
|
**Stärken:**
|
|
- Implizit Weltregularitäten (Physik, Objektpermanenz, Kausalität)
|
|
- Output-Qualität ist sichtbar — generierte Videos „beweisen" das Modell
|
|
- Direkter Weg zu Anwendungen (VEO ist Produkt-fähig)
|
|
|
|
**Schwächen:**
|
|
- **Compute-Verschwendung** für unwesentliche Details (LeCuns Hauptkritik: „Blattflattern im Wind")
|
|
- Latente Repräsentation ist implizit — schwer zu interpretieren oder gezielt zu nutzen
|
|
- Skaliert möglicherweise ineffizient — je realistischer das Pixel-Output, desto mehr Bits für unvorhersagbares Rauschen
|
|
|
|
## Pfad B: JEPA — Joint Embedding Predictive Architecture (LeCun-Lager)
|
|
|
|
**Yann LeCun (Meta):** Rein generative Objectives sind fundamental verschwenderisch. Statt Pixel zu rekonstruieren, sollen Modelle **kompatible Repräsentationen** für fehlende Teile vorhersagen — Embeddings, keine Pixel.
|
|
|
|
**Trainingsziel:** Konsistenz von Repräsentationen (Kontext-Encoder + Target-Encoder + Prädiktor im Embedding-Space).
|
|
|
|
**Vertreter:**
|
|
- **V-JEPA** (Meta AI Research) — Video-JEPA, [arXiv:2404.08471](https://arxiv.org/abs/2404.08471), [Meta Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/)
|
|
- **I-JEPA** (Image-JEPA) — Vorgänger
|
|
- **Original JEPA-Framework:** LeCun, [OpenReview 2022](https://openreview.net/pdf?id=BZ5a1r-kVsf)
|
|
|
|
**Stärken:**
|
|
- **Theoretisch effizienter** — sagt nur Embeddings voraus, keine Pixel-Detailflut
|
|
- **Skaliert besser**, weil Compute dort investiert wird, wo er zählt (Regularitäten, nicht Rauschen)
|
|
- Latente Repräsentation ist **explizit** und nutzbar für Planung, Suche, Reasoning
|
|
|
|
**Schwächen:**
|
|
- **Empirisch (noch) hinter** den Top-Generatoren — keine vergleichbar beeindruckenden Demos
|
|
- Schwer zu evaluieren, weil keine direkten „Generierungs-Beweise" wie bei VEO
|
|
- Braucht eine **zweite Stufe** (Decoder, Renderer) für sichtbare Outputs
|
|
|
|
## Trade-offs auf einen Blick
|
|
|
|
| Dimension | Generativ (Hassabis) | JEPA (LeCun) |
|
|
|-----------|----------------------|--------------|
|
|
| **Trainingsziel** | Pixel-Rekonstruktion | Embedding-Konsistenz |
|
|
| **Compute-Effizienz** | niedriger (Blattflattern-Problem) | höher (theoretisch) |
|
|
| **Skalierbarkeit** | qualitativ begrenzt durch Pixel-Rauschen | qualitativ offen |
|
|
| **Output-Qualität (empirisch 2026)** | sehr hoch (VEO) | noch im Aufbau |
|
|
| **Latente Repräsentation** | implizit, schwer nutzbar | explizit, planbar |
|
|
| **Reifegrad** | produktionsreif | Forschung |
|
|
| **Verifikation** | „Schau das Video an" | braucht Downstream-Tasks |
|
|
|
|
## Der aktuelle Stand 2026
|
|
|
|
**Pit-Zusammenfassung (2026-06-18):** „VEO-ähnliche Generatoren müssen latente Physik/Objektpermanenz/Kausalität gelernt haben" — Hassabis-These als Konsens innerhalb der DeepMind-Strategie. LeCuns JEPA-Gegenposition ist **konzeptionell elegant**, aber empirisch nicht an der Spitze.
|
|
|
|
**Hectors Einordnung:** Die Debatte ist nicht „wer hat recht" — beide Pfade verfolgen dasselbe Ziel mit verschiedenen Methoden:
|
|
|
|
- **Hassabis:** „Zeig mir, dass du die Welt verstehst, indem du sie generierst." Empirie-first.
|
|
- **LeCun:** „Lerne die Welt als kompaktes Modell, bevor du Pixel verschwendest." Theorie-first.
|
|
|
|
**Wette:** Wer bis 2028-2030 das produktionsreifere Weltmodell hat, das mehr ist als Video-Generation (echtes Planning, Reasoning, Counterfactuals), gewinnt die AGI-Weltmodell-Komponente. Hassabis spielt auf Sichtbarkeit (VEO-Demos); LeCun spielt auf Fundament (V-JEPA als Vor-Bedingung für alles weitere).
|
|
|
|
## Strategische Konsequenzen für AGI
|
|
|
|
| These | Vertreter | Konsequenz |
|
|
|-------|-----------|-----------|
|
|
| **Generative Weltmodelle = AGI-Weg** | Hassabis, DeepMind | Compute → Video-Generation → Weltmodell → AGI |
|
|
| **JEPA = notwendige Vorbedingung** | LeCun, Meta | Erst Repräsentationen lernen, dann generieren — wie Sprache vor Sprechen |
|
|
| **Hybrid** | (offen) | JEPA-Encoder → Planung → Generativer Decoder |
|
|
|
|
**OpenAI/Anthropic:** Beide Labors verfolgen aktuell **keine explizite Weltmodell-Strategie**. Sie skalieren AR-LLMs weiter. Dies ist ein blinder Fleck im AR-Only-Wettlauf — und der Hauptgrund, warum DeepMind seine Compute-Allokation breiter streut.
|
|
|
|
## Verwandte Wiki-Seiten
|
|
|
|
- `[[../architecture/deepmind-beyond-transformer.md]]` — Strategischer Kontrast DeepMind vs. AR-Only-Labs
|
|
- `[[../concepts/llm/post-transformer-llm-architectures.md]]` — Vier-Säulen-Übersicht inkl. Weltmodell-Sektion
|
|
- `[[transformer-foundation.md]]` — Klassischer Transformer als Vergleichsbasis
|
|
- `[[../concepts/agi/aschenbrenner-situational-awareness.md]]` — AGI-Realismus: „OOMs zählen" + The Project
|
|
- `[[world-model-rl-training.md]]` — **NEU 2026-06-25:** Qwen-AgentWorld — Weltmodelle als RL-Trainingsumgebungen (orthogonal zur Architektur-Debatte)
|
|
|
|
## Externe Primärquellen
|
|
|
|
- **V-JEPA Paper:** [arXiv:2404.08471](https://arxiv.org/abs/2404.08471)
|
|
- **V-JEPA Meta Blog:** https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/
|
|
- **LeCun JEPA Framework:** https://openreview.net/pdf?id=BZ5a1r-kVsf
|
|
- **Yann LeCun Position Papers:** [Meta AI Research](https://ai.meta.com/research/)
|
|
- **Demis Hassabis Position (VEO/Weltmodell):** [Google DeepMind Blog](https://blog.google/technology/google-deepmind/google-gemini-updates/)
|
|
- **Pourya Kordi Video:** https://www.youtube.com/watch?v=8oyZB24-vAM |