# Weltmodelle: JEPA vs. Generativ — Die Hassabis-LeCun-Debatte
> **Stand:** 2026-06-18. Quellen: Pourya Kordi Video „DeepMind Was Two Steps Ahead, AGAIN!" (Pit-Zusammenfassung in OME Topic 6 / aGi / eMergence, 2026-06-18) und Schwester-Ingest vom 2026-06-16 (Topic 13). YouTube-Transkript nicht abrufbar (LOGIN_REQUIRED).
Diese Konzept-Seite strukturiert die **theoretische und strategische Debatte** zwischen zwei fundamental verschiedenen Wegen zu einem Weltmodell: **generative Rekonstruktion** (Hassabis) vs. **Joint-Embedding-Prediction** (LeCun). Die Seite ist konzeptuell fokussiert — die breitere DeepMind-Architektur-Strategie liegt auf `[[../architecture/deepmind-beyond-transformer.md]]`, die technischen Säulen auf `[[../concepts/llm/post-transformer-llm-architectures.md]]`.
## Grundfrage
> Wie lernt ein Modell die latente Struktur der Welt — Physik, Objektpermanenz, Kausalität, räumliche/zeitliche Konsistenz?
Zwei Antworten, zwei Lager, zwei verschiedene Trainingsziele.
**Demis Hassabis (DeepMind):** Realistische Video-Generatoren wie VEO sind nicht nur „schöne Pixel". Wer glaubwürdige Szenen erzeugt, **muss** latente Regularitäten gelernt haben — sonst wären die Szenen physikalisch inkonsistent.
**Trainingsziel:** Rekonstruktion aus Rauschen (Diffusion).
**Vertreter:**
- **VEO** (Google DeepMind) — Video-Generation auf Weltmodell-Niveau
- **Sora** (OpenAI) — Vergleichsfall; wurde laut Pit zugunsten des GPT-Stacks zurückgefahren (OpenAI DevDay 2024)
- **Gemini Diffusion** — Text-Diffusion als Schwester-Pfad
**Yann LeCun (Meta):** Rein generative Objectives sind fundamental verschwenderisch. Statt Pixel zu rekonstruieren, sollen Modelle **kompatible Repräsentationen** für fehlende Teile vorhersagen — Embeddings, keine Pixel.
**Trainingsziel:** Konsistenz von Repräsentationen (Kontext-Encoder + Target-Encoder + Prädiktor im Embedding-Space).
**Vertreter:**
- **V-JEPA** (Meta AI Research) — Video-JEPA, [arXiv:2404.08471](https://arxiv.org/abs/2404.08471), [Meta Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/)
| **Verifikation** | „Schau das Video an" | braucht Downstream-Tasks |
## Der aktuelle Stand 2026
**Pit-Zusammenfassung (2026-06-18):** „VEO-ähnliche Generatoren müssen latente Physik/Objektpermanenz/Kausalität gelernt haben" — Hassabis-These als Konsens innerhalb der DeepMind-Strategie. LeCuns JEPA-Gegenposition ist **konzeptionell elegant**, aber empirisch nicht an der Spitze.
**Hectors Einordnung:** Die Debatte ist nicht „wer hat recht" — beide Pfade verfolgen dasselbe Ziel mit verschiedenen Methoden:
- **Hassabis:** „Zeig mir, dass du die Welt verstehst, indem du sie generierst." Empirie-first.
- **LeCun:** „Lerne die Welt als kompaktes Modell, bevor du Pixel verschwendest." Theorie-first.
**Wette:** Wer bis 2028-2030 das produktionsreifere Weltmodell hat, das mehr ist als Video-Generation (echtes Planning, Reasoning, Counterfactuals), gewinnt die AGI-Weltmodell-Komponente. Hassabis spielt auf Sichtbarkeit (VEO-Demos); LeCun spielt auf Fundament (V-JEPA als Vor-Bedingung für alles weitere).
**OpenAI/Anthropic:** Beide Labors verfolgen aktuell **keine explizite Weltmodell-Strategie**. Sie skalieren AR-LLMs weiter. Dies ist ein blinder Fleck im AR-Only-Wettlauf — und der Hauptgrund, warum DeepMind seine Compute-Allokation breiter streut.
## Verwandte Wiki-Seiten
-`[[../architecture/deepmind-beyond-transformer.md]]` — Strategischer Kontrast DeepMind vs. AR-Only-Labs