--- created: 2026-06-18 updated: 2026-06-25 sources: - youtube/2026-06-18_deepmind-beyond-transformer.md - youtube/2026-06-16_deepmind-two-steps-ahead.md tags: [concept, world-models, jepa, hassabis, lecun, generative, video-generation, v-jepa, veo, agi, deepmind, meta, rl-training, qwen-agentworld] --- # Weltmodelle: JEPA vs. Generativ — Die Hassabis-LeCun-Debatte > **Stand:** 2026-06-18. Quellen: Pourya Kordi Video „DeepMind Was Two Steps Ahead, AGAIN!" (Pit-Zusammenfassung in OME Topic 6 / aGi / eMergence, 2026-06-18) und Schwester-Ingest vom 2026-06-16 (Topic 13). YouTube-Transkript nicht abrufbar (LOGIN_REQUIRED). Diese Konzept-Seite strukturiert die **theoretische und strategische Debatte** zwischen zwei fundamental verschiedenen Wegen zu einem Weltmodell: **generative Rekonstruktion** (Hassabis) vs. **Joint-Embedding-Prediction** (LeCun). Die Seite ist konzeptuell fokussiert — die breitere DeepMind-Architektur-Strategie liegt auf `[[../architecture/deepmind-beyond-transformer.md]]`, die technischen Säulen auf `[[../concepts/llm/post-transformer-llm-architectures.md]]`. ## Grundfrage > Wie lernt ein Modell die latente Struktur der Welt — Physik, Objektpermanenz, Kausalität, räumliche/zeitliche Konsistenz? Zwei Antworten, zwei Lager, zwei verschiedene Trainingsziele. ## Pfad A: Generative Weltmodelle (Hassabis-Lager) **Demis Hassabis (DeepMind):** Realistische Video-Generatoren wie VEO sind nicht nur „schöne Pixel". Wer glaubwürdige Szenen erzeugt, **muss** latente Regularitäten gelernt haben — sonst wären die Szenen physikalisch inkonsistent. **Trainingsziel:** Rekonstruktion aus Rauschen (Diffusion). **Vertreter:** - **VEO** (Google DeepMind) — Video-Generation auf Weltmodell-Niveau - **Sora** (OpenAI) — Vergleichsfall; wurde laut Pit zugunsten des GPT-Stacks zurückgefahren (OpenAI DevDay 2024) - **Gemini Diffusion** — Text-Diffusion als Schwester-Pfad **Stärken:** - Implizit Weltregularitäten (Physik, Objektpermanenz, Kausalität) - Output-Qualität ist sichtbar — generierte Videos „beweisen" das Modell - Direkter Weg zu Anwendungen (VEO ist Produkt-fähig) **Schwächen:** - **Compute-Verschwendung** für unwesentliche Details (LeCuns Hauptkritik: „Blattflattern im Wind") - Latente Repräsentation ist implizit — schwer zu interpretieren oder gezielt zu nutzen - Skaliert möglicherweise ineffizient — je realistischer das Pixel-Output, desto mehr Bits für unvorhersagbares Rauschen ## Pfad B: JEPA — Joint Embedding Predictive Architecture (LeCun-Lager) **Yann LeCun (Meta):** Rein generative Objectives sind fundamental verschwenderisch. Statt Pixel zu rekonstruieren, sollen Modelle **kompatible Repräsentationen** für fehlende Teile vorhersagen — Embeddings, keine Pixel. **Trainingsziel:** Konsistenz von Repräsentationen (Kontext-Encoder + Target-Encoder + Prädiktor im Embedding-Space). **Vertreter:** - **V-JEPA** (Meta AI Research) — Video-JEPA, [arXiv:2404.08471](https://arxiv.org/abs/2404.08471), [Meta Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) - **I-JEPA** (Image-JEPA) — Vorgänger - **Original JEPA-Framework:** LeCun, [OpenReview 2022](https://openreview.net/pdf?id=BZ5a1r-kVsf) **Stärken:** - **Theoretisch effizienter** — sagt nur Embeddings voraus, keine Pixel-Detailflut - **Skaliert besser**, weil Compute dort investiert wird, wo er zählt (Regularitäten, nicht Rauschen) - Latente Repräsentation ist **explizit** und nutzbar für Planung, Suche, Reasoning **Schwächen:** - **Empirisch (noch) hinter** den Top-Generatoren — keine vergleichbar beeindruckenden Demos - Schwer zu evaluieren, weil keine direkten „Generierungs-Beweise" wie bei VEO - Braucht eine **zweite Stufe** (Decoder, Renderer) für sichtbare Outputs ## Trade-offs auf einen Blick | Dimension | Generativ (Hassabis) | JEPA (LeCun) | |-----------|----------------------|--------------| | **Trainingsziel** | Pixel-Rekonstruktion | Embedding-Konsistenz | | **Compute-Effizienz** | niedriger (Blattflattern-Problem) | höher (theoretisch) | | **Skalierbarkeit** | qualitativ begrenzt durch Pixel-Rauschen | qualitativ offen | | **Output-Qualität (empirisch 2026)** | sehr hoch (VEO) | noch im Aufbau | | **Latente Repräsentation** | implizit, schwer nutzbar | explizit, planbar | | **Reifegrad** | produktionsreif | Forschung | | **Verifikation** | „Schau das Video an" | braucht Downstream-Tasks | ## Der aktuelle Stand 2026 **Pit-Zusammenfassung (2026-06-18):** „VEO-ähnliche Generatoren müssen latente Physik/Objektpermanenz/Kausalität gelernt haben" — Hassabis-These als Konsens innerhalb der DeepMind-Strategie. LeCuns JEPA-Gegenposition ist **konzeptionell elegant**, aber empirisch nicht an der Spitze. **Hectors Einordnung:** Die Debatte ist nicht „wer hat recht" — beide Pfade verfolgen dasselbe Ziel mit verschiedenen Methoden: - **Hassabis:** „Zeig mir, dass du die Welt verstehst, indem du sie generierst." Empirie-first. - **LeCun:** „Lerne die Welt als kompaktes Modell, bevor du Pixel verschwendest." Theorie-first. **Wette:** Wer bis 2028-2030 das produktionsreifere Weltmodell hat, das mehr ist als Video-Generation (echtes Planning, Reasoning, Counterfactuals), gewinnt die AGI-Weltmodell-Komponente. Hassabis spielt auf Sichtbarkeit (VEO-Demos); LeCun spielt auf Fundament (V-JEPA als Vor-Bedingung für alles weitere). ## Strategische Konsequenzen für AGI | These | Vertreter | Konsequenz | |-------|-----------|-----------| | **Generative Weltmodelle = AGI-Weg** | Hassabis, DeepMind | Compute → Video-Generation → Weltmodell → AGI | | **JEPA = notwendige Vorbedingung** | LeCun, Meta | Erst Repräsentationen lernen, dann generieren — wie Sprache vor Sprechen | | **Hybrid** | (offen) | JEPA-Encoder → Planung → Generativer Decoder | **OpenAI/Anthropic:** Beide Labors verfolgen aktuell **keine explizite Weltmodell-Strategie**. Sie skalieren AR-LLMs weiter. Dies ist ein blinder Fleck im AR-Only-Wettlauf — und der Hauptgrund, warum DeepMind seine Compute-Allokation breiter streut. ## Verwandte Wiki-Seiten - `[[../architecture/deepmind-beyond-transformer.md]]` — Strategischer Kontrast DeepMind vs. AR-Only-Labs - `[[../concepts/llm/post-transformer-llm-architectures.md]]` — Vier-Säulen-Übersicht inkl. Weltmodell-Sektion - `[[../architecture/transformer-foundation.md]]` — Klassischer Transformer als Vergleichsbasis - `[[../concepts/agi/aschenbrenner-situational-awareness.md]]` — AGI-Realismus: „OOMs zählen" + The Project - `[[world-model-rl-training.md]]` — **NEU 2026-06-25:** Qwen-AgentWorld — Weltmodelle als RL-Trainingsumgebungen (orthogonal zur Architektur-Debatte) ## Externe Primärquellen - **V-JEPA Paper:** [arXiv:2404.08471](https://arxiv.org/abs/2404.08471) - **V-JEPA Meta Blog:** https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/ - **LeCun JEPA Framework:** https://openreview.net/pdf?id=BZ5a1r-kVsf - **Yann LeCun Position Papers:** [Meta AI Research](https://ai.meta.com/research/) - **Demis Hassabis Position (VEO/Weltmodell):** [Google DeepMind Blog](https://blog.google/technology/google-deepmind/google-gemini-updates/) - **Pourya Kordi Video:** https://www.youtube.com/watch?v=8oyZB24-vAM