knowledge-base/wiki/concepts/world-models-jepa-vs-generative.md
Hector f76310836e ingest(youtube): qwen-agentworld-world-model-rl
- raw: youtube/2026-06-25_qwen-agentworld-world-model-rl.md
- wiki (new): concepts/world-model-rl-training.md
- wiki (update): concepts/world-models-jepa-vs-generative.md (cross-ref)
- index.md: 32. Update, new World Models entry
- log.md: appended
2026-06-25 18:36:15 +02:00

7.1 KiB

created updated sources tags
2026-06-18 2026-06-25
youtube/2026-06-18_deepmind-beyond-transformer.md
youtube/2026-06-16_deepmind-two-steps-ahead.md
concept
world-models
jepa
hassabis
lecun
generative
video-generation
v-jepa
veo
agi
deepmind
meta
rl-training
qwen-agentworld

Weltmodelle: JEPA vs. Generativ — Die Hassabis-LeCun-Debatte

Stand: 2026-06-18. Quellen: Pourya Kordi Video „DeepMind Was Two Steps Ahead, AGAIN!" (Pit-Zusammenfassung in OME Topic 6 / aGi / eMergence, 2026-06-18) und Schwester-Ingest vom 2026-06-16 (Topic 13). YouTube-Transkript nicht abrufbar (LOGIN_REQUIRED).

Diese Konzept-Seite strukturiert die theoretische und strategische Debatte zwischen zwei fundamental verschiedenen Wegen zu einem Weltmodell: generative Rekonstruktion (Hassabis) vs. Joint-Embedding-Prediction (LeCun). Die Seite ist konzeptuell fokussiert — die breitere DeepMind-Architektur-Strategie liegt auf [[../architecture/deepmind-beyond-transformer.md]], die technischen Säulen auf [[../concepts/llm/post-transformer-llm-architectures.md]].

Grundfrage

Wie lernt ein Modell die latente Struktur der Welt — Physik, Objektpermanenz, Kausalität, räumliche/zeitliche Konsistenz?

Zwei Antworten, zwei Lager, zwei verschiedene Trainingsziele.

Pfad A: Generative Weltmodelle (Hassabis-Lager)

Demis Hassabis (DeepMind): Realistische Video-Generatoren wie VEO sind nicht nur „schöne Pixel". Wer glaubwürdige Szenen erzeugt, muss latente Regularitäten gelernt haben — sonst wären die Szenen physikalisch inkonsistent.

Trainingsziel: Rekonstruktion aus Rauschen (Diffusion).

Vertreter:

  • VEO (Google DeepMind) — Video-Generation auf Weltmodell-Niveau
  • Sora (OpenAI) — Vergleichsfall; wurde laut Pit zugunsten des GPT-Stacks zurückgefahren (OpenAI DevDay 2024)
  • Gemini Diffusion — Text-Diffusion als Schwester-Pfad

Stärken:

  • Implizit Weltregularitäten (Physik, Objektpermanenz, Kausalität)
  • Output-Qualität ist sichtbar — generierte Videos „beweisen" das Modell
  • Direkter Weg zu Anwendungen (VEO ist Produkt-fähig)

Schwächen:

  • Compute-Verschwendung für unwesentliche Details (LeCuns Hauptkritik: „Blattflattern im Wind")
  • Latente Repräsentation ist implizit — schwer zu interpretieren oder gezielt zu nutzen
  • Skaliert möglicherweise ineffizient — je realistischer das Pixel-Output, desto mehr Bits für unvorhersagbares Rauschen

Pfad B: JEPA — Joint Embedding Predictive Architecture (LeCun-Lager)

Yann LeCun (Meta): Rein generative Objectives sind fundamental verschwenderisch. Statt Pixel zu rekonstruieren, sollen Modelle kompatible Repräsentationen für fehlende Teile vorhersagen — Embeddings, keine Pixel.

Trainingsziel: Konsistenz von Repräsentationen (Kontext-Encoder + Target-Encoder + Prädiktor im Embedding-Space).

Vertreter:

Stärken:

  • Theoretisch effizienter — sagt nur Embeddings voraus, keine Pixel-Detailflut
  • Skaliert besser, weil Compute dort investiert wird, wo er zählt (Regularitäten, nicht Rauschen)
  • Latente Repräsentation ist explizit und nutzbar für Planung, Suche, Reasoning

Schwächen:

  • Empirisch (noch) hinter den Top-Generatoren — keine vergleichbar beeindruckenden Demos
  • Schwer zu evaluieren, weil keine direkten „Generierungs-Beweise" wie bei VEO
  • Braucht eine zweite Stufe (Decoder, Renderer) für sichtbare Outputs

Trade-offs auf einen Blick

Dimension Generativ (Hassabis) JEPA (LeCun)
Trainingsziel Pixel-Rekonstruktion Embedding-Konsistenz
Compute-Effizienz niedriger (Blattflattern-Problem) höher (theoretisch)
Skalierbarkeit qualitativ begrenzt durch Pixel-Rauschen qualitativ offen
Output-Qualität (empirisch 2026) sehr hoch (VEO) noch im Aufbau
Latente Repräsentation implizit, schwer nutzbar explizit, planbar
Reifegrad produktionsreif Forschung
Verifikation „Schau das Video an" braucht Downstream-Tasks

Der aktuelle Stand 2026

Pit-Zusammenfassung (2026-06-18): „VEO-ähnliche Generatoren müssen latente Physik/Objektpermanenz/Kausalität gelernt haben" — Hassabis-These als Konsens innerhalb der DeepMind-Strategie. LeCuns JEPA-Gegenposition ist konzeptionell elegant, aber empirisch nicht an der Spitze.

Hectors Einordnung: Die Debatte ist nicht „wer hat recht" — beide Pfade verfolgen dasselbe Ziel mit verschiedenen Methoden:

  • Hassabis: „Zeig mir, dass du die Welt verstehst, indem du sie generierst." Empirie-first.
  • LeCun: „Lerne die Welt als kompaktes Modell, bevor du Pixel verschwendest." Theorie-first.

Wette: Wer bis 2028-2030 das produktionsreifere Weltmodell hat, das mehr ist als Video-Generation (echtes Planning, Reasoning, Counterfactuals), gewinnt die AGI-Weltmodell-Komponente. Hassabis spielt auf Sichtbarkeit (VEO-Demos); LeCun spielt auf Fundament (V-JEPA als Vor-Bedingung für alles weitere).

Strategische Konsequenzen für AGI

These Vertreter Konsequenz
Generative Weltmodelle = AGI-Weg Hassabis, DeepMind Compute → Video-Generation → Weltmodell → AGI
JEPA = notwendige Vorbedingung LeCun, Meta Erst Repräsentationen lernen, dann generieren — wie Sprache vor Sprechen
Hybrid (offen) JEPA-Encoder → Planung → Generativer Decoder

OpenAI/Anthropic: Beide Labors verfolgen aktuell keine explizite Weltmodell-Strategie. Sie skalieren AR-LLMs weiter. Dies ist ein blinder Fleck im AR-Only-Wettlauf — und der Hauptgrund, warum DeepMind seine Compute-Allokation breiter streut.

Verwandte Wiki-Seiten

  • [[../architecture/deepmind-beyond-transformer.md]] — Strategischer Kontrast DeepMind vs. AR-Only-Labs
  • [[../concepts/llm/post-transformer-llm-architectures.md]] — Vier-Säulen-Übersicht inkl. Weltmodell-Sektion
  • [[transformer-foundation.md]] — Klassischer Transformer als Vergleichsbasis
  • [[../concepts/agi/aschenbrenner-situational-awareness.md]] — AGI-Realismus: „OOMs zählen" + The Project
  • [[world-model-rl-training.md]]NEU 2026-06-25: Qwen-AgentWorld — Weltmodelle als RL-Trainingsumgebungen (orthogonal zur Architektur-Debatte)

Externe Primärquellen