ingest(youtube)+wiki(concepts/llm): DeepMind Two Steps Ahead — Griffin, Diffusion-LLMs, JEPA, Weltmodelle

Pit-Zusammenfassung in OME Topic 13 #6645 als Primärquelle (YouTube Transkript nicht abrufbar, LOGIN_REQUIRED).
Neue Wiki-Seite post-transformer-llm-architectures.md sammelt die vier strategischen Säulen
DeepMinds jenseits der AR-Mainstream-Skalierung.
This commit is contained in:
Hector-Bot 2026-06-16 11:41:02 +02:00
parent e20a5e2bb5
commit 68c359f968
2 changed files with 195 additions and 0 deletions

View file

@ -0,0 +1,97 @@
---
type: youtube
source_url: https://www.youtube.com/watch?v=8oyZB24-vAM
retrieved: 2026-06-16
title: "DeepMind Was Two Steps Ahead, AGAIN!"
channel: "Pourya Kordi"
channel_url: https://www.youtube.com/@Pourya_Kordi
author_handle: "@Pourya_Kordi"
duration_sec: null
has_transcript: false
transcript_note: "Auto-Transcript via youtube.com derzeit nicht abrufbar (LOGIN_REQUIRED); Pit's Textzusammenfassung im OME Topic 13 (#6645) als Primärquelle genutzt."
pit_summary_ref: "OME Topic 13 message #6645, 2026-06-16 09:36 UTC"
tags: [deepmind, architectures, diffusion-llm, world-models, jepa, griffin, gemma, agi, post-transformer]
---
# DeepMind Was Two Steps Ahead, AGAIN!
**Kanal:** Pourya Kordi · [@Pourya_Kordi](https://www.youtube.com/@Pourya_Kordi)
**Pit-Zusammenfassung (OME #6645):** https://t.me/c/3839640481/13/6645
**Video:** https://www.youtube.com/watch?v=8oyZB24-vAM
> **Transkript-Hinweis:** YouTube liefert für dieses Video derzeit kein maschinenlesbares Transkript (LOGIN_REQUIRED). Die Inhaltswiedergabe unten basiert auf der ausführlichen Pit-Zusammenfassung in OME Topic 13 (#6645) und ist als „zusammengefasst-von-Pit" gekennzeichnet.
## Kernthese des Videos
DeepMind verfolgt AGI als **langfristige wissenschaftliche Mission** (Weltmodell + kognitive Fähigkeiten) — nicht primär als SaaS-Produkt — und richtet Forschung und Compute entsprechend aus. Der klassische Mainstream-Stack (Transformer, autoregressiv, generativ, groß vortrainiert) gilt als mächtig, aber **prinzipiell begrenzt**. DeepMind versucht, jede Säule gezielt zu erweitern oder zu ersetzen.
## 1. Jenseits des klassischen Transformers
- „Naive" globale Attention skaliert quadratisch → bei langen Kontexten unpraktisch.
- DeepMind experimentiert mit **sparse / lokal / hybrid** Attention-Mustern.
- Konkrete Linien: **Griffin**, **Recurrent Gemma**, **Titans** — kombinieren Rekurrenz, State-Space-Ideen und selektives Gedächtnis für effizienteren Langzeitkontext.
## 2. Griffin, Recurrent Gemma und Gemma 4
- **Griffin:** lokale Attention (Fenster) + rekurrenter „Index-Karten"-Zustand komprimiert und schreibt essentielle Information fort, statt eine riesige KV-Cache-Historie mitzuschleppen.
- **Recurrent Gemma:** baut darauf auf, deutliche Vorteile bei Langkontext-Benchmarks.
- **Gemma 4:** kombiniert Sparsity/Experts mit Mischung aus lokaler und globaler Attention — multimodal bis **256k Token Kontext** auf Edge-Hardware.
## 3. Weg von Autoregression zu Diffusions-LLMs
- AR-Modelle generieren sequentiell ohne nachträgliche Korrektur.
- **Diffusions-LLMs** verfeinern iterativ ganze Sequenzen → parallele Updates, eingebaute Fehlerkorrektur.
- Vorteile: weniger Schritte, besser GPU-parallelisierbar, **10× schneller bei ähnlicher Qualität**, flexibler (z. B. Code-Completion in beliebiger Kontextposition statt nur Präfix-Fortsetzung).
## 4. DeepMind vs. Labs, die nur AR-LLMs skalieren
- OpenAI/Anthropic skalieren primär AR-Transformers + Scaling Laws (Hinweis: Aufgabe von Sora zugunsten GPT-Stack).
- DeepMind positioniert **Diffusion (Gemini Diffusion)** als zentrale Technologie **neben** den LLMs.
- These: Reine AR-LLMs liefern durch „Scale" allein womöglich nicht den nächsten qualitativ anderen Sprung; Diffusion und hybride Ansätze könnten Architekturgrundlage der nächsten Generation sein.
## 5. Weltmodelle, Video und die LeCun-Debatte
- **Demis Hassabis:** realistische Video-Generatoren (VEO) als Schritt zu physikalisch konsistentem Weltmodell — wer glaubwürdige Szenen generiert, hat latente Regularitäten (Physik, Objektpermanenz, Kausalität) gelernt.
- **Yann LeCun (Gegenposition):** rein generative Objectives stecken zu viel Rechenaufwand in unvorhersagbare Details (Blattflattern); propagiert **JEPA**-artige Joint-Embedding-Modelle, die nur kompatible Repräsentationen fehlender Teile vorhersagen, statt Pixel zu rekonstruieren.
## 6. Generativ vs. JEPA als Weltmodell-Pfad
| Pfad | Trainingsziel | Stärke | Schwäche |
|------|---------------|--------|----------|
| **Generativ** (Encoder-Diffusion-Decoder) | Rekonstruktion aus Rauschen | Implizit Weltregularitäten | Rechenaufwand für unwesentliche Details |
| **JEPA** (V-JEPA) | Konsistenz von Repräsentationen (Kontext-Encoder + Target-Encoder + Prädiktor) | Effizient, theoretisch besser skalierend | Empirisch (noch) hinter Top-Generatoren |
## 7. DeepMinds „Simulation + Gemini"-Strategie
- Diffusions-Modelle bauen eine immer realistischere, physikalisch konsistente **Simulation der Welt**.
- Ein multimodaler Kern (**Gemini Omni**) sammelt Erfahrungen und lernt ein explizites, sich entwickelndes Weltmodell.
- Gemini Omni als **„anything-to-anything"-Autoregressor**, der in simulierten Welten agiert und physikalisch/kausal fundierte Kompetenzen aufbaut.
## 8. Pretraining, Continual Learning und AGI
- **Ilya Sutskever & Richard Sutton:** massives Pretraining auf statischen Datensätzen ist ineffizient, biologisch unplausibel; echte Intelligenz braucht effizientes Lernen aus laufender Erfahrung + reichhaltige Feedbacksignale.
- **Demis (Gegenposition):** große multimodale Foundation-Modelle auf Web-Daten bleiben sinnvoller „Prior" und Kern jedes AGI-Systems, auf den Planung, Suche und weiteres Lernen aufbauen.
## 9. Fazit
DeepMind setzt gleichzeitig auf:
- neue Architekturen (Griffin, Recurrent Gemma, Titans)
- alternative Generationsverfahren (Diffusions-LLMs)
- Weltmodelle via generatives Video
- großskaliges Pretraining + nachgelagerte Planung
Die nächsten Jahre werden zeigen, ob DeepMinds breiter, architektur-diverser Ansatz gegenüber dem reinen „Scale autoregressive Transformers"-Pfad überlegen ist.
---
## Externe Verweise (zur Vertiefung)
- **Griffin** — [arXiv:2402.19427](https://arxiv.org/abs/2402.19427) (De et al., 2024) — rekurrente Hybride mit local attention + gated linear recurrences
- **Recurrent Gemma** — [Google DeepMind Blog](https://blog.google/technology/developers/google-gemma-recurrent/) / [arXiv:2404.08239](https://arxiv.org/abs/2404.08239)
- **Titans** — [arXiv:2501.00663](https://arxiv.org/abs/2501.00663) (Behrouz et al., 2025) — „Learning to Memorize at Test Time"
- **Gemini Diffusion** — [Google DeepMind Announcement](https://blog.google/technology/google-deepmind/google-gemini-updates/) (Mai 2025)
- **V-JEPA** — [Meta AI Research](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) / [arXiv:2404.08471](https://arxiv.org/abs/2404.08471)
- **JEPA-Konzept allgemein** — [LeCun, A Path Towards Autonomous Machine Intelligence](https://openreview.net/pdf?id=BZ5a1r-kVsf) (2022)
- **Hassabis / Sutton / Sutskever Debatte** — siehe [Yann LeCun Homepage](https://yann.lecun.com/) für Primärstatements
- **Sora-Aufgabe zugunsten GPT-Stack** — siehe [OpenAI DevDay 2024 Announcements](https://openai.com/index/sora-is-here/)

View file

@ -0,0 +1,98 @@
---
created: 2026-06-16
updated: 2026-06-16
sources:
- youtube/2026-06-16_deepmind-two-steps-ahead.md
tags: [architecture, deepmind, post-transformer, diffusion-llm, jepa, world-model, griffin, recurrent-gemma]
---
# Post-Transformer LLM Architectures
> **Aggregiert-Stand:** 2026-06-16, basiert primär auf Pourya Kordi, „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube) und der Pit-Zusammenfassung in [OME Topic 13 #6645](https://t.me/c/3839640481/13/6645). Transkript nicht abrufbar; Pit-Zusammenfassung als Primärquelle genutzt.
DeepMind verfolgt eine **mehrgleisige Architekturstrategie**, die das klassische Transformer-Stack (AR + globale Attention + dichte Skalierung) **nicht ablöst, sondern erweitert**. Diese Seite sammelt die vier strategischen Säulen.
## 1. Effizientere Attention & hybride Architekturen
Quadratische Komplexität der „naiven" globalen Attention wird bei langen Kontexten unpraktisch. DeepMind-Alternativen:
| Architektur | Kernidee | Kontext-Fokus | Status |
|-------------|----------|---------------|--------|
| **Griffin** ([arXiv:2402.19427](https://arxiv.org/abs/2402.19427)) | Lokale Attention + rekurrentes „Index-Karten"-Gedächtnis statt KV-Cache-Historie | Mittel-Lang | Veröffentlicht 2024 |
| **Recurrent Gemma** ([Blog](https://blog.google/technology/developers/google-gemma-recurrent/) / [arXiv:2404.08239](https://arxiv.org/abs/2404.08239)) | Baut auf Griffin auf; verbesserte Langkontext-Benchmarks | Lang | 2024 |
| **Titans** ([arXiv:2501.00663](https://arxiv.org/abs/2501.00663)) | „Learning to Memorize at Test Time" — selektives Gedächtnis | Sehr lang | Behrouz et al., 2025 |
| **Gemma 4** | Sparsity/Experts + lokal+global hybrid multimodal | **256k Token auf Edge-Hardware** | Aktuell |
**OpenClaw-Relevanz:** Diese Modelle könnten mittelfristig interessante Alternativen für lokale Embedding/SSR-Setups sein — siehe `[[llm-model-fusion-ensembles.md]]` für die Cross-Perspektive.
## 2. Diffusions-LLMs (Nicht-AR-Generierung)
**Paradigmenwechsel:** Statt sequentiellem Token-für-Token wird die ganze Sequenz iterativ verfeinert.
| Eigenschaft | AR-Transformer | Diffusions-LLM |
|-------------|----------------|-----------------|
| Generierung | sequentiell, irreversibel | iterativ, korrigierbar |
| Parallelisierbarkeit | Token-Pipeline | Sequenz-Pipeline, GPU-freundlich |
| Geschwindigkeit (gemessen) | Baseline | **~10× schneller bei ähnlicher Qualität** |
| Flexibilität | nur Präfix-Fortsetzung | beliebige Kontextpositionen (z. B. Code-Completion in Lücken) |
| Fehlerkorrektur | extern | eingebaut durch iterative Verfeinerung |
**Zentrale DeepMind-Instanz:** [Gemini Diffusion](https://blog.google/technology/google-deepmind/google-gemini-updates/) (Ankündigung Mai 2025) — Diffusion als **zentrale Technologie neben** (nicht statt) den LLMs.
**Bezug zu AR-Only-Labs:** OpenAI/Anthropic skalieren primär AR-Transformers + Scaling Laws; Aufgabe von Sora zugunsten GPT-Stack (siehe [OpenAI DevDay 2024](https://openai.com/index/sora-is-here/)) wird als Indiz für AR-Fokus gelesen.
## 3. Weltmodelle — Generativ vs. JEPA
**Grundfrage:** Wie lernt ein Modell die latente Struktur der Welt?
| Pfad | Trainingsziel | Vertreter | Stärke | Schwäche |
|------|---------------|-----------|--------|----------|
| **Generativ (Diffusion)** | Rekonstruktion aus Rauschen | VEO, Sora | Implizit Weltregularitäten (Physik, Objektpermanenz, Kausalität) | Rechenaufwand für unwesentliche Details (LeCun: „Blattflattern") |
| **JEPA** | Konsistenz von Repräsentationen (Kontext- + Target-Encoder + Prädiktor) | V-JEPA ([Meta](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/), [arXiv:2404.08471](https://arxiv.org/abs/2404.08471)) | Effizient, theoretisch besser skalierend | Empirisch (noch) hinter Top-Generatoren |
**Kontroverse:**
- **Hassabis:** Realistische Video-Generatoren sind der Weg zum Weltmodell — wer glaubwürdige Szenen erzeugt, **muss** latente Regularitäten gelernt haben.
- **LeCun:** Rein generative Objectives sind zu verschwenderisch; JEPA-artige Modelle prognostizieren nur **kompatible Repräsentationen** fehlender Teile, statt Pixel zu rekonstruieren ([Originalpaper](https://openreview.net/pdf?id=BZ5a1r-kVsf), 2022).
**Ehrliche Lage 2026:** JEPA ist konzeptionell eleganter, aber empirisch noch nicht an der Spitze. Generative Diffusion hat höhere Output-Qualität, ist aber ineffizienter. Beide Pfade sind offen.
## 4. Pretraining-Continuum: Foundation Prior vs. Continual Learning
| Position | Vertreter | Kernthese |
|----------|-----------|-----------|
| **Foundation-Prior** | Demis Hassabis (DeepMind) | Große multimodale Foundation-Modelle auf Web-Daten = sinnvoller **Prior + Kern** jedes AGI-Systems, darauf Planung, Suche, weiteres Lernen |
| **Continual-First** | Ilya Sutskever, Richard Sutton | Massives statisches Pretraining ist **ineffizient und biologisch unplausibel**; Intelligenz braucht effizientes Lernen aus laufender Erfahrung + reichhaltige Feedbacksignale |
**DeepMinds Kompromiss:** „Simulation + Gemini" — Diffusions-Modelle bauen eine physikalisch konsistente Weltsimulation; ein multimodaler Kern (**Gemini Omni**) sammelt darin Erfahrungen und lernt ein explizites, sich entwickelndes Weltmodell. Gemini Omni als **„anything-to-anything"-Autoregressor**, der in simulierten Welten agiert.
## Strategie-Synthese: Was macht DeepMind anders?
1. **Architektur-Diversität** statt Monokultur — vier parallele Säulen statt einer.
2. **Compute-Allokation auf AGI-Mission**, nicht auf SaaS-Optimierung.
3. **Langfristiger wissenschaftlicher Zeithorizont** — bereit, „verlorene" Wetten auf nicht-AR-Architekturen einzugehen.
4. **Hypothese:** Reine AR-LLMs liefern durch „Scale" allein womöglich nicht den nächsten **qualitativ anderen** Sprung; Diffusion + hybride Architekturen + Weltmodelle sind die Architekturgrundlage der nächsten Generation.
**Offene Fragen (für OpenClaw / Hector):**
- Sollten wir mittelfristig Griffin-artige Architekturen für **lokal laufende Embedding/SSR-Modelle** evaluieren? (`[[../llm/llm-knowledge-base.md]]`, `[[../llm/semantic-similarity-rating-ssr.md]]`)
- Ist Diffusion-Pfad relevant für **Code-Completion in nicht-Präfix-Positionen** im Agenten-Workflow?
- Wie balancieren wir Foundation-Prior (großes Modell) vs. Continual-Learning (eigene Erfahrung) bei unseren Subconscious-/Memory-Subsystemen?
## Externe Primärquellen
- **Pourya Kordi Video:** https://www.youtube.com/watch?v=8oyZB24-vAM
- **Griffin:** [arXiv:2402.19427](https://arxiv.org/abs/2402.19427) · [Google Research](https://research.google/blog/introducing-griffin/)
- **Recurrent Gemma:** [arXiv:2404.08239](https://arxiv.org/abs/2404.08239) · [Google Blog](https://blog.google/technology/developers/google-gemma-recurrent/)
- **Titans:** [arXiv:2501.00663](https://arxiv.org/abs/2501.00663) (Behrouz et al., 2025)
- **Gemini Diffusion:** [Google DeepMind Blog](https://blog.google/technology/google-deepmind/google-gemini-updates/)
- **V-JEPA:** [Meta AI Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) · [arXiv:2404.08471](https://arxiv.org/abs/2404.08471)
- **LeCun JEPA-Framework:** [OpenReview 2022](https://openreview.net/pdf?id=BZ5a1r-kVsf)
- **Sutton „Bitter Lesson":** [Incomplete Ideas](http://www.incompleteideas.net/IncIdeas/BitterLesson.html)
- **Pit-Zusammenfassung im Chat:** [OME Topic 13 #6645](https://t.me/c/3839640481/13/6645)
## Verwandte Wiki-Seiten
- `[[llm-model-fusion-ensembles.md]]` — Orthogonaler Ansatz: mehrere Modelle ensemble
- `[[glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack) als Kontrast
- `[[../architecture/model-routing.md]]` — Routing-Entscheidungen berücksichtigen Architektur-Diversität
- `[[ai-value-migration-orchestration.md]]` — 20VC Perspektive: Aravind Srinivas zu AGI-Wettlauf