--- created: 2026-06-16 updated: 2026-06-18 sources: - youtube/2026-06-16_deepmind-two-steps-ahead.md - youtube/2026-06-18_deepmind-beyond-transformer.md tags: [architecture, deepmind, post-transformer, diffusion-llm, jepa, world-model, griffin, recurrent-gemma] --- # Post-Transformer LLM Architectures > **Aggregiert-Stand:** 2026-06-16, erweitert 2026-06-18. Primärquellen: Pourya Kordi, „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube), Pit-Zusammenfassungen in [OME Topic 13 #6645](https://t.me/c/3839640481/13/6645) (16.06) und OME Topic 6 / aGi / eMergence (18.06). Transkript nicht abrufbar; Pit-Zusammenfassungen als Primärquelle. > > **Schwester-Seiten:** > - Strategischer Kontrast DeepMind vs. AR-Only-Labs: `[[../../architecture/deepmind-beyond-transformer.md]]` > - Hassabis-vs-LeCun-Weltmodell-Debatte: `[[../world-models-jepa-vs-generative.md]]` > - Klassischer Transformer als Basis: `[[../../architecture/transformer-foundation.md]]` DeepMind verfolgt eine **mehrgleisige Architekturstrategie**, die das klassische Transformer-Stack (AR + globale Attention + dichte Skalierung) **nicht ablöst, sondern erweitert**. Diese Seite sammelt die vier strategischen Säulen. ## 1. Effizientere Attention & hybride Architekturen Quadratische Komplexität der „naiven" globalen Attention wird bei langen Kontexten unpraktisch. DeepMind-Alternativen: | Architektur | Kernidee | Kontext-Fokus | Status | |-------------|----------|---------------|--------| | **Griffin** ([arXiv:2402.19427](https://arxiv.org/abs/2402.19427)) | Lokale Attention + rekurrentes „Index-Karten"-Gedächtnis statt KV-Cache-Historie | Mittel-Lang | Veröffentlicht 2024 | | **Recurrent Gemma** ([Blog](https://blog.google/technology/developers/google-gemma-recurrent/) / [arXiv:2404.08239](https://arxiv.org/abs/2404.08239)) | Baut auf Griffin auf; verbesserte Langkontext-Benchmarks | Lang | 2024 | | **Titans** ([arXiv:2501.00663](https://arxiv.org/abs/2501.00663)) | „Learning to Memorize at Test Time" — selektives Gedächtnis | Sehr lang | Behrouz et al., 2025 | | **Gemma 4** | Sparsity/Experts + lokal+global hybrid multimodal | **256k Token auf Edge-Hardware** | Aktuell | **OpenClaw-Relevanz:** Diese Modelle könnten mittelfristig interessante Alternativen für lokale Embedding/SSR-Setups sein — siehe `[[llm-model-fusion-ensembles.md]]` für die Cross-Perspektive. ## 2. Diffusions-LLMs (Nicht-AR-Generierung) **Paradigmenwechsel:** Statt sequentiellem Token-für-Token wird die ganze Sequenz iterativ verfeinert. | Eigenschaft | AR-Transformer | Diffusions-LLM | |-------------|----------------|-----------------| | Generierung | sequentiell, irreversibel | iterativ, korrigierbar | | Parallelisierbarkeit | Token-Pipeline | Sequenz-Pipeline, GPU-freundlich | | Geschwindigkeit (gemessen) | Baseline | **~10× schneller bei ähnlicher Qualität** | | Flexibilität | nur Präfix-Fortsetzung | beliebige Kontextpositionen (z. B. Code-Completion in Lücken) | | Fehlerkorrektur | extern | eingebaut durch iterative Verfeinerung | **Zentrale DeepMind-Instanz:** [Gemini Diffusion](https://blog.google/technology/google-deepmind/google-gemini-updates/) (Ankündigung Mai 2025) — Diffusion als **zentrale Technologie neben** (nicht statt) den LLMs. **Bezug zu AR-Only-Labs:** OpenAI/Anthropic skalieren primär AR-Transformers + Scaling Laws; Aufgabe von Sora zugunsten GPT-Stack (siehe [OpenAI DevDay 2024](https://openai.com/index/sora-is-here/)) wird als Indiz für AR-Fokus gelesen. ## 3. Weltmodelle — Generativ vs. JEPA **Grundfrage:** Wie lernt ein Modell die latente Struktur der Welt? | Pfad | Trainingsziel | Vertreter | Stärke | Schwäche | |------|---------------|-----------|--------|----------| | **Generativ (Diffusion)** | Rekonstruktion aus Rauschen | VEO, Sora | Implizit Weltregularitäten (Physik, Objektpermanenz, Kausalität) | Rechenaufwand für unwesentliche Details (LeCun: „Blattflattern") | | **JEPA** | Konsistenz von Repräsentationen (Kontext- + Target-Encoder + Prädiktor) | V-JEPA ([Meta](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/), [arXiv:2404.08471](https://arxiv.org/abs/2404.08471)) | Effizient, theoretisch besser skalierend | Empirisch (noch) hinter Top-Generatoren | **Kontroverse:** - **Hassabis:** Realistische Video-Generatoren sind der Weg zum Weltmodell — wer glaubwürdige Szenen erzeugt, **muss** latente Regularitäten gelernt haben. - **LeCun:** Rein generative Objectives sind zu verschwenderisch; JEPA-artige Modelle prognostizieren nur **kompatible Repräsentationen** fehlender Teile, statt Pixel zu rekonstruieren ([Originalpaper](https://openreview.net/pdf?id=BZ5a1r-kVsf), 2022). **Ehrliche Lage 2026:** JEPA ist konzeptionell eleganter, aber empirisch noch nicht an der Spitze. Generative Diffusion hat höhere Output-Qualität, ist aber ineffizienter. Beide Pfade sind offen. ## 4. Pretraining-Continuum: Foundation Prior vs. Continual Learning | Position | Vertreter | Kernthese | |----------|-----------|-----------| | **Foundation-Prior** | Demis Hassabis (DeepMind) | Große multimodale Foundation-Modelle auf Web-Daten = sinnvoller **Prior + Kern** jedes AGI-Systems, darauf Planung, Suche, weiteres Lernen | | **Continual-First** | Ilya Sutskever, Richard Sutton | Massives statisches Pretraining ist **ineffizient und biologisch unplausibel**; Intelligenz braucht effizientes Lernen aus laufender Erfahrung + reichhaltige Feedbacksignale | **DeepMinds Kompromiss:** „Simulation + Gemini" — Diffusions-Modelle bauen eine physikalisch konsistente Weltsimulation; ein multimodaler Kern (**Gemini Omni**) sammelt darin Erfahrungen und lernt ein explizites, sich entwickelndes Weltmodell. Gemini Omni als **„anything-to-anything"-Autoregressor**, der in simulierten Welten agiert. ## Strategie-Synthese: Was macht DeepMind anders? 1. **Architektur-Diversität** statt Monokultur — vier parallele Säulen statt einer. 2. **Compute-Allokation auf AGI-Mission**, nicht auf SaaS-Optimierung. 3. **Langfristiger wissenschaftlicher Zeithorizont** — bereit, „verlorene" Wetten auf nicht-AR-Architekturen einzugehen. 4. **Hypothese:** Reine AR-LLMs liefern durch „Scale" allein womöglich nicht den nächsten **qualitativ anderen** Sprung; Diffusion + hybride Architekturen + Weltmodelle sind die Architekturgrundlage der nächsten Generation. **Offene Fragen (für OpenClaw / Hector):** - Sollten wir mittelfristig Griffin-artige Architekturen für **lokal laufende Embedding/SSR-Modelle** evaluieren? (`[[../llm/llm-knowledge-base.md]]`, `[[../llm/semantic-similarity-rating-ssr.md]]`) - Ist Diffusion-Pfad relevant für **Code-Completion in nicht-Präfix-Positionen** im Agenten-Workflow? - Wie balancieren wir Foundation-Prior (großes Modell) vs. Continual-Learning (eigene Erfahrung) bei unseren Subconscious-/Memory-Subsystemen? ## Externe Primärquellen - **Pourya Kordi Video:** https://www.youtube.com/watch?v=8oyZB24-vAM - **Griffin:** [arXiv:2402.19427](https://arxiv.org/abs/2402.19427) · [Google Research](https://research.google/blog/introducing-griffin/) - **Recurrent Gemma:** [arXiv:2404.08239](https://arxiv.org/abs/2404.08239) · [Google Blog](https://blog.google/technology/developers/google-gemma-recurrent/) - **Titans:** [arXiv:2501.00663](https://arxiv.org/abs/2501.00663) (Behrouz et al., 2025) - **Gemini Diffusion:** [Google DeepMind Blog](https://blog.google/technology/google-deepmind/google-gemini-updates/) - **V-JEPA:** [Meta AI Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) · [arXiv:2404.08471](https://arxiv.org/abs/2404.08471) - **LeCun JEPA-Framework:** [OpenReview 2022](https://openreview.net/pdf?id=BZ5a1r-kVsf) - **Sutton „Bitter Lesson":** [Incomplete Ideas](http://www.incompleteideas.net/IncIdeas/BitterLesson.html) - **Pit-Zusammenfassung im Chat:** [OME Topic 13 #6645](https://t.me/c/3839640481/13/6645) ## Verwandte Wiki-Seiten - `[[llm-model-fusion-ensembles.md]]` — Orthogonaler Ansatz: mehrere Modelle ensemble - `[[glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack) als Kontrast - `[[../world-models-jepa-vs-generative.md]]` — Hassabis-vs-LeCun-Debatte (eigenständige Konzept-Seite, 18.06.2026) - `[[../../architecture/deepmind-beyond-transformer.md]]` — Strategischer Kontrast DeepMind vs. AR-Only-Labs - `[[../../architecture/transformer-foundation.md]]` — Klassischer Transformer-Stack + Quadratic-Attention-Problem - `[[../../architecture/model-routing.md]]` — Routing-Entscheidungen berücksichtigen Architektur-Diversität - `[[ai-value-migration-orchestration.md]]` — 20VC Perspektive: Aravind Srinivas zu AGI-Wettlauf