DeepMind verfolgt eine **mehrgleisige Architekturstrategie**, die das klassische Transformer-Stack (AR + globale Attention + dichte Skalierung) **nicht ablöst, sondern erweitert**. Diese Seite sammelt die vier strategischen Säulen.
| **Recurrent Gemma** ([Blog](https://blog.google/technology/developers/google-gemma-recurrent/) / [arXiv:2404.08239](https://arxiv.org/abs/2404.08239)) | Baut auf Griffin auf; verbesserte Langkontext-Benchmarks | Lang | 2024 |
| **Titans** ([arXiv:2501.00663](https://arxiv.org/abs/2501.00663)) | „Learning to Memorize at Test Time" — selektives Gedächtnis | Sehr lang | Behrouz et al., 2025 |
**OpenClaw-Relevanz:** Diese Modelle könnten mittelfristig interessante Alternativen für lokale Embedding/SSR-Setups sein — siehe `[[llm-model-fusion-ensembles.md]]` für die Cross-Perspektive.
## 2. Diffusions-LLMs (Nicht-AR-Generierung)
**Paradigmenwechsel:** Statt sequentiellem Token-für-Token wird die ganze Sequenz iterativ verfeinert.
| Flexibilität | nur Präfix-Fortsetzung | beliebige Kontextpositionen (z. B. Code-Completion in Lücken) |
| Fehlerkorrektur | extern | eingebaut durch iterative Verfeinerung |
**Zentrale DeepMind-Instanz:** [Gemini Diffusion](https://blog.google/technology/google-deepmind/google-gemini-updates/) (Ankündigung Mai 2025) — Diffusion als **zentrale Technologie neben** (nicht statt) den LLMs.
**Bezug zu AR-Only-Labs:** OpenAI/Anthropic skalieren primär AR-Transformers + Scaling Laws; Aufgabe von Sora zugunsten GPT-Stack (siehe [OpenAI DevDay 2024](https://openai.com/index/sora-is-here/)) wird als Indiz für AR-Fokus gelesen.
## 3. Weltmodelle — Generativ vs. JEPA
**Grundfrage:** Wie lernt ein Modell die latente Struktur der Welt?
- **Hassabis:** Realistische Video-Generatoren sind der Weg zum Weltmodell — wer glaubwürdige Szenen erzeugt, **muss** latente Regularitäten gelernt haben.
- **LeCun:** Rein generative Objectives sind zu verschwenderisch; JEPA-artige Modelle prognostizieren nur **kompatible Repräsentationen** fehlender Teile, statt Pixel zu rekonstruieren ([Originalpaper](https://openreview.net/pdf?id=BZ5a1r-kVsf), 2022).
**Ehrliche Lage 2026:** JEPA ist konzeptionell eleganter, aber empirisch noch nicht an der Spitze. Generative Diffusion hat höhere Output-Qualität, ist aber ineffizienter. Beide Pfade sind offen.
## 4. Pretraining-Continuum: Foundation Prior vs. Continual Learning
| Position | Vertreter | Kernthese |
|----------|-----------|-----------|
| **Foundation-Prior** | Demis Hassabis (DeepMind) | Große multimodale Foundation-Modelle auf Web-Daten = sinnvoller **Prior + Kern** jedes AGI-Systems, darauf Planung, Suche, weiteres Lernen |
| **Continual-First** | Ilya Sutskever, Richard Sutton | Massives statisches Pretraining ist **ineffizient und biologisch unplausibel**; Intelligenz braucht effizientes Lernen aus laufender Erfahrung + reichhaltige Feedbacksignale |
**DeepMinds Kompromiss:** „Simulation + Gemini" — Diffusions-Modelle bauen eine physikalisch konsistente Weltsimulation; ein multimodaler Kern (**Gemini Omni**) sammelt darin Erfahrungen und lernt ein explizites, sich entwickelndes Weltmodell. Gemini Omni als **„anything-to-anything"-Autoregressor**, der in simulierten Welten agiert.
## Strategie-Synthese: Was macht DeepMind anders?
1.**Architektur-Diversität** statt Monokultur — vier parallele Säulen statt einer.
2.**Compute-Allokation auf AGI-Mission**, nicht auf SaaS-Optimierung.
3.**Langfristiger wissenschaftlicher Zeithorizont** — bereit, „verlorene" Wetten auf nicht-AR-Architekturen einzugehen.
4.**Hypothese:** Reine AR-LLMs liefern durch „Scale" allein womöglich nicht den nächsten **qualitativ anderen** Sprung; Diffusion + hybride Architekturen + Weltmodelle sind die Architekturgrundlage der nächsten Generation.
**Offene Fragen (für OpenClaw / Hector):**
- Sollten wir mittelfristig Griffin-artige Architekturen für **lokal laufende Embedding/SSR-Modelle** evaluieren? (`[[../llm/llm-knowledge-base.md]]`, `[[../llm/semantic-similarity-rating-ssr.md]]`)
- Ist Diffusion-Pfad relevant für **Code-Completion in nicht-Präfix-Positionen** im Agenten-Workflow?
- Wie balancieren wir Foundation-Prior (großes Modell) vs. Continual-Learning (eigene Erfahrung) bei unseren Subconscious-/Memory-Subsystemen?