knowledge-base/wiki/concepts/llm/post-transformer-llm-architectures.md
Hector ffacfad6f2 fix: wiki link checker + auto-fix script + pre-commit hook
- scripts/check-wiki-links.py: validates all [[...]] links source-relative (matching Forgejo behavior)
- scripts/fix-wiki-links.py: auto-rewrites broken links as source-relative paths
- scripts/.check-wiki-links-wrapper.sh: pre-commit hook wrapper
- .git/hooks/pre-commit: installs wrapper as Git hook
- Fixed 47 wiki files with broken links (mostly path-confusion and wiki/-prefix bugs)
- Total: 691 valid wiki links, 0 broken, 0 path confusion
- Manual fix: Wikipedia: Sleeper agent link → proper Markdown URL
- Manual fix: non-existent decision link → decisions-index
- Code-span and template-placeholder handling (ignores `[[example]]` and `[[{slug}]]`)

Trigger: k9ert noted https://.../concepts/llm/concepts/llm/... was 404 in wiki-catalog
2026-06-25 21:47:40 +02:00

107 lines
8.5 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-06-16
updated: 2026-06-18
sources:
- youtube/2026-06-16_deepmind-two-steps-ahead.md
- youtube/2026-06-18_deepmind-beyond-transformer.md
tags: [architecture, deepmind, post-transformer, diffusion-llm, jepa, world-model, griffin, recurrent-gemma]
---
# Post-Transformer LLM Architectures
> **Aggregiert-Stand:** 2026-06-16, erweitert 2026-06-18. Primärquellen: Pourya Kordi, „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube), Pit-Zusammenfassungen in [OME Topic 13 #6645](https://t.me/c/3839640481/13/6645) (16.06) und OME Topic 6 / aGi / eMergence (18.06). Transkript nicht abrufbar; Pit-Zusammenfassungen als Primärquelle.
>
> **Schwester-Seiten:**
> - Strategischer Kontrast DeepMind vs. AR-Only-Labs: `[[../../architecture/deepmind-beyond-transformer.md]]`
> - Hassabis-vs-LeCun-Weltmodell-Debatte: `[[../world-models-jepa-vs-generative.md]]`
> - Klassischer Transformer als Basis: `[[../../architecture/transformer-foundation.md]]`
DeepMind verfolgt eine **mehrgleisige Architekturstrategie**, die das klassische Transformer-Stack (AR + globale Attention + dichte Skalierung) **nicht ablöst, sondern erweitert**. Diese Seite sammelt die vier strategischen Säulen.
## 1. Effizientere Attention & hybride Architekturen
Quadratische Komplexität der „naiven" globalen Attention wird bei langen Kontexten unpraktisch. DeepMind-Alternativen:
| Architektur | Kernidee | Kontext-Fokus | Status |
|-------------|----------|---------------|--------|
| **Griffin** ([arXiv:2402.19427](https://arxiv.org/abs/2402.19427)) | Lokale Attention + rekurrentes „Index-Karten"-Gedächtnis statt KV-Cache-Historie | Mittel-Lang | Veröffentlicht 2024 |
| **Recurrent Gemma** ([Blog](https://blog.google/technology/developers/google-gemma-recurrent/) / [arXiv:2404.08239](https://arxiv.org/abs/2404.08239)) | Baut auf Griffin auf; verbesserte Langkontext-Benchmarks | Lang | 2024 |
| **Titans** ([arXiv:2501.00663](https://arxiv.org/abs/2501.00663)) | „Learning to Memorize at Test Time" — selektives Gedächtnis | Sehr lang | Behrouz et al., 2025 |
| **Gemma 4** | Sparsity/Experts + lokal+global hybrid multimodal | **256k Token auf Edge-Hardware** | Aktuell |
**OpenClaw-Relevanz:** Diese Modelle könnten mittelfristig interessante Alternativen für lokale Embedding/SSR-Setups sein — siehe `[[llm-model-fusion-ensembles.md]]` für die Cross-Perspektive.
## 2. Diffusions-LLMs (Nicht-AR-Generierung)
**Paradigmenwechsel:** Statt sequentiellem Token-für-Token wird die ganze Sequenz iterativ verfeinert.
| Eigenschaft | AR-Transformer | Diffusions-LLM |
|-------------|----------------|-----------------|
| Generierung | sequentiell, irreversibel | iterativ, korrigierbar |
| Parallelisierbarkeit | Token-Pipeline | Sequenz-Pipeline, GPU-freundlich |
| Geschwindigkeit (gemessen) | Baseline | **~10× schneller bei ähnlicher Qualität** |
| Flexibilität | nur Präfix-Fortsetzung | beliebige Kontextpositionen (z. B. Code-Completion in Lücken) |
| Fehlerkorrektur | extern | eingebaut durch iterative Verfeinerung |
**Zentrale DeepMind-Instanz:** [Gemini Diffusion](https://blog.google/technology/google-deepmind/google-gemini-updates/) (Ankündigung Mai 2025) — Diffusion als **zentrale Technologie neben** (nicht statt) den LLMs.
**Bezug zu AR-Only-Labs:** OpenAI/Anthropic skalieren primär AR-Transformers + Scaling Laws; Aufgabe von Sora zugunsten GPT-Stack (siehe [OpenAI DevDay 2024](https://openai.com/index/sora-is-here/)) wird als Indiz für AR-Fokus gelesen.
## 3. Weltmodelle — Generativ vs. JEPA
**Grundfrage:** Wie lernt ein Modell die latente Struktur der Welt?
| Pfad | Trainingsziel | Vertreter | Stärke | Schwäche |
|------|---------------|-----------|--------|----------|
| **Generativ (Diffusion)** | Rekonstruktion aus Rauschen | VEO, Sora | Implizit Weltregularitäten (Physik, Objektpermanenz, Kausalität) | Rechenaufwand für unwesentliche Details (LeCun: „Blattflattern") |
| **JEPA** | Konsistenz von Repräsentationen (Kontext- + Target-Encoder + Prädiktor) | V-JEPA ([Meta](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/), [arXiv:2404.08471](https://arxiv.org/abs/2404.08471)) | Effizient, theoretisch besser skalierend | Empirisch (noch) hinter Top-Generatoren |
**Kontroverse:**
- **Hassabis:** Realistische Video-Generatoren sind der Weg zum Weltmodell — wer glaubwürdige Szenen erzeugt, **muss** latente Regularitäten gelernt haben.
- **LeCun:** Rein generative Objectives sind zu verschwenderisch; JEPA-artige Modelle prognostizieren nur **kompatible Repräsentationen** fehlender Teile, statt Pixel zu rekonstruieren ([Originalpaper](https://openreview.net/pdf?id=BZ5a1r-kVsf), 2022).
**Ehrliche Lage 2026:** JEPA ist konzeptionell eleganter, aber empirisch noch nicht an der Spitze. Generative Diffusion hat höhere Output-Qualität, ist aber ineffizienter. Beide Pfade sind offen.
## 4. Pretraining-Continuum: Foundation Prior vs. Continual Learning
| Position | Vertreter | Kernthese |
|----------|-----------|-----------|
| **Foundation-Prior** | Demis Hassabis (DeepMind) | Große multimodale Foundation-Modelle auf Web-Daten = sinnvoller **Prior + Kern** jedes AGI-Systems, darauf Planung, Suche, weiteres Lernen |
| **Continual-First** | Ilya Sutskever, Richard Sutton | Massives statisches Pretraining ist **ineffizient und biologisch unplausibel**; Intelligenz braucht effizientes Lernen aus laufender Erfahrung + reichhaltige Feedbacksignale |
**DeepMinds Kompromiss:** „Simulation + Gemini" — Diffusions-Modelle bauen eine physikalisch konsistente Weltsimulation; ein multimodaler Kern (**Gemini Omni**) sammelt darin Erfahrungen und lernt ein explizites, sich entwickelndes Weltmodell. Gemini Omni als **„anything-to-anything"-Autoregressor**, der in simulierten Welten agiert.
## Strategie-Synthese: Was macht DeepMind anders?
1. **Architektur-Diversität** statt Monokultur — vier parallele Säulen statt einer.
2. **Compute-Allokation auf AGI-Mission**, nicht auf SaaS-Optimierung.
3. **Langfristiger wissenschaftlicher Zeithorizont** — bereit, „verlorene" Wetten auf nicht-AR-Architekturen einzugehen.
4. **Hypothese:** Reine AR-LLMs liefern durch „Scale" allein womöglich nicht den nächsten **qualitativ anderen** Sprung; Diffusion + hybride Architekturen + Weltmodelle sind die Architekturgrundlage der nächsten Generation.
**Offene Fragen (für OpenClaw / Hector):**
- Sollten wir mittelfristig Griffin-artige Architekturen für **lokal laufende Embedding/SSR-Modelle** evaluieren? (`[[../llm/llm-knowledge-base.md]]`, `[[../llm/semantic-similarity-rating-ssr.md]]`)
- Ist Diffusion-Pfad relevant für **Code-Completion in nicht-Präfix-Positionen** im Agenten-Workflow?
- Wie balancieren wir Foundation-Prior (großes Modell) vs. Continual-Learning (eigene Erfahrung) bei unseren Subconscious-/Memory-Subsystemen?
## Externe Primärquellen
- **Pourya Kordi Video:** https://www.youtube.com/watch?v=8oyZB24-vAM
- **Griffin:** [arXiv:2402.19427](https://arxiv.org/abs/2402.19427) · [Google Research](https://research.google/blog/introducing-griffin/)
- **Recurrent Gemma:** [arXiv:2404.08239](https://arxiv.org/abs/2404.08239) · [Google Blog](https://blog.google/technology/developers/google-gemma-recurrent/)
- **Titans:** [arXiv:2501.00663](https://arxiv.org/abs/2501.00663) (Behrouz et al., 2025)
- **Gemini Diffusion:** [Google DeepMind Blog](https://blog.google/technology/google-deepmind/google-gemini-updates/)
- **V-JEPA:** [Meta AI Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) · [arXiv:2404.08471](https://arxiv.org/abs/2404.08471)
- **LeCun JEPA-Framework:** [OpenReview 2022](https://openreview.net/pdf?id=BZ5a1r-kVsf)
- **Sutton „Bitter Lesson":** [Incomplete Ideas](http://www.incompleteideas.net/IncIdeas/BitterLesson.html)
- **Pit-Zusammenfassung im Chat:** [OME Topic 13 #6645](https://t.me/c/3839640481/13/6645)
## Verwandte Wiki-Seiten
- `[[llm-model-fusion-ensembles.md]]` — Orthogonaler Ansatz: mehrere Modelle ensemble
- `[[glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack) als Kontrast
- `[[../world-models-jepa-vs-generative.md]]` — Hassabis-vs-LeCun-Debatte (eigenständige Konzept-Seite, 18.06.2026)
- `[[../../architecture/deepmind-beyond-transformer.md]]` — Strategischer Kontrast DeepMind vs. AR-Only-Labs
- `[[../../architecture/transformer-foundation.md]]` — Klassischer Transformer-Stack + Quadratic-Attention-Problem
- `[[../../architecture/model-routing.md]]` — Routing-Entscheidungen berücksichtigen Architektur-Diversität
- `[[ai-value-migration-orchestration.md]]` — 20VC Perspektive: Aravind Srinivas zu AGI-Wettlauf