- scripts/check-wiki-links.py: validates all [[...]] links source-relative (matching Forgejo behavior)
- scripts/fix-wiki-links.py: auto-rewrites broken links as source-relative paths
- scripts/.check-wiki-links-wrapper.sh: pre-commit hook wrapper
- .git/hooks/pre-commit: installs wrapper as Git hook
- Fixed 47 wiki files with broken links (mostly path-confusion and wiki/-prefix bugs)
- Total: 691 valid wiki links, 0 broken, 0 path confusion
- Manual fix: Wikipedia: Sleeper agent link → proper Markdown URL
- Manual fix: non-existent decision link → decisions-index
- Code-span and template-placeholder handling (ignores `[[example]]` and `[[{slug}]]`)
Trigger: k9ert noted https://.../concepts/llm/concepts/llm/... was 404 in wiki-catalog
8.5 KiB
| created | updated | sources | tags | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-06-16 | 2026-06-18 |
|
|
Post-Transformer LLM Architectures
Aggregiert-Stand: 2026-06-16, erweitert 2026-06-18. Primärquellen: Pourya Kordi, „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube), Pit-Zusammenfassungen in OME Topic 13 #6645 (16.06) und OME Topic 6 / aGi / eMergence (18.06). Transkript nicht abrufbar; Pit-Zusammenfassungen als Primärquelle.
Schwester-Seiten:
- Strategischer Kontrast DeepMind vs. AR-Only-Labs:
[[../../architecture/deepmind-beyond-transformer.md]]- Hassabis-vs-LeCun-Weltmodell-Debatte:
[[../world-models-jepa-vs-generative.md]]- Klassischer Transformer als Basis:
[[../../architecture/transformer-foundation.md]]
DeepMind verfolgt eine mehrgleisige Architekturstrategie, die das klassische Transformer-Stack (AR + globale Attention + dichte Skalierung) nicht ablöst, sondern erweitert. Diese Seite sammelt die vier strategischen Säulen.
1. Effizientere Attention & hybride Architekturen
Quadratische Komplexität der „naiven" globalen Attention wird bei langen Kontexten unpraktisch. DeepMind-Alternativen:
| Architektur | Kernidee | Kontext-Fokus | Status |
|---|---|---|---|
| Griffin (arXiv:2402.19427) | Lokale Attention + rekurrentes „Index-Karten"-Gedächtnis statt KV-Cache-Historie | Mittel-Lang | Veröffentlicht 2024 |
| Recurrent Gemma (Blog / arXiv:2404.08239) | Baut auf Griffin auf; verbesserte Langkontext-Benchmarks | Lang | 2024 |
| Titans (arXiv:2501.00663) | „Learning to Memorize at Test Time" — selektives Gedächtnis | Sehr lang | Behrouz et al., 2025 |
| Gemma 4 | Sparsity/Experts + lokal+global hybrid multimodal | 256k Token auf Edge-Hardware | Aktuell |
OpenClaw-Relevanz: Diese Modelle könnten mittelfristig interessante Alternativen für lokale Embedding/SSR-Setups sein — siehe [[llm-model-fusion-ensembles.md]] für die Cross-Perspektive.
2. Diffusions-LLMs (Nicht-AR-Generierung)
Paradigmenwechsel: Statt sequentiellem Token-für-Token wird die ganze Sequenz iterativ verfeinert.
| Eigenschaft | AR-Transformer | Diffusions-LLM |
|---|---|---|
| Generierung | sequentiell, irreversibel | iterativ, korrigierbar |
| Parallelisierbarkeit | Token-Pipeline | Sequenz-Pipeline, GPU-freundlich |
| Geschwindigkeit (gemessen) | Baseline | ~10× schneller bei ähnlicher Qualität |
| Flexibilität | nur Präfix-Fortsetzung | beliebige Kontextpositionen (z. B. Code-Completion in Lücken) |
| Fehlerkorrektur | extern | eingebaut durch iterative Verfeinerung |
Zentrale DeepMind-Instanz: Gemini Diffusion (Ankündigung Mai 2025) — Diffusion als zentrale Technologie neben (nicht statt) den LLMs.
Bezug zu AR-Only-Labs: OpenAI/Anthropic skalieren primär AR-Transformers + Scaling Laws; Aufgabe von Sora zugunsten GPT-Stack (siehe OpenAI DevDay 2024) wird als Indiz für AR-Fokus gelesen.
3. Weltmodelle — Generativ vs. JEPA
Grundfrage: Wie lernt ein Modell die latente Struktur der Welt?
| Pfad | Trainingsziel | Vertreter | Stärke | Schwäche |
|---|---|---|---|---|
| Generativ (Diffusion) | Rekonstruktion aus Rauschen | VEO, Sora | Implizit Weltregularitäten (Physik, Objektpermanenz, Kausalität) | Rechenaufwand für unwesentliche Details (LeCun: „Blattflattern") |
| JEPA | Konsistenz von Repräsentationen (Kontext- + Target-Encoder + Prädiktor) | V-JEPA (Meta, arXiv:2404.08471) | Effizient, theoretisch besser skalierend | Empirisch (noch) hinter Top-Generatoren |
Kontroverse:
- Hassabis: Realistische Video-Generatoren sind der Weg zum Weltmodell — wer glaubwürdige Szenen erzeugt, muss latente Regularitäten gelernt haben.
- LeCun: Rein generative Objectives sind zu verschwenderisch; JEPA-artige Modelle prognostizieren nur kompatible Repräsentationen fehlender Teile, statt Pixel zu rekonstruieren (Originalpaper, 2022).
Ehrliche Lage 2026: JEPA ist konzeptionell eleganter, aber empirisch noch nicht an der Spitze. Generative Diffusion hat höhere Output-Qualität, ist aber ineffizienter. Beide Pfade sind offen.
4. Pretraining-Continuum: Foundation Prior vs. Continual Learning
| Position | Vertreter | Kernthese |
|---|---|---|
| Foundation-Prior | Demis Hassabis (DeepMind) | Große multimodale Foundation-Modelle auf Web-Daten = sinnvoller Prior + Kern jedes AGI-Systems, darauf Planung, Suche, weiteres Lernen |
| Continual-First | Ilya Sutskever, Richard Sutton | Massives statisches Pretraining ist ineffizient und biologisch unplausibel; Intelligenz braucht effizientes Lernen aus laufender Erfahrung + reichhaltige Feedbacksignale |
DeepMinds Kompromiss: „Simulation + Gemini" — Diffusions-Modelle bauen eine physikalisch konsistente Weltsimulation; ein multimodaler Kern (Gemini Omni) sammelt darin Erfahrungen und lernt ein explizites, sich entwickelndes Weltmodell. Gemini Omni als „anything-to-anything"-Autoregressor, der in simulierten Welten agiert.
Strategie-Synthese: Was macht DeepMind anders?
- Architektur-Diversität statt Monokultur — vier parallele Säulen statt einer.
- Compute-Allokation auf AGI-Mission, nicht auf SaaS-Optimierung.
- Langfristiger wissenschaftlicher Zeithorizont — bereit, „verlorene" Wetten auf nicht-AR-Architekturen einzugehen.
- Hypothese: Reine AR-LLMs liefern durch „Scale" allein womöglich nicht den nächsten qualitativ anderen Sprung; Diffusion + hybride Architekturen + Weltmodelle sind die Architekturgrundlage der nächsten Generation.
Offene Fragen (für OpenClaw / Hector):
- Sollten wir mittelfristig Griffin-artige Architekturen für lokal laufende Embedding/SSR-Modelle evaluieren? (
[[../llm/llm-knowledge-base.md]],[[../llm/semantic-similarity-rating-ssr.md]]) - Ist Diffusion-Pfad relevant für Code-Completion in nicht-Präfix-Positionen im Agenten-Workflow?
- Wie balancieren wir Foundation-Prior (großes Modell) vs. Continual-Learning (eigene Erfahrung) bei unseren Subconscious-/Memory-Subsystemen?
Externe Primärquellen
- Pourya Kordi Video: https://www.youtube.com/watch?v=8oyZB24-vAM
- Griffin: arXiv:2402.19427 · Google Research
- Recurrent Gemma: arXiv:2404.08239 · Google Blog
- Titans: arXiv:2501.00663 (Behrouz et al., 2025)
- Gemini Diffusion: Google DeepMind Blog
- V-JEPA: Meta AI Blog · arXiv:2404.08471
- LeCun JEPA-Framework: OpenReview 2022
- Sutton „Bitter Lesson": Incomplete Ideas
- Pit-Zusammenfassung im Chat: OME Topic 13 #6645
Verwandte Wiki-Seiten
[[llm-model-fusion-ensembles.md]]— Orthogonaler Ansatz: mehrere Modelle ensemble[[glm-5.2-zai-coding-model.md]]— Coding-Frontier (AR-Stack) als Kontrast[[../world-models-jepa-vs-generative.md]]— Hassabis-vs-LeCun-Debatte (eigenständige Konzept-Seite, 18.06.2026)[[../../architecture/deepmind-beyond-transformer.md]]— Strategischer Kontrast DeepMind vs. AR-Only-Labs[[../../architecture/transformer-foundation.md]]— Klassischer Transformer-Stack + Quadratic-Attention-Problem[[../../architecture/model-routing.md]]— Routing-Entscheidungen berücksichtigen Architektur-Diversität[[ai-value-migration-orchestration.md]]— 20VC Perspektive: Aravind Srinivas zu AGI-Wettlauf