knowledge-base/wiki/concepts/llm/post-transformer-llm-architectures.md

8.4 KiB
Raw Blame History

created updated sources tags
2026-06-16 2026-06-18
youtube/2026-06-16_deepmind-two-steps-ahead.md
youtube/2026-06-18_deepmind-beyond-transformer.md
architecture
deepmind
post-transformer
diffusion-llm
jepa
world-model
griffin
recurrent-gemma

Post-Transformer LLM Architectures

Aggregiert-Stand: 2026-06-16, erweitert 2026-06-18. Primärquellen: Pourya Kordi, „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube), Pit-Zusammenfassungen in OME Topic 13 #6645 (16.06) und OME Topic 6 / aGi / eMergence (18.06). Transkript nicht abrufbar; Pit-Zusammenfassungen als Primärquelle.

Schwester-Seiten:

  • Strategischer Kontrast DeepMind vs. AR-Only-Labs: [[../../architecture/deepmind-beyond-transformer.md]]
  • Hassabis-vs-LeCun-Weltmodell-Debatte: [[../world-models-jepa-vs-generative.md]]
  • Klassischer Transformer als Basis: [[../../architecture/transformer-foundation.md]]

DeepMind verfolgt eine mehrgleisige Architekturstrategie, die das klassische Transformer-Stack (AR + globale Attention + dichte Skalierung) nicht ablöst, sondern erweitert. Diese Seite sammelt die vier strategischen Säulen.

1. Effizientere Attention & hybride Architekturen

Quadratische Komplexität der „naiven" globalen Attention wird bei langen Kontexten unpraktisch. DeepMind-Alternativen:

Architektur Kernidee Kontext-Fokus Status
Griffin (arXiv:2402.19427) Lokale Attention + rekurrentes „Index-Karten"-Gedächtnis statt KV-Cache-Historie Mittel-Lang Veröffentlicht 2024
Recurrent Gemma (Blog / arXiv:2404.08239) Baut auf Griffin auf; verbesserte Langkontext-Benchmarks Lang 2024
Titans (arXiv:2501.00663) „Learning to Memorize at Test Time" — selektives Gedächtnis Sehr lang Behrouz et al., 2025
Gemma 4 Sparsity/Experts + lokal+global hybrid multimodal 256k Token auf Edge-Hardware Aktuell

OpenClaw-Relevanz: Diese Modelle könnten mittelfristig interessante Alternativen für lokale Embedding/SSR-Setups sein — siehe [[llm-model-fusion-ensembles.md]] für die Cross-Perspektive.

2. Diffusions-LLMs (Nicht-AR-Generierung)

Paradigmenwechsel: Statt sequentiellem Token-für-Token wird die ganze Sequenz iterativ verfeinert.

Eigenschaft AR-Transformer Diffusions-LLM
Generierung sequentiell, irreversibel iterativ, korrigierbar
Parallelisierbarkeit Token-Pipeline Sequenz-Pipeline, GPU-freundlich
Geschwindigkeit (gemessen) Baseline ~10× schneller bei ähnlicher Qualität
Flexibilität nur Präfix-Fortsetzung beliebige Kontextpositionen (z. B. Code-Completion in Lücken)
Fehlerkorrektur extern eingebaut durch iterative Verfeinerung

Zentrale DeepMind-Instanz: Gemini Diffusion (Ankündigung Mai 2025) — Diffusion als zentrale Technologie neben (nicht statt) den LLMs.

Bezug zu AR-Only-Labs: OpenAI/Anthropic skalieren primär AR-Transformers + Scaling Laws; Aufgabe von Sora zugunsten GPT-Stack (siehe OpenAI DevDay 2024) wird als Indiz für AR-Fokus gelesen.

3. Weltmodelle — Generativ vs. JEPA

Grundfrage: Wie lernt ein Modell die latente Struktur der Welt?

Pfad Trainingsziel Vertreter Stärke Schwäche
Generativ (Diffusion) Rekonstruktion aus Rauschen VEO, Sora Implizit Weltregularitäten (Physik, Objektpermanenz, Kausalität) Rechenaufwand für unwesentliche Details (LeCun: „Blattflattern")
JEPA Konsistenz von Repräsentationen (Kontext- + Target-Encoder + Prädiktor) V-JEPA (Meta, arXiv:2404.08471) Effizient, theoretisch besser skalierend Empirisch (noch) hinter Top-Generatoren

Kontroverse:

  • Hassabis: Realistische Video-Generatoren sind der Weg zum Weltmodell — wer glaubwürdige Szenen erzeugt, muss latente Regularitäten gelernt haben.
  • LeCun: Rein generative Objectives sind zu verschwenderisch; JEPA-artige Modelle prognostizieren nur kompatible Repräsentationen fehlender Teile, statt Pixel zu rekonstruieren (Originalpaper, 2022).

Ehrliche Lage 2026: JEPA ist konzeptionell eleganter, aber empirisch noch nicht an der Spitze. Generative Diffusion hat höhere Output-Qualität, ist aber ineffizienter. Beide Pfade sind offen.

4. Pretraining-Continuum: Foundation Prior vs. Continual Learning

Position Vertreter Kernthese
Foundation-Prior Demis Hassabis (DeepMind) Große multimodale Foundation-Modelle auf Web-Daten = sinnvoller Prior + Kern jedes AGI-Systems, darauf Planung, Suche, weiteres Lernen
Continual-First Ilya Sutskever, Richard Sutton Massives statisches Pretraining ist ineffizient und biologisch unplausibel; Intelligenz braucht effizientes Lernen aus laufender Erfahrung + reichhaltige Feedbacksignale

DeepMinds Kompromiss: „Simulation + Gemini" — Diffusions-Modelle bauen eine physikalisch konsistente Weltsimulation; ein multimodaler Kern (Gemini Omni) sammelt darin Erfahrungen und lernt ein explizites, sich entwickelndes Weltmodell. Gemini Omni als „anything-to-anything"-Autoregressor, der in simulierten Welten agiert.

Strategie-Synthese: Was macht DeepMind anders?

  1. Architektur-Diversität statt Monokultur — vier parallele Säulen statt einer.
  2. Compute-Allokation auf AGI-Mission, nicht auf SaaS-Optimierung.
  3. Langfristiger wissenschaftlicher Zeithorizont — bereit, „verlorene" Wetten auf nicht-AR-Architekturen einzugehen.
  4. Hypothese: Reine AR-LLMs liefern durch „Scale" allein womöglich nicht den nächsten qualitativ anderen Sprung; Diffusion + hybride Architekturen + Weltmodelle sind die Architekturgrundlage der nächsten Generation.

Offene Fragen (für OpenClaw / Hector):

  • Sollten wir mittelfristig Griffin-artige Architekturen für lokal laufende Embedding/SSR-Modelle evaluieren? ([[../llm/llm-knowledge-base.md]], [[../llm/semantic-similarity-rating-ssr.md]])
  • Ist Diffusion-Pfad relevant für Code-Completion in nicht-Präfix-Positionen im Agenten-Workflow?
  • Wie balancieren wir Foundation-Prior (großes Modell) vs. Continual-Learning (eigene Erfahrung) bei unseren Subconscious-/Memory-Subsystemen?

Externe Primärquellen

Verwandte Wiki-Seiten

  • [[llm-model-fusion-ensembles.md]] — Orthogonaler Ansatz: mehrere Modelle ensemble
  • [[glm-5.2-zai-coding-model.md]] — Coding-Frontier (AR-Stack) als Kontrast
  • [[../world-models-jepa-vs-generative.md]] — Hassabis-vs-LeCun-Debatte (eigenständige Konzept-Seite, 18.06.2026)
  • [[../../architecture/deepmind-beyond-transformer.md]] — Strategischer Kontrast DeepMind vs. AR-Only-Labs
  • [[../../architecture/transformer-foundation.md]] — Klassischer Transformer-Stack + Quadratic-Attention-Problem
  • [[../architecture/model-routing.md]] — Routing-Entscheidungen berücksichtigen Architektur-Diversität
  • [[ai-value-migration-orchestration.md]] — 20VC Perspektive: Aravind Srinivas zu AGI-Wettlauf