knowledge-base/wiki/architecture/transformer-foundation.md

5.9 KiB
Raw Blame History

created updated sources tags
2026-06-18 2026-06-18
youtube/2026-06-18_deepmind-beyond-transformer.md
architecture
transformer
attention
scaling
foundation
post-transformer

Transformer Foundation — Klassischer Stack und seine Grenzen

Stand: 2026-06-18. Hintergrund: Pit-Zusammenfassung in OME Topic 6 (aGi / eMergence), 2026-06-18, Pourya Kordi „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube).

Diese Seite beschreibt den klassischen Transformer-Stack, seine Kernidee und seine fundamentalen Skalierungs-Limits — als Voraussetzung für das Verständnis der Alternativen auf [[deepmind-beyond-transformer.md]] und [[../concepts/llm/post-transformer-llm-architectures.md]].

Der klassische Transformer-Stack

Der „klassische" moderne LLM-Stack, wie er seit 2017 (Vaswani et al., „Attention Is All You Need") in OpenAI/Anthropic-Frontier-Modellen eingesetzt wird, besteht aus drei Säulen:

Säule Beschreibung Hauptvertreter
Globale Self-Attention Jedes Token sieht jedes andere Token in der Sequenz (volle Aufmerksamkeitsmatrix) Alle GPT-, Claude-, Gemini-AR-Modelle
Autoregressive (AR) Generierung Token-für-Token sequentiell, irreversibel, ohne nachträgliche Korrektur GPT-5.x, Claude Opus 4.x, Gemini 3.x
Großes statisches Pretraining Web-Scale-Daten, eine Trainingsphase, danach gefroren oder leicht fine-tuned Chinchilla-Scaling-Laws

Erfolgsgeschichte: Dieser Stack hat seit 2018 GPT-2 → GPT-3 → GPT-4 → GPT-5x, BERT → RoBERTa, T5 → PaLM → Gemini, LLaMA → LLaMA 3/4, Claude 1 → 4 hervorgebracht. Alle Frontier-Modelle 2026 basieren auf dieser Architektur.

Das Quadratic-Attention-Problem

Kernproblem: Globale Self-Attention skaliert quadratisch mit der Sequenzlänge.

Aufmerksamkeitsmatrix = N × N
wobei N = Sequenzlänge in Tokens

Konsequenzen:

  • 8k Token Kontext: 64 Millionen Attention-Einträge pro Layer
  • 128k Token Kontext: 16 Milliarden Attention-Einträge pro Layer
  • 1M Token Kontext: 1 Billion Attention-Einträge pro Layer — praktisch nicht mehr trainierbar

Pit-Zusammenfassung (2026-06-18): „Quadratische Komplexität der naiven' globalen Attention wird bei langen Kontexten unpraktisch."

Standard-Milderungen (alle mit Trade-offs):

  • Flash Attention — Speicher-effizienter Algorithmus, ändert nichts an asymptotischer Komplexität
  • Sliding Window Attention (z. B. Mistral) — jedes Token sieht nur einen lokalen Kontext
  • Sparse Attention Patterns — BigBird, Longformer, ETC. — vordefinierte Sparsity-Patterns
  • KV-Cache-Komprimierung — zur Laufzeit, nicht beim Training

DeepMinds radikalerer Ansatz: Attention komplett durch rekurrente Zustände ergänzen oder ersetzen (Griffin, Recurrent Gemma, Titans — siehe [[../concepts/llm/post-transformer-llm-architectures.md]]).

Skalierungs-Limits

Pit-Zusammenfassung (2026-06-18): „Reine AR-LLMs liefern durch Scale' allein womöglich nicht den nächsten qualitativ anderen Sprung."

Empirische Hinweise für nachlassende Skalierungsrenditen:

  • Chinchilla-Optimal wurde 2022 erreicht; danach lineares Scaling statt super-linear
  • Compute-Budget 2025/26: ~10²⁵ FLOPs für Frontier-Trainings; weitere OOMs werden teurer (Energie, Chip-Engpässe)
  • Datenmauer: Hochwertige Textdaten nähern sich der Erschöpfung; Multimodal-Daten sind die nächste Reserve, aber Tokenisierung ist teurer
  • Pre-Training-Plateau: GPT-5.x und Claude 4.x zeigen kleinere Sprünge zwischen Generationen als GPT-3 → GPT-4

Konsequenz: Das „mehr vom Gleichen"-Spiel stößt an harte Grenzen. Architektur-Innovation wird zum primären Hebel — siehe [[deepmind-beyond-transformer.md]] für DeepMinds Strategie.

Alternative: AR + Skalierung reicht — die Gegenposition

OpenAI und Anthropic halten an AR + Scaling fest. Ihre Argumente:

Argument Quelle
Skalierungsgesetze gelten weiter, nur langsamer Chinchilla-Erweiterungen
RLHF / Constitutional AI / „Reasoning"-Modi sind orthogonal zu Architektur OpenAI o1/o3, Claude Extended Thinking
Tool-Use und Agent-Loops kompensieren Modell-Schwächen OpenAI Function Calling, Anthropic MCP
Multimodale Erweiterung (Vision, Audio) als nächste Skalierungs-Achse GPT-5 Vision, Claude 4 Multimodal

Hectors Einordnung: Beide Lager haben rationale Argumente. DeepMind wettet stärker auf Architektur-Diversität; OpenAI/Anthropic auf Compute-Skalierung + Training-Methodik. Empirischer Sieger ist offen — wahrscheinlich Hybrid aus beidem (siehe [[../concepts/world-models-jepa-vs-generative.md#strategische-konsequenzen-für-agi]]).

Verwandte Wiki-Seiten

  • [[deepmind-beyond-transformer.md]] — DeepMinds Architektur-Diversität als Antwort
  • [[../concepts/llm/post-transformer-llm-architectures.md]] — Vier-Säulen-Übersicht (Griffin, Diffusion, JEPA, Foundation-Prior)
  • [[../concepts/world-models-jepa-vs-generative.md]] — Hassabis-vs-LeCun-Debatte
  • [[model-routing.md]] — Wie wir in OpenClaw heute mit Architektur-Diversität umgehen
  • [[../concepts/llm/glm-5.2-zai-coding-model.md]] — Coding-Frontier (AR-Stack)
  • [[../concepts/llm/ai-value-migration-orchestration.md]] — Wertverschiebung zu Compute + Strom

Externe Primärquellen