5.9 KiB
| created | updated | sources | tags | |||||||
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-06-18 | 2026-06-18 |
|
|
Transformer Foundation — Klassischer Stack und seine Grenzen
Stand: 2026-06-18. Hintergrund: Pit-Zusammenfassung in OME Topic 6 (aGi / eMergence), 2026-06-18, Pourya Kordi „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube).
Diese Seite beschreibt den klassischen Transformer-Stack, seine Kernidee und seine fundamentalen Skalierungs-Limits — als Voraussetzung für das Verständnis der Alternativen auf [[deepmind-beyond-transformer.md]] und [[../concepts/llm/post-transformer-llm-architectures.md]].
Der klassische Transformer-Stack
Der „klassische" moderne LLM-Stack, wie er seit 2017 (Vaswani et al., „Attention Is All You Need") in OpenAI/Anthropic-Frontier-Modellen eingesetzt wird, besteht aus drei Säulen:
| Säule | Beschreibung | Hauptvertreter |
|---|---|---|
| Globale Self-Attention | Jedes Token sieht jedes andere Token in der Sequenz (volle Aufmerksamkeitsmatrix) | Alle GPT-, Claude-, Gemini-AR-Modelle |
| Autoregressive (AR) Generierung | Token-für-Token sequentiell, irreversibel, ohne nachträgliche Korrektur | GPT-5.x, Claude Opus 4.x, Gemini 3.x |
| Großes statisches Pretraining | Web-Scale-Daten, eine Trainingsphase, danach gefroren oder leicht fine-tuned | Chinchilla-Scaling-Laws |
Erfolgsgeschichte: Dieser Stack hat seit 2018 GPT-2 → GPT-3 → GPT-4 → GPT-5x, BERT → RoBERTa, T5 → PaLM → Gemini, LLaMA → LLaMA 3/4, Claude 1 → 4 hervorgebracht. Alle Frontier-Modelle 2026 basieren auf dieser Architektur.
Das Quadratic-Attention-Problem
Kernproblem: Globale Self-Attention skaliert quadratisch mit der Sequenzlänge.
Aufmerksamkeitsmatrix = N × N
wobei N = Sequenzlänge in Tokens
Konsequenzen:
- 8k Token Kontext: 64 Millionen Attention-Einträge pro Layer
- 128k Token Kontext: 16 Milliarden Attention-Einträge pro Layer
- 1M Token Kontext: 1 Billion Attention-Einträge pro Layer — praktisch nicht mehr trainierbar
Pit-Zusammenfassung (2026-06-18): „Quadratische Komplexität der ‚naiven' globalen Attention wird bei langen Kontexten unpraktisch."
Standard-Milderungen (alle mit Trade-offs):
- Flash Attention — Speicher-effizienter Algorithmus, ändert nichts an asymptotischer Komplexität
- Sliding Window Attention (z. B. Mistral) — jedes Token sieht nur einen lokalen Kontext
- Sparse Attention Patterns — BigBird, Longformer, ETC. — vordefinierte Sparsity-Patterns
- KV-Cache-Komprimierung — zur Laufzeit, nicht beim Training
DeepMinds radikalerer Ansatz: Attention komplett durch rekurrente Zustände ergänzen oder ersetzen (Griffin, Recurrent Gemma, Titans — siehe [[../concepts/llm/post-transformer-llm-architectures.md]]).
Skalierungs-Limits
Pit-Zusammenfassung (2026-06-18): „Reine AR-LLMs liefern durch ‚Scale' allein womöglich nicht den nächsten qualitativ anderen Sprung."
Empirische Hinweise für nachlassende Skalierungsrenditen:
- Chinchilla-Optimal wurde 2022 erreicht; danach lineares Scaling statt super-linear
- Compute-Budget 2025/26: ~10²⁵ FLOPs für Frontier-Trainings; weitere OOMs werden teurer (Energie, Chip-Engpässe)
- Datenmauer: Hochwertige Textdaten nähern sich der Erschöpfung; Multimodal-Daten sind die nächste Reserve, aber Tokenisierung ist teurer
- Pre-Training-Plateau: GPT-5.x und Claude 4.x zeigen kleinere Sprünge zwischen Generationen als GPT-3 → GPT-4
Konsequenz: Das „mehr vom Gleichen"-Spiel stößt an harte Grenzen. Architektur-Innovation wird zum primären Hebel — siehe [[deepmind-beyond-transformer.md]] für DeepMinds Strategie.
Alternative: AR + Skalierung reicht — die Gegenposition
OpenAI und Anthropic halten an AR + Scaling fest. Ihre Argumente:
| Argument | Quelle |
|---|---|
| Skalierungsgesetze gelten weiter, nur langsamer | Chinchilla-Erweiterungen |
| RLHF / Constitutional AI / „Reasoning"-Modi sind orthogonal zu Architektur | OpenAI o1/o3, Claude Extended Thinking |
| Tool-Use und Agent-Loops kompensieren Modell-Schwächen | OpenAI Function Calling, Anthropic MCP |
| Multimodale Erweiterung (Vision, Audio) als nächste Skalierungs-Achse | GPT-5 Vision, Claude 4 Multimodal |
Hectors Einordnung: Beide Lager haben rationale Argumente. DeepMind wettet stärker auf Architektur-Diversität; OpenAI/Anthropic auf Compute-Skalierung + Training-Methodik. Empirischer Sieger ist offen — wahrscheinlich Hybrid aus beidem (siehe [[../concepts/world-models-jepa-vs-generative.md#strategische-konsequenzen-für-agi]]).
Verwandte Wiki-Seiten
[[deepmind-beyond-transformer.md]]— DeepMinds Architektur-Diversität als Antwort[[../concepts/llm/post-transformer-llm-architectures.md]]— Vier-Säulen-Übersicht (Griffin, Diffusion, JEPA, Foundation-Prior)[[../concepts/world-models-jepa-vs-generative.md]]— Hassabis-vs-LeCun-Debatte[[model-routing.md]]— Wie wir in OpenClaw heute mit Architektur-Diversität umgehen[[../concepts/llm/glm-5.2-zai-coding-model.md]]— Coding-Frontier (AR-Stack)[[../concepts/llm/ai-value-migration-orchestration.md]]— Wertverschiebung zu Compute + Strom
Externe Primärquellen
- Vaswani et al., „Attention Is All You Need": arXiv:1706.03762 (Originalpaper)
- Chinchilla Scaling Laws: arXiv:2203.15556 (Hoffmann et al., DeepMind 2022)
- Flash Attention: arXiv:2205.14135 (Dao et al.)
- Longformer: arXiv:2004.05150
- Pit-Zusammenfassung (OME Topic 6): 2026-06-18, Pourya Kordi „DeepMind Was Two Steps Ahead, AGAIN!" (https://www.youtube.com/watch?v=8oyZB24-vAM)