knowledge-base/wiki/architecture/transformer-foundation.md

91 lines
5.9 KiB
Markdown
Raw Permalink Normal View History

---
created: 2026-06-18
updated: 2026-06-18
sources:
- youtube/2026-06-18_deepmind-beyond-transformer.md
tags: [architecture, transformer, attention, scaling, foundation, post-transformer]
---
# Transformer Foundation — Klassischer Stack und seine Grenzen
> **Stand:** 2026-06-18. Hintergrund: Pit-Zusammenfassung in OME Topic 6 (aGi / eMergence), 2026-06-18, Pourya Kordi „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube).
Diese Seite beschreibt den **klassischen Transformer-Stack**, seine Kernidee und seine **fundamentalen Skalierungs-Limits** — als Voraussetzung für das Verständnis der Alternativen auf `[[deepmind-beyond-transformer.md]]` und `[[../concepts/llm/post-transformer-llm-architectures.md]]`.
## Der klassische Transformer-Stack
Der „klassische" moderne LLM-Stack, wie er seit 2017 ([Vaswani et al., „Attention Is All You Need"](https://arxiv.org/abs/1706.03762)) in OpenAI/Anthropic-Frontier-Modellen eingesetzt wird, besteht aus drei Säulen:
| Säule | Beschreibung | Hauptvertreter |
|-------|--------------|----------------|
| **Globale Self-Attention** | Jedes Token sieht jedes andere Token in der Sequenz (volle Aufmerksamkeitsmatrix) | Alle GPT-, Claude-, Gemini-AR-Modelle |
| **Autoregressive (AR) Generierung** | Token-für-Token sequentiell, irreversibel, ohne nachträgliche Korrektur | GPT-5.x, Claude Opus 4.x, Gemini 3.x |
| **Großes statisches Pretraining** | Web-Scale-Daten, eine Trainingsphase, danach gefroren oder leicht fine-tuned | Chinchilla-Scaling-Laws |
**Erfolgsgeschichte:** Dieser Stack hat seit 2018 GPT-2 → GPT-3 → GPT-4 → GPT-5x, BERT → RoBERTa, T5 → PaLM → Gemini, LLaMA → LLaMA 3/4, Claude 1 → 4 hervorgebracht. Alle Frontier-Modelle 2026 basieren auf dieser Architektur.
## Das Quadratic-Attention-Problem
**Kernproblem:** Globale Self-Attention skaliert **quadratisch** mit der Sequenzlänge.
```
Aufmerksamkeitsmatrix = N × N
wobei N = Sequenzlänge in Tokens
```
**Konsequenzen:**
- **8k Token Kontext:** 64 Millionen Attention-Einträge pro Layer
- **128k Token Kontext:** 16 Milliarden Attention-Einträge pro Layer
- **1M Token Kontext:** 1 Billion Attention-Einträge pro Layer — praktisch nicht mehr trainierbar
**Pit-Zusammenfassung (2026-06-18):** „Quadratische Komplexität der naiven' globalen Attention wird bei langen Kontexten unpraktisch."
**Standard-Milderungen (alle mit Trade-offs):**
- **Flash Attention** — Speicher-effizienter Algorithmus, ändert nichts an asymptotischer Komplexität
- **Sliding Window Attention** (z. B. Mistral) — jedes Token sieht nur einen lokalen Kontext
- **Sparse Attention Patterns** — BigBird, Longformer, ETC. — vordefinierte Sparsity-Patterns
- **KV-Cache-Komprimierung** — zur Laufzeit, nicht beim Training
**DeepMinds radikalerer Ansatz:** Attention komplett durch **rekurrente Zustände** ergänzen oder ersetzen (Griffin, Recurrent Gemma, Titans — siehe `[[../concepts/llm/post-transformer-llm-architectures.md]]`).
## Skalierungs-Limits
Pit-Zusammenfassung (2026-06-18): „Reine AR-LLMs liefern durch Scale' allein womöglich nicht den nächsten qualitativ anderen Sprung."
**Empirische Hinweise für nachlassende Skalierungsrenditen:**
- **Chinchilla-Optimal** wurde 2022 erreicht; danach lineares Scaling statt super-linear
- **Compute-Budget 2025/26:** ~10²⁵ FLOPs für Frontier-Trainings; weitere OOMs werden teurer (Energie, Chip-Engpässe)
- **Datenmauer:** Hochwertige Textdaten nähern sich der Erschöpfung; Multimodal-Daten sind die nächste Reserve, aber Tokenisierung ist teurer
- **Pre-Training-Plateau:** GPT-5.x und Claude 4.x zeigen kleinere Sprünge zwischen Generationen als GPT-3 → GPT-4
**Konsequenz:** Das „mehr vom Gleichen"-Spiel stößt an harte Grenzen. Architektur-Innovation wird zum primären Hebel — siehe `[[deepmind-beyond-transformer.md]]` für DeepMinds Strategie.
## Alternative: AR + Skalierung reicht — die Gegenposition
OpenAI und Anthropic halten an AR + Scaling fest. Ihre Argumente:
| Argument | Quelle |
|----------|--------|
| Skalierungsgesetze gelten weiter, nur langsamer | Chinchilla-Erweiterungen |
| RLHF / Constitutional AI / „Reasoning"-Modi sind orthogonal zu Architektur | OpenAI o1/o3, Claude Extended Thinking |
| Tool-Use und Agent-Loops kompensieren Modell-Schwächen | OpenAI Function Calling, Anthropic MCP |
| Multimodale Erweiterung (Vision, Audio) als nächste Skalierungs-Achse | GPT-5 Vision, Claude 4 Multimodal |
**Hectors Einordnung:** Beide Lager haben rationale Argumente. DeepMind wettet stärker auf Architektur-Diversität; OpenAI/Anthropic auf Compute-Skalierung + Training-Methodik. Empirischer Sieger ist offen — wahrscheinlich Hybrid aus beidem (siehe `[[../concepts/world-models-jepa-vs-generative.md#strategische-konsequenzen-für-agi]]`).
## Verwandte Wiki-Seiten
- `[[deepmind-beyond-transformer.md]]` — DeepMinds Architektur-Diversität als Antwort
- `[[../concepts/llm/post-transformer-llm-architectures.md]]` — Vier-Säulen-Übersicht (Griffin, Diffusion, JEPA, Foundation-Prior)
- `[[../concepts/world-models-jepa-vs-generative.md]]` — Hassabis-vs-LeCun-Debatte
- `[[model-routing.md]]` — Wie wir in OpenClaw heute mit Architektur-Diversität umgehen
- `[[../concepts/llm/glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack)
- `[[../concepts/llm/ai-value-migration-orchestration.md]]` — Wertverschiebung zu Compute + Strom
## Externe Primärquellen
- **Vaswani et al., „Attention Is All You Need":** [arXiv:1706.03762](https://arxiv.org/abs/1706.03762) (Originalpaper)
- **Chinchilla Scaling Laws:** [arXiv:2203.15556](https://arxiv.org/abs/2203.15556) (Hoffmann et al., DeepMind 2022)
- **Flash Attention:** [arXiv:2205.14135](https://arxiv.org/abs/2205.14135) (Dao et al.)
- **Longformer:** [arXiv:2004.05150](https://arxiv.org/abs/2004.05150)
- **Pit-Zusammenfassung (OME Topic 6):** 2026-06-18, Pourya Kordi „DeepMind Was Two Steps Ahead, AGAIN!" (https://www.youtube.com/watch?v=8oyZB24-vAM)