knowledge-base/wiki/architecture/transformer-foundation.md

91 lines
No EOL
5.9 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-06-18
updated: 2026-06-18
sources:
- youtube/2026-06-18_deepmind-beyond-transformer.md
tags: [architecture, transformer, attention, scaling, foundation, post-transformer]
---
# Transformer Foundation — Klassischer Stack und seine Grenzen
> **Stand:** 2026-06-18. Hintergrund: Pit-Zusammenfassung in OME Topic 6 (aGi / eMergence), 2026-06-18, Pourya Kordi „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube).
Diese Seite beschreibt den **klassischen Transformer-Stack**, seine Kernidee und seine **fundamentalen Skalierungs-Limits** — als Voraussetzung für das Verständnis der Alternativen auf `[[deepmind-beyond-transformer.md]]` und `[[../concepts/llm/post-transformer-llm-architectures.md]]`.
## Der klassische Transformer-Stack
Der „klassische" moderne LLM-Stack, wie er seit 2017 ([Vaswani et al., „Attention Is All You Need"](https://arxiv.org/abs/1706.03762)) in OpenAI/Anthropic-Frontier-Modellen eingesetzt wird, besteht aus drei Säulen:
| Säule | Beschreibung | Hauptvertreter |
|-------|--------------|----------------|
| **Globale Self-Attention** | Jedes Token sieht jedes andere Token in der Sequenz (volle Aufmerksamkeitsmatrix) | Alle GPT-, Claude-, Gemini-AR-Modelle |
| **Autoregressive (AR) Generierung** | Token-für-Token sequentiell, irreversibel, ohne nachträgliche Korrektur | GPT-5.x, Claude Opus 4.x, Gemini 3.x |
| **Großes statisches Pretraining** | Web-Scale-Daten, eine Trainingsphase, danach gefroren oder leicht fine-tuned | Chinchilla-Scaling-Laws |
**Erfolgsgeschichte:** Dieser Stack hat seit 2018 GPT-2 → GPT-3 → GPT-4 → GPT-5x, BERT → RoBERTa, T5 → PaLM → Gemini, LLaMA → LLaMA 3/4, Claude 1 → 4 hervorgebracht. Alle Frontier-Modelle 2026 basieren auf dieser Architektur.
## Das Quadratic-Attention-Problem
**Kernproblem:** Globale Self-Attention skaliert **quadratisch** mit der Sequenzlänge.
```
Aufmerksamkeitsmatrix = N × N
wobei N = Sequenzlänge in Tokens
```
**Konsequenzen:**
- **8k Token Kontext:** 64 Millionen Attention-Einträge pro Layer
- **128k Token Kontext:** 16 Milliarden Attention-Einträge pro Layer
- **1M Token Kontext:** 1 Billion Attention-Einträge pro Layer — praktisch nicht mehr trainierbar
**Pit-Zusammenfassung (2026-06-18):** „Quadratische Komplexität der naiven' globalen Attention wird bei langen Kontexten unpraktisch."
**Standard-Milderungen (alle mit Trade-offs):**
- **Flash Attention** — Speicher-effizienter Algorithmus, ändert nichts an asymptotischer Komplexität
- **Sliding Window Attention** (z. B. Mistral) — jedes Token sieht nur einen lokalen Kontext
- **Sparse Attention Patterns** — BigBird, Longformer, ETC. — vordefinierte Sparsity-Patterns
- **KV-Cache-Komprimierung** — zur Laufzeit, nicht beim Training
**DeepMinds radikalerer Ansatz:** Attention komplett durch **rekurrente Zustände** ergänzen oder ersetzen (Griffin, Recurrent Gemma, Titans — siehe `[[../concepts/llm/post-transformer-llm-architectures.md]]`).
## Skalierungs-Limits
Pit-Zusammenfassung (2026-06-18): „Reine AR-LLMs liefern durch Scale' allein womöglich nicht den nächsten qualitativ anderen Sprung."
**Empirische Hinweise für nachlassende Skalierungsrenditen:**
- **Chinchilla-Optimal** wurde 2022 erreicht; danach lineares Scaling statt super-linear
- **Compute-Budget 2025/26:** ~10²⁵ FLOPs für Frontier-Trainings; weitere OOMs werden teurer (Energie, Chip-Engpässe)
- **Datenmauer:** Hochwertige Textdaten nähern sich der Erschöpfung; Multimodal-Daten sind die nächste Reserve, aber Tokenisierung ist teurer
- **Pre-Training-Plateau:** GPT-5.x und Claude 4.x zeigen kleinere Sprünge zwischen Generationen als GPT-3 → GPT-4
**Konsequenz:** Das „mehr vom Gleichen"-Spiel stößt an harte Grenzen. Architektur-Innovation wird zum primären Hebel — siehe `[[deepmind-beyond-transformer.md]]` für DeepMinds Strategie.
## Alternative: AR + Skalierung reicht — die Gegenposition
OpenAI und Anthropic halten an AR + Scaling fest. Ihre Argumente:
| Argument | Quelle |
|----------|--------|
| Skalierungsgesetze gelten weiter, nur langsamer | Chinchilla-Erweiterungen |
| RLHF / Constitutional AI / „Reasoning"-Modi sind orthogonal zu Architektur | OpenAI o1/o3, Claude Extended Thinking |
| Tool-Use und Agent-Loops kompensieren Modell-Schwächen | OpenAI Function Calling, Anthropic MCP |
| Multimodale Erweiterung (Vision, Audio) als nächste Skalierungs-Achse | GPT-5 Vision, Claude 4 Multimodal |
**Hectors Einordnung:** Beide Lager haben rationale Argumente. DeepMind wettet stärker auf Architektur-Diversität; OpenAI/Anthropic auf Compute-Skalierung + Training-Methodik. Empirischer Sieger ist offen — wahrscheinlich Hybrid aus beidem (siehe `[[../concepts/world-models-jepa-vs-generative.md#strategische-konsequenzen-für-agi]]`).
## Verwandte Wiki-Seiten
- `[[deepmind-beyond-transformer.md]]` — DeepMinds Architektur-Diversität als Antwort
- `[[../concepts/llm/post-transformer-llm-architectures.md]]` — Vier-Säulen-Übersicht (Griffin, Diffusion, JEPA, Foundation-Prior)
- `[[../concepts/world-models-jepa-vs-generative.md]]` — Hassabis-vs-LeCun-Debatte
- `[[model-routing.md]]` — Wie wir in OpenClaw heute mit Architektur-Diversität umgehen
- `[[../concepts/llm/glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack)
- `[[../concepts/llm/ai-value-migration-orchestration.md]]` — Wertverschiebung zu Compute + Strom
## Externe Primärquellen
- **Vaswani et al., „Attention Is All You Need":** [arXiv:1706.03762](https://arxiv.org/abs/1706.03762) (Originalpaper)
- **Chinchilla Scaling Laws:** [arXiv:2203.15556](https://arxiv.org/abs/2203.15556) (Hoffmann et al., DeepMind 2022)
- **Flash Attention:** [arXiv:2205.14135](https://arxiv.org/abs/2205.14135) (Dao et al.)
- **Longformer:** [arXiv:2004.05150](https://arxiv.org/abs/2004.05150)
- **Pit-Zusammenfassung (OME Topic 6):** 2026-06-18, Pourya Kordi „DeepMind Was Two Steps Ahead, AGAIN!" (https://www.youtube.com/watch?v=8oyZB24-vAM)