91 lines
No EOL
5.9 KiB
Markdown
91 lines
No EOL
5.9 KiB
Markdown
---
|
||
created: 2026-06-18
|
||
updated: 2026-06-18
|
||
sources:
|
||
- youtube/2026-06-18_deepmind-beyond-transformer.md
|
||
tags: [architecture, transformer, attention, scaling, foundation, post-transformer]
|
||
---
|
||
|
||
# Transformer Foundation — Klassischer Stack und seine Grenzen
|
||
|
||
> **Stand:** 2026-06-18. Hintergrund: Pit-Zusammenfassung in OME Topic 6 (aGi / eMergence), 2026-06-18, Pourya Kordi „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube).
|
||
|
||
Diese Seite beschreibt den **klassischen Transformer-Stack**, seine Kernidee und seine **fundamentalen Skalierungs-Limits** — als Voraussetzung für das Verständnis der Alternativen auf `[[deepmind-beyond-transformer.md]]` und `[[../concepts/llm/post-transformer-llm-architectures.md]]`.
|
||
|
||
## Der klassische Transformer-Stack
|
||
|
||
Der „klassische" moderne LLM-Stack, wie er seit 2017 ([Vaswani et al., „Attention Is All You Need"](https://arxiv.org/abs/1706.03762)) in OpenAI/Anthropic-Frontier-Modellen eingesetzt wird, besteht aus drei Säulen:
|
||
|
||
| Säule | Beschreibung | Hauptvertreter |
|
||
|-------|--------------|----------------|
|
||
| **Globale Self-Attention** | Jedes Token sieht jedes andere Token in der Sequenz (volle Aufmerksamkeitsmatrix) | Alle GPT-, Claude-, Gemini-AR-Modelle |
|
||
| **Autoregressive (AR) Generierung** | Token-für-Token sequentiell, irreversibel, ohne nachträgliche Korrektur | GPT-5.x, Claude Opus 4.x, Gemini 3.x |
|
||
| **Großes statisches Pretraining** | Web-Scale-Daten, eine Trainingsphase, danach gefroren oder leicht fine-tuned | Chinchilla-Scaling-Laws |
|
||
|
||
**Erfolgsgeschichte:** Dieser Stack hat seit 2018 GPT-2 → GPT-3 → GPT-4 → GPT-5x, BERT → RoBERTa, T5 → PaLM → Gemini, LLaMA → LLaMA 3/4, Claude 1 → 4 hervorgebracht. Alle Frontier-Modelle 2026 basieren auf dieser Architektur.
|
||
|
||
## Das Quadratic-Attention-Problem
|
||
|
||
**Kernproblem:** Globale Self-Attention skaliert **quadratisch** mit der Sequenzlänge.
|
||
|
||
```
|
||
Aufmerksamkeitsmatrix = N × N
|
||
wobei N = Sequenzlänge in Tokens
|
||
```
|
||
|
||
**Konsequenzen:**
|
||
- **8k Token Kontext:** 64 Millionen Attention-Einträge pro Layer
|
||
- **128k Token Kontext:** 16 Milliarden Attention-Einträge pro Layer
|
||
- **1M Token Kontext:** 1 Billion Attention-Einträge pro Layer — praktisch nicht mehr trainierbar
|
||
|
||
**Pit-Zusammenfassung (2026-06-18):** „Quadratische Komplexität der ‚naiven' globalen Attention wird bei langen Kontexten unpraktisch."
|
||
|
||
**Standard-Milderungen (alle mit Trade-offs):**
|
||
- **Flash Attention** — Speicher-effizienter Algorithmus, ändert nichts an asymptotischer Komplexität
|
||
- **Sliding Window Attention** (z. B. Mistral) — jedes Token sieht nur einen lokalen Kontext
|
||
- **Sparse Attention Patterns** — BigBird, Longformer, ETC. — vordefinierte Sparsity-Patterns
|
||
- **KV-Cache-Komprimierung** — zur Laufzeit, nicht beim Training
|
||
|
||
**DeepMinds radikalerer Ansatz:** Attention komplett durch **rekurrente Zustände** ergänzen oder ersetzen (Griffin, Recurrent Gemma, Titans — siehe `[[../concepts/llm/post-transformer-llm-architectures.md]]`).
|
||
|
||
## Skalierungs-Limits
|
||
|
||
Pit-Zusammenfassung (2026-06-18): „Reine AR-LLMs liefern durch ‚Scale' allein womöglich nicht den nächsten qualitativ anderen Sprung."
|
||
|
||
**Empirische Hinweise für nachlassende Skalierungsrenditen:**
|
||
- **Chinchilla-Optimal** wurde 2022 erreicht; danach lineares Scaling statt super-linear
|
||
- **Compute-Budget 2025/26:** ~10²⁵ FLOPs für Frontier-Trainings; weitere OOMs werden teurer (Energie, Chip-Engpässe)
|
||
- **Datenmauer:** Hochwertige Textdaten nähern sich der Erschöpfung; Multimodal-Daten sind die nächste Reserve, aber Tokenisierung ist teurer
|
||
- **Pre-Training-Plateau:** GPT-5.x und Claude 4.x zeigen kleinere Sprünge zwischen Generationen als GPT-3 → GPT-4
|
||
|
||
**Konsequenz:** Das „mehr vom Gleichen"-Spiel stößt an harte Grenzen. Architektur-Innovation wird zum primären Hebel — siehe `[[deepmind-beyond-transformer.md]]` für DeepMinds Strategie.
|
||
|
||
## Alternative: AR + Skalierung reicht — die Gegenposition
|
||
|
||
OpenAI und Anthropic halten an AR + Scaling fest. Ihre Argumente:
|
||
|
||
| Argument | Quelle |
|
||
|----------|--------|
|
||
| Skalierungsgesetze gelten weiter, nur langsamer | Chinchilla-Erweiterungen |
|
||
| RLHF / Constitutional AI / „Reasoning"-Modi sind orthogonal zu Architektur | OpenAI o1/o3, Claude Extended Thinking |
|
||
| Tool-Use und Agent-Loops kompensieren Modell-Schwächen | OpenAI Function Calling, Anthropic MCP |
|
||
| Multimodale Erweiterung (Vision, Audio) als nächste Skalierungs-Achse | GPT-5 Vision, Claude 4 Multimodal |
|
||
|
||
**Hectors Einordnung:** Beide Lager haben rationale Argumente. DeepMind wettet stärker auf Architektur-Diversität; OpenAI/Anthropic auf Compute-Skalierung + Training-Methodik. Empirischer Sieger ist offen — wahrscheinlich Hybrid aus beidem (siehe `[[../concepts/world-models-jepa-vs-generative.md#strategische-konsequenzen-für-agi]]`).
|
||
|
||
## Verwandte Wiki-Seiten
|
||
|
||
- `[[deepmind-beyond-transformer.md]]` — DeepMinds Architektur-Diversität als Antwort
|
||
- `[[../concepts/llm/post-transformer-llm-architectures.md]]` — Vier-Säulen-Übersicht (Griffin, Diffusion, JEPA, Foundation-Prior)
|
||
- `[[../concepts/world-models-jepa-vs-generative.md]]` — Hassabis-vs-LeCun-Debatte
|
||
- `[[model-routing.md]]` — Wie wir in OpenClaw heute mit Architektur-Diversität umgehen
|
||
- `[[../concepts/llm/glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack)
|
||
- `[[../concepts/llm/ai-value-migration-orchestration.md]]` — Wertverschiebung zu Compute + Strom
|
||
|
||
## Externe Primärquellen
|
||
|
||
- **Vaswani et al., „Attention Is All You Need":** [arXiv:1706.03762](https://arxiv.org/abs/1706.03762) (Originalpaper)
|
||
- **Chinchilla Scaling Laws:** [arXiv:2203.15556](https://arxiv.org/abs/2203.15556) (Hoffmann et al., DeepMind 2022)
|
||
- **Flash Attention:** [arXiv:2205.14135](https://arxiv.org/abs/2205.14135) (Dao et al.)
|
||
- **Longformer:** [arXiv:2004.05150](https://arxiv.org/abs/2004.05150)
|
||
- **Pit-Zusammenfassung (OME Topic 6):** 2026-06-18, Pourya Kordi „DeepMind Was Two Steps Ahead, AGAIN!" (https://www.youtube.com/watch?v=8oyZB24-vAM) |