--- created: 2026-06-18 updated: 2026-06-18 sources: - youtube/2026-06-18_deepmind-beyond-transformer.md tags: [architecture, transformer, attention, scaling, foundation, post-transformer] --- # Transformer Foundation — Klassischer Stack und seine Grenzen > **Stand:** 2026-06-18. Hintergrund: Pit-Zusammenfassung in OME Topic 6 (aGi / eMergence), 2026-06-18, Pourya Kordi „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube). Diese Seite beschreibt den **klassischen Transformer-Stack**, seine Kernidee und seine **fundamentalen Skalierungs-Limits** — als Voraussetzung für das Verständnis der Alternativen auf `[[deepmind-beyond-transformer.md]]` und `[[../concepts/llm/post-transformer-llm-architectures.md]]`. ## Der klassische Transformer-Stack Der „klassische" moderne LLM-Stack, wie er seit 2017 ([Vaswani et al., „Attention Is All You Need"](https://arxiv.org/abs/1706.03762)) in OpenAI/Anthropic-Frontier-Modellen eingesetzt wird, besteht aus drei Säulen: | Säule | Beschreibung | Hauptvertreter | |-------|--------------|----------------| | **Globale Self-Attention** | Jedes Token sieht jedes andere Token in der Sequenz (volle Aufmerksamkeitsmatrix) | Alle GPT-, Claude-, Gemini-AR-Modelle | | **Autoregressive (AR) Generierung** | Token-für-Token sequentiell, irreversibel, ohne nachträgliche Korrektur | GPT-5.x, Claude Opus 4.x, Gemini 3.x | | **Großes statisches Pretraining** | Web-Scale-Daten, eine Trainingsphase, danach gefroren oder leicht fine-tuned | Chinchilla-Scaling-Laws | **Erfolgsgeschichte:** Dieser Stack hat seit 2018 GPT-2 → GPT-3 → GPT-4 → GPT-5x, BERT → RoBERTa, T5 → PaLM → Gemini, LLaMA → LLaMA 3/4, Claude 1 → 4 hervorgebracht. Alle Frontier-Modelle 2026 basieren auf dieser Architektur. ## Das Quadratic-Attention-Problem **Kernproblem:** Globale Self-Attention skaliert **quadratisch** mit der Sequenzlänge. ``` Aufmerksamkeitsmatrix = N × N wobei N = Sequenzlänge in Tokens ``` **Konsequenzen:** - **8k Token Kontext:** 64 Millionen Attention-Einträge pro Layer - **128k Token Kontext:** 16 Milliarden Attention-Einträge pro Layer - **1M Token Kontext:** 1 Billion Attention-Einträge pro Layer — praktisch nicht mehr trainierbar **Pit-Zusammenfassung (2026-06-18):** „Quadratische Komplexität der ‚naiven' globalen Attention wird bei langen Kontexten unpraktisch." **Standard-Milderungen (alle mit Trade-offs):** - **Flash Attention** — Speicher-effizienter Algorithmus, ändert nichts an asymptotischer Komplexität - **Sliding Window Attention** (z. B. Mistral) — jedes Token sieht nur einen lokalen Kontext - **Sparse Attention Patterns** — BigBird, Longformer, ETC. — vordefinierte Sparsity-Patterns - **KV-Cache-Komprimierung** — zur Laufzeit, nicht beim Training **DeepMinds radikalerer Ansatz:** Attention komplett durch **rekurrente Zustände** ergänzen oder ersetzen (Griffin, Recurrent Gemma, Titans — siehe `[[../concepts/llm/post-transformer-llm-architectures.md]]`). ## Skalierungs-Limits Pit-Zusammenfassung (2026-06-18): „Reine AR-LLMs liefern durch ‚Scale' allein womöglich nicht den nächsten qualitativ anderen Sprung." **Empirische Hinweise für nachlassende Skalierungsrenditen:** - **Chinchilla-Optimal** wurde 2022 erreicht; danach lineares Scaling statt super-linear - **Compute-Budget 2025/26:** ~10²⁵ FLOPs für Frontier-Trainings; weitere OOMs werden teurer (Energie, Chip-Engpässe) - **Datenmauer:** Hochwertige Textdaten nähern sich der Erschöpfung; Multimodal-Daten sind die nächste Reserve, aber Tokenisierung ist teurer - **Pre-Training-Plateau:** GPT-5.x und Claude 4.x zeigen kleinere Sprünge zwischen Generationen als GPT-3 → GPT-4 **Konsequenz:** Das „mehr vom Gleichen"-Spiel stößt an harte Grenzen. Architektur-Innovation wird zum primären Hebel — siehe `[[deepmind-beyond-transformer.md]]` für DeepMinds Strategie. ## Alternative: AR + Skalierung reicht — die Gegenposition OpenAI und Anthropic halten an AR + Scaling fest. Ihre Argumente: | Argument | Quelle | |----------|--------| | Skalierungsgesetze gelten weiter, nur langsamer | Chinchilla-Erweiterungen | | RLHF / Constitutional AI / „Reasoning"-Modi sind orthogonal zu Architektur | OpenAI o1/o3, Claude Extended Thinking | | Tool-Use und Agent-Loops kompensieren Modell-Schwächen | OpenAI Function Calling, Anthropic MCP | | Multimodale Erweiterung (Vision, Audio) als nächste Skalierungs-Achse | GPT-5 Vision, Claude 4 Multimodal | **Hectors Einordnung:** Beide Lager haben rationale Argumente. DeepMind wettet stärker auf Architektur-Diversität; OpenAI/Anthropic auf Compute-Skalierung + Training-Methodik. Empirischer Sieger ist offen — wahrscheinlich Hybrid aus beidem (siehe `[[../concepts/world-models-jepa-vs-generative.md#strategische-konsequenzen-für-agi]]`). ## Verwandte Wiki-Seiten - `[[deepmind-beyond-transformer.md]]` — DeepMinds Architektur-Diversität als Antwort - `[[../concepts/llm/post-transformer-llm-architectures.md]]` — Vier-Säulen-Übersicht (Griffin, Diffusion, JEPA, Foundation-Prior) - `[[../concepts/world-models-jepa-vs-generative.md]]` — Hassabis-vs-LeCun-Debatte - `[[model-routing.md]]` — Wie wir in OpenClaw heute mit Architektur-Diversität umgehen - `[[../concepts/llm/glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack) - `[[../concepts/llm/ai-value-migration-orchestration.md]]` — Wertverschiebung zu Compute + Strom ## Externe Primärquellen - **Vaswani et al., „Attention Is All You Need":** [arXiv:1706.03762](https://arxiv.org/abs/1706.03762) (Originalpaper) - **Chinchilla Scaling Laws:** [arXiv:2203.15556](https://arxiv.org/abs/2203.15556) (Hoffmann et al., DeepMind 2022) - **Flash Attention:** [arXiv:2205.14135](https://arxiv.org/abs/2205.14135) (Dao et al.) - **Longformer:** [arXiv:2004.05150](https://arxiv.org/abs/2004.05150) - **Pit-Zusammenfassung (OME Topic 6):** 2026-06-18, Pourya Kordi „DeepMind Was Two Steps Ahead, AGAIN!" (https://www.youtube.com/watch?v=8oyZB24-vAM)