diff --git a/raw/youtube/2026-06-18_deepmind-beyond-transformer.md b/raw/youtube/2026-06-18_deepmind-beyond-transformer.md new file mode 100644 index 0000000..8111c42 --- /dev/null +++ b/raw/youtube/2026-06-18_deepmind-beyond-transformer.md @@ -0,0 +1,86 @@ +--- +type: youtube +source_url: https://www.youtube.com/watch?v=8oyZB24-vAM +retrieved: 2026-06-18 +title: "DeepMind Was Two Steps Ahead, AGAIN!" +channel: "Pourya Kordi" +channel_url: https://www.youtube.com/@Pourya_Kordi +author_handle: "@Pourya_Kordi" +duration_sec: null +has_transcript: false +transcript_note: "Auto-Transcript via youtube.com nicht abrufbar (LOGIN_REQUIRED); Pits Textzusammenfassung in OME Topic 6 (aGi / eMergence) als Primärquelle genutzt." +pit_summary_ref: "OME Topic 6 (aGi / eMergence), 2026-06-18 — Pit Weber" +topic: "aGi / eMergence" +tags: [deepmind, transformer, attention, diffusion, world-models, jepa, griffin, recurrent-gemma, gemma, agi, post-transformer, hassabis, lecun] +--- + +# DeepMind Was Two Steps Ahead, AGAIN! + +**Pit Weber — 2026-06-18 — OME Topic 6 (aGi / eMergence)** +**Kanal:** Pourya Kordi · [@Pourya_Kordi](https://www.youtube.com/@Pourya_Kordi) +**Video:** https://www.youtube.com/watch?v=8oyZB24-vAM + +> **Hinweis:** YouTube liefert für dieses Video kein maschinenlesbares Transkript (LOGIN_REQUIRED). Diese Datei basiert auf Pits zweiter Zusammenfassung desselben Videos (Topic 6 / aGi / eMergence), zwei Tage nach der ersten Ingest-Welle (Topic 13 / News & Infos, 2026-06-16 → `raw/youtube/2026-06-16_deepmind-two-steps-ahead.md`). Inhaltlich deckungsgleich mit der 16.06-Zusammenfassung; strukturell hier nochmal als eigenständige Quelle geführt, weil sie in einem anderen Topic-Kontext (aGi / eMergence statt News) gepostet wurde. + +## Kernthese + +DeepMind positioniert sich **jenseits des klassischen Transformer-Stacks** (autoregressive LLMs mit globaler Attention) und investiert systematisch in alternative Architekturen — als Fundament einer nächsten Generation, in der AR-Transformer + Scaling allein möglicherweise nicht den nächsten qualitativ anderen Sprung liefern. + +## 1. Architektur-Alternativen jenseits globaler Attention + +Quadratische Komplexität der „naiven" globalen Attention wird bei langen Kontexten unpraktisch. DeepMind-Alternativen kombinieren **lokale Attention** mit **rekurrentem Zustand** für effizienten Langzeitkontext: + +- **Griffin** — lokale Attention (Fenster) + rekurrentes „Index-Karten"-Gedächtnis, das essentielle Information komprimiert fortschreibt, statt eine riesige KV-Cache-Historie mitzuschleppen. +- **Recurrent Gemma** — baut auf Griffin auf; verbesserte Langkontext-Benchmarks. +- **Titans** — „Learning to Memorize at Test Time"; selektives Gedächtnis für sehr lange Kontexte. + +## 2. Gemma 4 + +Kombination aus **Sparsity/Experts** und **hybrider Attention** (lokal + global). Multimodalität bis **256k Token Kontext auf Edge-Hardware** — also auf Consumer-Geräten lauffähig, nicht nur in Rechenzentren. + +## 3. Diffusions-LLMs + +Statt sequentieller Token-Generierung (klassische AR-Transformer) verfeinern Diffusions-LLMs **iterativ die ganze Sequenz**: + +- **~10× schneller** bei vergleichbarer Qualität (gemessen) +- **Parallele Updates** statt Token-Pipeline → GPU-freundlich +- **Eingebaute Fehlerkorrektur** durch iterative Verfeinerung +- **Flexibler:** Code-Completion in beliebigen Kontextpositionen, nicht nur als Präfix-Fortsetzung +- **DeepMind-Instanz:** Gemini Diffusion (Ankündigung Mai 2025) als zentrale Technologie **neben** (nicht statt) den AR-LLMs + +## 4. Weltmodelle via Video-Generation + +**Demis Hassabis' These:** VEO-ähnliche Video-Generatoren, die glaubwürdige Szenen erzeugen, **müssen** latente Physik, Objektpermanenz und Kausalität gelernt haben — sonst könnten sie keine konsistenten Welten generieren. Realistische Generierung = impliziter Weltmodell-Test. + +## 5. LeCun-Konter: JEPA > generative Objectives + +**Yann LeCun (Gegenposition):** Rein generative Objectives stecken zu viel Rechenaufwand in **unvorhersagbare Details** (berühmtes Beispiel: „Blattflattern" im Wind). JEPA-artige Joint-Embedding-Modelle prognostizieren stattdessen nur **kompatible Repräsentationen** fehlender Teile — keine Pixel-Rekonstruktion. Vertreter: **V-JEPA** (Meta AI Research). + +**Theoretisch effizienter**, **empirisch (noch) hinter** den Top-Generatoren — die Debatte ist offen. + +## 6. Strategischer Kontrast DeepMind vs. AR-Only-Labs + +| Position | Labs | Kern-These | +|----------|------|-----------| +| **AR + Scaling** | OpenAI, Anthropic | Klassische Transformer + Skalierungsgesetze reichen; Compute ist der Engpass | +| **Architektur-Diversität** | DeepMind | Reine AR-LLMs liefern womöglich nicht den nächsten Sprung; Diffusion + hybride Architekturen sind Fundament der nächsten Generation | + +**Hinweis:** Aufgabe von Sora zugunsten des GPT-Stacks (OpenAI DevDay 2024) wird als Indiz für AR-Fokus gelesen. DeepMind hält dagegen **Gemini Diffusion** als zentrale Säule. + +## Offene Fragen + +- Sollten wir mittelfristig Griffin-artige Architekturen für **lokal laufende Embedding/SSR-Modelle** evaluieren? +- Ist der Diffusions-Pfad relevant für **Code-Completion in nicht-Präfix-Positionen** im Agenten-Workflow? +- Wie balancieren wir Foundation-Prior (großes vortrainiertes Modell) vs. Continual-Learning (eigene Erfahrung) bei unseren Subconscious-/Memory-Subsystemen? + +## Externe Primärquellen + +- **Video (Original):** https://www.youtube.com/watch?v=8oyZB24-vAM +- **Kanal:** https://www.youtube.com/@Pourya_Kordi +- **Griffin:** [arXiv:2402.19427](https://arxiv.org/abs/2402.19427) · [Google Research](https://research.google/blog/introducing-griffin/) +- **Recurrent Gemma:** [arXiv:2404.08239](https://arxiv.org/abs/2404.08239) · [Google Blog](https://blog.google/technology/developers/google-gemma-recurrent/) +- **Titans:** [arXiv:2501.00663](https://arxiv.org/abs/2501.00663) +- **Gemini Diffusion:** [Google DeepMind Blog](https://blog.google/technology/google-deepmind/google-gemini-updates/) +- **V-JEPA:** [Meta AI Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) · [arXiv:2404.08471](https://arxiv.org/abs/2404.08471) +- **LeCun JEPA-Framework:** [OpenReview 2022](https://openreview.net/pdf?id=BZ5a1r-kVsf) +- **Schwester-Raw (2026-06-16):** `raw/youtube/2026-06-16_deepmind-two-steps-ahead.md` (Pit Topic 13, identisches Video, frühere Ingest-Welle) \ No newline at end of file diff --git a/scripts/wiki-lint-report.md b/scripts/wiki-lint-report.md index ec08813..1b70e88 100644 --- a/scripts/wiki-lint-report.md +++ b/scripts/wiki-lint-report.md @@ -1,6 +1,6 @@ # Wiki Lint Report -*Generated: 2026-06-18 14:21:24 UTC* +*Generated: 2026-06-18 20:23:35 UTC* *Repo: /home/node/workspace/knowledge-base* *Script: scripts/wiki-lint.sh v1.0* @@ -9,7 +9,8 @@ | Dir | Files | Trigger | |-----|-------|---------| | wiki | 3 | ✅ | -| wiki/architecture | 6 | ✅ | +| wiki/architecture | 8 | ✅ | +| wiki/concepts | 1 | ✅ | | wiki/concepts/agents | 6 | ✅ | | wiki/concepts/agi | 1 | ✅ | | wiki/concepts/directives | 3 | ✅ | @@ -25,7 +26,7 @@ _Schema v1.5 Sub-Categories: `concepts/hardware`, `concepts/agi`, `people/`, `institutions/` (alle in Counts oben enthalten)_ ### Stub-Quote (<30 Zeilen) -✅ **4 / 52 (7%)** +✅ **4 / 55 (7%)** Stub-Files: - `wiki/ideas/2026-04-08_git-auto-commit.md (28 lines)` @@ -34,7 +35,7 @@ Stub-Files: - `wiki/ideas/2026-06-06_plur1bus-priority-fix.md (29 lines)` ### Frontmatter Präsenz -✅ **49 / 52 present** +✅ **52 / 55 present** ### Broken Cross-References ✅ **0 broken** @@ -82,11 +83,11 @@ Stub-Files: ✅ **0 stale** ### Uncovered Raw Sources -✅ **26 raw, all covered** +✅ **27 raw, all covered** ## Summary -- Total Wiki-Pages: 52 +- Total Wiki-Pages: 55 - Issues: 0 → Wiki is clean. No subagent spawn needed. diff --git a/wiki/architecture/deepmind-beyond-transformer.md b/wiki/architecture/deepmind-beyond-transformer.md new file mode 100644 index 0000000..906074c --- /dev/null +++ b/wiki/architecture/deepmind-beyond-transformer.md @@ -0,0 +1,89 @@ +--- +created: 2026-06-18 +updated: 2026-06-18 +sources: + - youtube/2026-06-18_deepmind-beyond-transformer.md + - youtube/2026-06-16_deepmind-two-steps-ahead.md +tags: [architecture, deepmind, post-transformer, diffusion-llm, griffin, recurrent-gemma, titans, gemma, gemini, agi] +--- + +# DeepMind Beyond Transformer — Strategischer Architektur-Kontrast + +> **Aggregiert-Stand:** 2026-06-18. Primärquellen: Pourya Kordi, „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube, https://www.youtube.com/watch?v=8oyZB24-vAM) — Pit-Zusammenfassung in OME Topic 6 (aGi / eMergence) am 2026-06-18. YouTube-Transkript nicht abrufbar (LOGIN_REQUIRED). Schwester-Ingest vom 2026-06-16 (Topic 13) liegt unter `raw/youtube/2026-06-16_deepmind-two-steps-ahead.md` und wird hier inhaltlich mit zitiert. + +Diese Seite rückt den **strategischen Kontrast** zwischen DeepMinds Architektur-Diversität und der AR-Only-Strategie von OpenAI/Anthropic in den Mittelpunkt. Technische Details zu den einzelnen Architekturen sind auf der Schwester-Seite `[[../concepts/llm/post-transformer-llm-architectures.md]]` (Vier-Säulen-Übersicht) und der Konzept-Seite `[[../concepts/world-models-jepa-vs-generative.md]]` (Hassabis-vs-LeCun-Debatte) ausführlich dokumentiert. + +## Kernthese: Architektur-Diversität statt Monokultur + +DeepMind verfolgt **vier parallele Säulen**, statt die gesamte Compute-Allokation auf AR-Transformer-Skalierung zu setzen: + +| Säule | Wettlauf-Anteil | Schlüsselmodelle | OpenClaw-Relevanz | +|-------|----------------|------------------|-------------------| +| **Hybride Attention / Recurrence** | Mittel-Lang-Kontext auf Edge | Griffin, Recurrent Gemma, Titans | Lokal laufende Embeddings/SSR | +| **Diffusions-LLMs** | Schnelle, parallele Generierung | Gemini Diffusion | Code-Completion in beliebigen Positionen | +| **Multimodale Edge-Modelle** | On-Device-Deployment | Gemma 4 (Sparsity+hybride Attention, 256k Kontext) | Self-Hosted Sovereignty | +| **Weltmodelle** | AGI-Wegbereitung | VEO + Hassabis-These | siehe Konzept-Seite | + +## Strategischer Kontrast: DeepMind vs. AR-Only-Labs + +| | OpenAI / Anthropic | DeepMind | +|---|-------------------|----------| +| **Primär-Stack** | AR-Transformer + Skalierung | AR + Diffusion + Hybride + Weltmodelle | +| **Skalierungs-Hebel** | Compute (Chinchilla, Scaling Laws) | Compute **und** Architektur-Innovation | +| **Indiz für Position** | Aufgabe von Sora zugunsten GPT-Stack (OpenAI DevDay 2024) | Gemini Diffusion als zentrale Säule (Mai 2025) | +| **Wettlauf-Strategie** | „Wir skalieren besser als die anderen" | „Wir skalieren ANDERS — mit Architektur-Mix" | +| **Risiko** | AR-Hitze-Dead-End (Skalierungsgesetze flachen ab) | AR-Beiwerk wird verworfen, falsche Säule gewinnt | +| **Compute-Allokation** | SaaS-Produkt-Optimierung | AGI-Mission | + +**Pit-Zusammenfassung (2026-06-18):** „OpenAI/Anthropic setzen auf AR-Transformer + Scaling; DeepMind setzt auf Diffusion + hybride Architekturen als Fundament der nächsten Generation." + +## Was macht DeepMind anders? — Vier strategische Prinzipien + +1. **Architektur-Diversität statt Monokultur** — vier parallele Säulen statt einer vertikalen Skalierungspiste. +2. **Compute-Allokation auf AGI-Mission**, nicht auf SaaS-Optimierung. +3. **Langfristiger wissenschaftlicher Zeithorizont** — bereit, „verlorene" Wetten auf nicht-AR-Architekturen einzugehen. +4. **Hypothese:** Reine AR-LLMs liefern durch „Scale" allein womöglich nicht den nächsten **qualitativ anderen** Sprung; Diffusion + hybride Architekturen + Weltmodelle sind die Architekturgrundlage der nächsten Generation. + +## Detail-Säulen mit Architektur-Referenzen + +### 1. Hybride Attention / Recurrence (Griffin / Recurrent Gemma / Titans) + +Quadratische Komplexität globaler Attention → bei langen Kontexten unpraktisch. DeepMind-Alternativen kombinieren lokale Attention mit rekurrentem Zustand. Detail-Beschreibungen und externe arXiv-Links siehe `[[../concepts/llm/post-transformer-llm-architectures.md#1-effizientere-attention--hybride-architekturen]]`. + +### 2. Gemma 4 — Edge-Multimodalität + +- Sparsity/Experts + hybrid (lokal + global) Attention +- Multimodal +- **256k Token Kontext auf Edge-Hardware** — d. h. auf Consumer-Geräten lauffähig +- **OpenClaw-Relevanz:** Self-Hosted Sovereignty, Datenschutz, Latenz-Reduktion + +### 3. Diffusions-LLMs (Gemini Diffusion) + +Statt sequentieller AR-Generierung → iterative Verfeinerung der ganzen Sequenz. Pit-Zusammenfassung nennt konkret **~10× schneller bei vergleichbarer Qualität**, parallele Updates, GPU-freundlich, eingebaute Fehlerkorrektur, und **Code-Completion in beliebigen Kontextpositionen** (statt nur Präfix-Fortsetzung). Detail-Tabellen siehe `[[../concepts/llm/post-transformer-llm-architectures.md#2-diffusions-llms-nicht-ar-generierung]]`. + +### 4. Weltmodelle — Hassabis-vs-LeCun-Debatte + +Wird auf eigener Konzept-Seite `[[../concepts/world-models-jepa-vs-generative.md]]` strukturiert. + +## Externe Primärquellen + +- **Video:** https://www.youtube.com/watch?v=8oyZB24-vAM (Pourya Kordi) +- **Pit Topic 6:** OME Topic 6 (aGi / eMergence), 2026-06-18 +- **Pit Topic 13:** OME Topic 13 #6645, 2026-06-16 (Schwester-Ingest) +- **Griffin:** [arXiv:2402.19427](https://arxiv.org/abs/2402.19427) +- **Recurrent Gemma:** [arXiv:2404.08239](https://arxiv.org/abs/2404.08239) · [Google Blog](https://blog.google/technology/developers/google-gemma-recurrent/) +- **Titans:** [arXiv:2501.00663](https://arxiv.org/abs/2501.00663) +- **Gemini Diffusion:** [Google DeepMind Blog](https://blog.google/technology/google-deepmind/google-gemini-updates/) +- **V-JEPA:** [Meta AI Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) · [arXiv:2404.08471](https://arxiv.org/abs/2404.08471) +- **LeCun JEPA-Framework:** [OpenReview 2022](https://openreview.net/pdf?id=BZ5a1r-kVsf) +- **OpenAI DevDay 2024 (Sora-Kontext):** [OpenAI](https://openai.com/index/sora-is-here/) + +## Verwandte Wiki-Seiten + +- `[[../concepts/llm/post-transformer-llm-architectures.md]]` — Vier-Säulen-Übersicht mit Architektur-Details +- `[[../concepts/world-models-jepa-vs-generative.md]]` — Hassabis-vs-LeCun-Debatte als eigenständiges Konzept +- `[[transformer-foundation.md]]` — Klassischer Transformer-Stack + Quadratic-Attention-Limit (Voraussetzung) +- `[[model-routing.md]]` — Routing-Entscheidungen sollten Architektur-Diversität berücksichtigen +- `[[../concepts/llm/llm-model-fusion-ensembles.md]]` — Orthogonaler Ansatz (mehrere Modelle ensemble) +- `[[../concepts/llm/glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack) als Kontrast +- `[[../concepts/llm/ai-value-migration-orchestration.md]]` — Aravind Srinivas (20VC) zu AGI-Wettlauf \ No newline at end of file diff --git a/wiki/architecture/transformer-foundation.md b/wiki/architecture/transformer-foundation.md new file mode 100644 index 0000000..9b9b02e --- /dev/null +++ b/wiki/architecture/transformer-foundation.md @@ -0,0 +1,91 @@ +--- +created: 2026-06-18 +updated: 2026-06-18 +sources: + - youtube/2026-06-18_deepmind-beyond-transformer.md +tags: [architecture, transformer, attention, scaling, foundation, post-transformer] +--- + +# Transformer Foundation — Klassischer Stack und seine Grenzen + +> **Stand:** 2026-06-18. Hintergrund: Pit-Zusammenfassung in OME Topic 6 (aGi / eMergence), 2026-06-18, Pourya Kordi „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube). + +Diese Seite beschreibt den **klassischen Transformer-Stack**, seine Kernidee und seine **fundamentalen Skalierungs-Limits** — als Voraussetzung für das Verständnis der Alternativen auf `[[deepmind-beyond-transformer.md]]` und `[[../concepts/llm/post-transformer-llm-architectures.md]]`. + +## Der klassische Transformer-Stack + +Der „klassische" moderne LLM-Stack, wie er seit 2017 ([Vaswani et al., „Attention Is All You Need"](https://arxiv.org/abs/1706.03762)) in OpenAI/Anthropic-Frontier-Modellen eingesetzt wird, besteht aus drei Säulen: + +| Säule | Beschreibung | Hauptvertreter | +|-------|--------------|----------------| +| **Globale Self-Attention** | Jedes Token sieht jedes andere Token in der Sequenz (volle Aufmerksamkeitsmatrix) | Alle GPT-, Claude-, Gemini-AR-Modelle | +| **Autoregressive (AR) Generierung** | Token-für-Token sequentiell, irreversibel, ohne nachträgliche Korrektur | GPT-5.x, Claude Opus 4.x, Gemini 3.x | +| **Großes statisches Pretraining** | Web-Scale-Daten, eine Trainingsphase, danach gefroren oder leicht fine-tuned | Chinchilla-Scaling-Laws | + +**Erfolgsgeschichte:** Dieser Stack hat seit 2018 GPT-2 → GPT-3 → GPT-4 → GPT-5x, BERT → RoBERTa, T5 → PaLM → Gemini, LLaMA → LLaMA 3/4, Claude 1 → 4 hervorgebracht. Alle Frontier-Modelle 2026 basieren auf dieser Architektur. + +## Das Quadratic-Attention-Problem + +**Kernproblem:** Globale Self-Attention skaliert **quadratisch** mit der Sequenzlänge. + +``` +Aufmerksamkeitsmatrix = N × N +wobei N = Sequenzlänge in Tokens +``` + +**Konsequenzen:** +- **8k Token Kontext:** 64 Millionen Attention-Einträge pro Layer +- **128k Token Kontext:** 16 Milliarden Attention-Einträge pro Layer +- **1M Token Kontext:** 1 Billion Attention-Einträge pro Layer — praktisch nicht mehr trainierbar + +**Pit-Zusammenfassung (2026-06-18):** „Quadratische Komplexität der ‚naiven' globalen Attention wird bei langen Kontexten unpraktisch." + +**Standard-Milderungen (alle mit Trade-offs):** +- **Flash Attention** — Speicher-effizienter Algorithmus, ändert nichts an asymptotischer Komplexität +- **Sliding Window Attention** (z. B. Mistral) — jedes Token sieht nur einen lokalen Kontext +- **Sparse Attention Patterns** — BigBird, Longformer, ETC. — vordefinierte Sparsity-Patterns +- **KV-Cache-Komprimierung** — zur Laufzeit, nicht beim Training + +**DeepMinds radikalerer Ansatz:** Attention komplett durch **rekurrente Zustände** ergänzen oder ersetzen (Griffin, Recurrent Gemma, Titans — siehe `[[../concepts/llm/post-transformer-llm-architectures.md]]`). + +## Skalierungs-Limits + +Pit-Zusammenfassung (2026-06-18): „Reine AR-LLMs liefern durch ‚Scale' allein womöglich nicht den nächsten qualitativ anderen Sprung." + +**Empirische Hinweise für nachlassende Skalierungsrenditen:** +- **Chinchilla-Optimal** wurde 2022 erreicht; danach lineares Scaling statt super-linear +- **Compute-Budget 2025/26:** ~10²⁵ FLOPs für Frontier-Trainings; weitere OOMs werden teurer (Energie, Chip-Engpässe) +- **Datenmauer:** Hochwertige Textdaten nähern sich der Erschöpfung; Multimodal-Daten sind die nächste Reserve, aber Tokenisierung ist teurer +- **Pre-Training-Plateau:** GPT-5.x und Claude 4.x zeigen kleinere Sprünge zwischen Generationen als GPT-3 → GPT-4 + +**Konsequenz:** Das „mehr vom Gleichen"-Spiel stößt an harte Grenzen. Architektur-Innovation wird zum primären Hebel — siehe `[[deepmind-beyond-transformer.md]]` für DeepMinds Strategie. + +## Alternative: AR + Skalierung reicht — die Gegenposition + +OpenAI und Anthropic halten an AR + Scaling fest. Ihre Argumente: + +| Argument | Quelle | +|----------|--------| +| Skalierungsgesetze gelten weiter, nur langsamer | Chinchilla-Erweiterungen | +| RLHF / Constitutional AI / „Reasoning"-Modi sind orthogonal zu Architektur | OpenAI o1/o3, Claude Extended Thinking | +| Tool-Use und Agent-Loops kompensieren Modell-Schwächen | OpenAI Function Calling, Anthropic MCP | +| Multimodale Erweiterung (Vision, Audio) als nächste Skalierungs-Achse | GPT-5 Vision, Claude 4 Multimodal | + +**Hectors Einordnung:** Beide Lager haben rationale Argumente. DeepMind wettet stärker auf Architektur-Diversität; OpenAI/Anthropic auf Compute-Skalierung + Training-Methodik. Empirischer Sieger ist offen — wahrscheinlich Hybrid aus beidem (siehe `[[../concepts/world-models-jepa-vs-generative.md#strategische-konsequenzen-für-agi]]`). + +## Verwandte Wiki-Seiten + +- `[[deepmind-beyond-transformer.md]]` — DeepMinds Architektur-Diversität als Antwort +- `[[../concepts/llm/post-transformer-llm-architectures.md]]` — Vier-Säulen-Übersicht (Griffin, Diffusion, JEPA, Foundation-Prior) +- `[[../concepts/world-models-jepa-vs-generative.md]]` — Hassabis-vs-LeCun-Debatte +- `[[model-routing.md]]` — Wie wir in OpenClaw heute mit Architektur-Diversität umgehen +- `[[../concepts/llm/glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack) +- `[[../concepts/llm/ai-value-migration-orchestration.md]]` — Wertverschiebung zu Compute + Strom + +## Externe Primärquellen + +- **Vaswani et al., „Attention Is All You Need":** [arXiv:1706.03762](https://arxiv.org/abs/1706.03762) (Originalpaper) +- **Chinchilla Scaling Laws:** [arXiv:2203.15556](https://arxiv.org/abs/2203.15556) (Hoffmann et al., DeepMind 2022) +- **Flash Attention:** [arXiv:2205.14135](https://arxiv.org/abs/2205.14135) (Dao et al.) +- **Longformer:** [arXiv:2004.05150](https://arxiv.org/abs/2004.05150) +- **Pit-Zusammenfassung (OME Topic 6):** 2026-06-18, Pourya Kordi „DeepMind Was Two Steps Ahead, AGAIN!" (https://www.youtube.com/watch?v=8oyZB24-vAM) \ No newline at end of file diff --git a/wiki/concepts/llm/post-transformer-llm-architectures.md b/wiki/concepts/llm/post-transformer-llm-architectures.md index 0a68d66..18d3b2e 100644 --- a/wiki/concepts/llm/post-transformer-llm-architectures.md +++ b/wiki/concepts/llm/post-transformer-llm-architectures.md @@ -1,14 +1,20 @@ --- created: 2026-06-16 -updated: 2026-06-16 +updated: 2026-06-18 sources: - youtube/2026-06-16_deepmind-two-steps-ahead.md + - youtube/2026-06-18_deepmind-beyond-transformer.md tags: [architecture, deepmind, post-transformer, diffusion-llm, jepa, world-model, griffin, recurrent-gemma] --- # Post-Transformer LLM Architectures -> **Aggregiert-Stand:** 2026-06-16, basiert primär auf Pourya Kordi, „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube) und der Pit-Zusammenfassung in [OME Topic 13 #6645](https://t.me/c/3839640481/13/6645). Transkript nicht abrufbar; Pit-Zusammenfassung als Primärquelle genutzt. +> **Aggregiert-Stand:** 2026-06-16, erweitert 2026-06-18. Primärquellen: Pourya Kordi, „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube), Pit-Zusammenfassungen in [OME Topic 13 #6645](https://t.me/c/3839640481/13/6645) (16.06) und OME Topic 6 / aGi / eMergence (18.06). Transkript nicht abrufbar; Pit-Zusammenfassungen als Primärquelle. +> +> **Schwester-Seiten:** +> - Strategischer Kontrast DeepMind vs. AR-Only-Labs: `[[../../architecture/deepmind-beyond-transformer.md]]` +> - Hassabis-vs-LeCun-Weltmodell-Debatte: `[[../world-models-jepa-vs-generative.md]]` +> - Klassischer Transformer als Basis: `[[../../architecture/transformer-foundation.md]]` DeepMind verfolgt eine **mehrgleisige Architekturstrategie**, die das klassische Transformer-Stack (AR + globale Attention + dichte Skalierung) **nicht ablöst, sondern erweitert**. Diese Seite sammelt die vier strategischen Säulen. @@ -93,6 +99,9 @@ Quadratische Komplexität der „naiven" globalen Attention wird bei langen Kont - `[[llm-model-fusion-ensembles.md]]` — Orthogonaler Ansatz: mehrere Modelle ensemble - `[[glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack) als Kontrast +- `[[../world-models-jepa-vs-generative.md]]` — Hassabis-vs-LeCun-Debatte (eigenständige Konzept-Seite, 18.06.2026) +- `[[../../architecture/deepmind-beyond-transformer.md]]` — Strategischer Kontrast DeepMind vs. AR-Only-Labs +- `[[../../architecture/transformer-foundation.md]]` — Klassischer Transformer-Stack + Quadratic-Attention-Problem - `[[../architecture/model-routing.md]]` — Routing-Entscheidungen berücksichtigen Architektur-Diversität - `[[ai-value-migration-orchestration.md]]` — 20VC Perspektive: Aravind Srinivas zu AGI-Wettlauf diff --git a/wiki/concepts/world-models-jepa-vs-generative.md b/wiki/concepts/world-models-jepa-vs-generative.md new file mode 100644 index 0000000..ce66c1d --- /dev/null +++ b/wiki/concepts/world-models-jepa-vs-generative.md @@ -0,0 +1,111 @@ +--- +created: 2026-06-18 +updated: 2026-06-18 +sources: + - youtube/2026-06-18_deepmind-beyond-transformer.md + - youtube/2026-06-16_deepmind-two-steps-ahead.md +tags: [concept, world-models, jepa, hassabis, lecun, generative, video-generation, v-jepa, veo, agi, deepmind, meta] +--- + +# Weltmodelle: JEPA vs. Generativ — Die Hassabis-LeCun-Debatte + +> **Stand:** 2026-06-18. Quellen: Pourya Kordi Video „DeepMind Was Two Steps Ahead, AGAIN!" (Pit-Zusammenfassung in OME Topic 6 / aGi / eMergence, 2026-06-18) und Schwester-Ingest vom 2026-06-16 (Topic 13). YouTube-Transkript nicht abrufbar (LOGIN_REQUIRED). + +Diese Konzept-Seite strukturiert die **theoretische und strategische Debatte** zwischen zwei fundamental verschiedenen Wegen zu einem Weltmodell: **generative Rekonstruktion** (Hassabis) vs. **Joint-Embedding-Prediction** (LeCun). Die Seite ist konzeptuell fokussiert — die breitere DeepMind-Architektur-Strategie liegt auf `[[../architecture/deepmind-beyond-transformer.md]]`, die technischen Säulen auf `[[../concepts/llm/post-transformer-llm-architectures.md]]`. + +## Grundfrage + +> Wie lernt ein Modell die latente Struktur der Welt — Physik, Objektpermanenz, Kausalität, räumliche/zeitliche Konsistenz? + +Zwei Antworten, zwei Lager, zwei verschiedene Trainingsziele. + +## Pfad A: Generative Weltmodelle (Hassabis-Lager) + +**Demis Hassabis (DeepMind):** Realistische Video-Generatoren wie VEO sind nicht nur „schöne Pixel". Wer glaubwürdige Szenen erzeugt, **muss** latente Regularitäten gelernt haben — sonst wären die Szenen physikalisch inkonsistent. + +**Trainingsziel:** Rekonstruktion aus Rauschen (Diffusion). + +**Vertreter:** +- **VEO** (Google DeepMind) — Video-Generation auf Weltmodell-Niveau +- **Sora** (OpenAI) — Vergleichsfall; wurde laut Pit zugunsten des GPT-Stacks zurückgefahren (OpenAI DevDay 2024) +- **Gemini Diffusion** — Text-Diffusion als Schwester-Pfad + +**Stärken:** +- Implizit Weltregularitäten (Physik, Objektpermanenz, Kausalität) +- Output-Qualität ist sichtbar — generierte Videos „beweisen" das Modell +- Direkter Weg zu Anwendungen (VEO ist Produkt-fähig) + +**Schwächen:** +- **Compute-Verschwendung** für unwesentliche Details (LeCuns Hauptkritik: „Blattflattern im Wind") +- Latente Repräsentation ist implizit — schwer zu interpretieren oder gezielt zu nutzen +- Skaliert möglicherweise ineffizient — je realistischer das Pixel-Output, desto mehr Bits für unvorhersagbares Rauschen + +## Pfad B: JEPA — Joint Embedding Predictive Architecture (LeCun-Lager) + +**Yann LeCun (Meta):** Rein generative Objectives sind fundamental verschwenderisch. Statt Pixel zu rekonstruieren, sollen Modelle **kompatible Repräsentationen** für fehlende Teile vorhersagen — Embeddings, keine Pixel. + +**Trainingsziel:** Konsistenz von Repräsentationen (Kontext-Encoder + Target-Encoder + Prädiktor im Embedding-Space). + +**Vertreter:** +- **V-JEPA** (Meta AI Research) — Video-JEPA, [arXiv:2404.08471](https://arxiv.org/abs/2404.08471), [Meta Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) +- **I-JEPA** (Image-JEPA) — Vorgänger +- **Original JEPA-Framework:** LeCun, [OpenReview 2022](https://openreview.net/pdf?id=BZ5a1r-kVsf) + +**Stärken:** +- **Theoretisch effizienter** — sagt nur Embeddings voraus, keine Pixel-Detailflut +- **Skaliert besser**, weil Compute dort investiert wird, wo er zählt (Regularitäten, nicht Rauschen) +- Latente Repräsentation ist **explizit** und nutzbar für Planung, Suche, Reasoning + +**Schwächen:** +- **Empirisch (noch) hinter** den Top-Generatoren — keine vergleichbar beeindruckenden Demos +- Schwer zu evaluieren, weil keine direkten „Generierungs-Beweise" wie bei VEO +- Braucht eine **zweite Stufe** (Decoder, Renderer) für sichtbare Outputs + +## Trade-offs auf einen Blick + +| Dimension | Generativ (Hassabis) | JEPA (LeCun) | +|-----------|----------------------|--------------| +| **Trainingsziel** | Pixel-Rekonstruktion | Embedding-Konsistenz | +| **Compute-Effizienz** | niedriger (Blattflattern-Problem) | höher (theoretisch) | +| **Skalierbarkeit** | qualitativ begrenzt durch Pixel-Rauschen | qualitativ offen | +| **Output-Qualität (empirisch 2026)** | sehr hoch (VEO) | noch im Aufbau | +| **Latente Repräsentation** | implizit, schwer nutzbar | explizit, planbar | +| **Reifegrad** | produktionsreif | Forschung | +| **Verifikation** | „Schau das Video an" | braucht Downstream-Tasks | + +## Der aktuelle Stand 2026 + +**Pit-Zusammenfassung (2026-06-18):** „VEO-ähnliche Generatoren müssen latente Physik/Objektpermanenz/Kausalität gelernt haben" — Hassabis-These als Konsens innerhalb der DeepMind-Strategie. LeCuns JEPA-Gegenposition ist **konzeptionell elegant**, aber empirisch nicht an der Spitze. + +**Hectors Einordnung:** Die Debatte ist nicht „wer hat recht" — beide Pfade verfolgen dasselbe Ziel mit verschiedenen Methoden: + +- **Hassabis:** „Zeig mir, dass du die Welt verstehst, indem du sie generierst." Empirie-first. +- **LeCun:** „Lerne die Welt als kompaktes Modell, bevor du Pixel verschwendest." Theorie-first. + +**Wette:** Wer bis 2028-2030 das produktionsreifere Weltmodell hat, das mehr ist als Video-Generation (echtes Planning, Reasoning, Counterfactuals), gewinnt die AGI-Weltmodell-Komponente. Hassabis spielt auf Sichtbarkeit (VEO-Demos); LeCun spielt auf Fundament (V-JEPA als Vor-Bedingung für alles weitere). + +## Strategische Konsequenzen für AGI + +| These | Vertreter | Konsequenz | +|-------|-----------|-----------| +| **Generative Weltmodelle = AGI-Weg** | Hassabis, DeepMind | Compute → Video-Generation → Weltmodell → AGI | +| **JEPA = notwendige Vorbedingung** | LeCun, Meta | Erst Repräsentationen lernen, dann generieren — wie Sprache vor Sprechen | +| **Hybrid** | (offen) | JEPA-Encoder → Planung → Generativer Decoder | + +**OpenAI/Anthropic:** Beide Labors verfolgen aktuell **keine explizite Weltmodell-Strategie**. Sie skalieren AR-LLMs weiter. Dies ist ein blinder Fleck im AR-Only-Wettlauf — und der Hauptgrund, warum DeepMind seine Compute-Allokation breiter streut. + +## Verwandte Wiki-Seiten + +- `[[../architecture/deepmind-beyond-transformer.md]]` — Strategischer Kontrast DeepMind vs. AR-Only-Labs +- `[[../concepts/llm/post-transformer-llm-architectures.md]]` — Vier-Säulen-Übersicht inkl. Weltmodell-Sektion +- `[[transformer-foundation.md]]` — Klassischer Transformer als Vergleichsbasis +- `[[../concepts/agi/aschenbrenner-situational-awareness.md]]` — AGI-Realismus: „OOMs zählen" + The Project + +## Externe Primärquellen + +- **V-JEPA Paper:** [arXiv:2404.08471](https://arxiv.org/abs/2404.08471) +- **V-JEPA Meta Blog:** https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/ +- **LeCun JEPA Framework:** https://openreview.net/pdf?id=BZ5a1r-kVsf +- **Yann LeCun Position Papers:** [Meta AI Research](https://ai.meta.com/research/) +- **Demis Hassabis Position (VEO/Weltmodell):** [Google DeepMind Blog](https://blog.google/technology/google-deepmind/google-gemini-updates/) +- **Pourya Kordi Video:** https://www.youtube.com/watch?v=8oyZB24-vAM \ No newline at end of file diff --git a/wiki/index.md b/wiki/index.md index 08701d8..af8aa67 100644 --- a/wiki/index.md +++ b/wiki/index.md @@ -2,7 +2,7 @@ *Auto-generated: 2026-06-18* -*Letzte Aktualisierung: 2026-06-18 (15. Update — Neue Konzeptseite `wiki/concepts/policy/ai-as-geopolitical-weapon.md` (Miles Deutscher "Weaponization of Intelligence" + Hector-Einordnung), `ai-regulation-2026.md` um Geopolitik-Cross-Link erweitert. Trigger: Pit Weber geteilter Thread im Krallenpolitik-Topic.)* +*Letzte Aktualisierung: 2026-06-18 (16. Update — Wikify-Cluster zum DeepMind-„Beyond Transformer"-Video (Pourya Kordi). Neue Architektur-Seiten `architecture/deepmind-beyond-transformer.md` (strategischer Kontrast zu OpenAI/Anthropic) + `architecture/transformer-foundation.md` (klassischer Stack + Quadratic-Attention-Limit). Neue Konzept-Seite `concepts/world-models-jepa-vs-generative.md` (Hassabis-vs-LeCun-Debatte). Bestehende `concepts/llm/post-transformer-llm-architectures.md` um Cross-Links und Schwester-Quelle (`youtube/2026-06-18_deepmind-beyond-transformer.md`, OME Topic 6 / aGi / eMergence) erweitert. Trigger: Pit Weber hat das Video erneut in OME Topic 6 (aGi / eMergence) mit ausführlicher deutscher Zusammenfassung geteilt.)* ## Architecture @@ -14,6 +14,8 @@ | [Model Routing](architecture/model-routing.md) | Two-Model-Pipeline, GPT-5.4 Config, Fallback-Chain, OpenClaw v2026.6.8 GLM-5.2 + Provider-Prefix-Normalisierung | context-tree + other/2026-06-16_openclaw-releases-v2026.6.8.md | | [Cron & System Events](architecture/cron-notable-events.md) | Historische Cron-Architektur, Disk-Krise, Execution Gap | context-tree | | [ByteRover Knowledge Mining](architecture/byterover-knowledge-mining.md) | Mining-Pipeline, Blockaden, Status | context-tree | +| [DeepMind Beyond Transformer](architecture/deepmind-beyond-transformer.md) | Strategischer Architektur-Kontrast: DeepMind (Diffusion + Hybride + Weltmodelle) vs. OpenAI/Anthropic (AR + Scaling). Vier Säulen, Gemma 4 Edge (256k), Gemini Diffusion 10× | youtube/2026-06-18_deepmind-beyond-transformer.md + youtube/2026-06-16_deepmind-two-steps-ahead.md | +| [Transformer Foundation](architecture/transformer-foundation.md) | Klassischer Transformer-Stack (Attention + AR + großes Pretraining), Quadratic-Attention-Limit, Skalierungsgrenzen, AR-Only-Gegenposition | youtube/2026-06-18_deepmind-beyond-transformer.md | ## Tools @@ -32,6 +34,11 @@ ## Concepts +### World Models +| Seite | Beschreibung | Quellen | +|-------|-------------|---------| +| [Weltmodelle: JEPA vs. Generativ](concepts/world-models-jepa-vs-generative.md) | Hassabis-vs-LeCun-Debatte strukturiert: Generative Weltmodelle (VEO, Pixel-Rekonstruktion, Compute-intensiv) vs. JEPA (V-JEPA, Embedding-Konsistenz, theoretisch effizienter, empirisch noch nicht an der Spitze). AGI-Weltmodell-Wette bis 2028-2030 | youtube/2026-06-18_deepmind-beyond-transformer.md + youtube/2026-06-16_deepmind-two-steps-ahead.md | + ### LLM | Seite | Beschreibung | Quellen | |-------|-------------|---------| @@ -131,5 +138,7 @@ | `raw/other/financialbot-topic-history-2026-02-01_2026-05-30.json` | other | FinancialBot-Topic Komplett-Export (66 Messages, OME-Gruppe, 2026-02-01→2026-05-30) | | `raw/xpost/2026-06-15_harrystebbings-20vc-aravind-srinivas.md` | xpost | 20VC mit Aravind Srinivas: 7 Thesen zu Agents, Export Controls, Orchestrierung, Token Value per Watt, Speed + Humility | | `raw/youtube/2026-06-16_everlast-mainzer-neuromorphe-chips-quantencomputer.md` | youtube | Prof. Mainzer (Everlast AI, 1:48:40, 2026-06-03): Neuromorphe Chips, Quantencomputer, Physical AI, 20W-Gehirn, geopolitische KI-Strategien | +| `raw/youtube/2026-06-16_deepmind-two-steps-ahead.md` | youtube | Pourya Kordi: DeepMind Was Two Steps Ahead, AGAIN! — Pit-Zusammenfassung in OME Topic 13 (#6645), Inhalt: Griffin/Recurrent-Gemma/Titans, Diffusions-LLMs (10×), Hassabis-vs-LeCun-Weltmodelle (JEPA vs. generativ), Strategie-Kontrast OpenAI/Anthropic | +| `raw/youtube/2026-06-18_deepmind-beyond-transformer.md` | youtube | Pourya Kordi: DeepMind Was Two Steps Ahead, AGAIN! — Pit-Zusammenfassung in OME Topic 6 / aGi / eMergence (18.06.2026), Schwester-Ingest zum 16.06-Cluster (anderes Topic, gleicher Video-Inhalt). Schwerpunkt: Architektur-Alternativen (Griffin/Recurrent-Gemma/Titans/Gemma 4 Edge 256k), Diffusions-LLMs, Hassabis-These VEO = Weltmodell, LeCun-Konter JEPA, DeepMind vs. AR-Only-Labs | | `raw/blog/2026-06-16_aschenbrenner-situational-awareness.md` | blog | Leopold Aschenbrenner (OpenAI Superalignment, Juni 2024): AGI bis 2027, Superintelligenz, The Project, vier Risiken, AGI-Realismus | | `raw/other/2026-06-16_openclaw-releases-v2026.6.8.md` | other | OpenClaw Releases v2026.6.6–v2026.6.8 — GitHub-API-Snapshot der Top 5 (16.06.2026): GLM-5.2 + Claude Haiku 4.5, Provider-Prefix-Norm, QMD-Stabilität, Security-Hardening | diff --git a/wiki/log.md b/wiki/log.md index 6be24dd..e140e5c 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -576,3 +576,26 @@ Die drei zusammen ergeben ein vollständiges Bild: Algorithmus × Hardware × AG - Sollen `wiki/teams/`-Inhalte physisch nach `people/` verschoben werden oder parallel existieren? Aktueller Plan: physisch migrieren mit Redirect-Stub-File (analog OKF-Move-Pattern), Ausnahme: Netbits-Avatar (User-Identität, nicht reale Person). - WMT-009 wird die User-Identitäten separat klassifizieren. **Lint-Vorab-Check:** Neuer Lint-Run wird die leeren Dirs als 0-File-Cluster markieren — kein Fail (Threshold 12/20). + +## [2026-06-18] Wikify: DeepMind „Beyond Transformer" — Strategischer Kontrast + JEPA-vs-Generativ-Debatte +**Type:** ingest | **Scope:** raw/youtube/2026-06-18_deepmind-beyond-transformer.md + 3 Wiki-Seiten +**Trigger:** Pit Weber hat Pourya Kordis Video „DeepMind Was Two Steps Ahead, AGAIN!" (https://www.youtube.com/watch?v=8oyZB24-vAM) erneut in OME Topic 6 (aGi / eMergence) mit ausführlicher deutscher Zusammenfassung geteilt. Inhaltlich deckungsgleich mit dem 16.06-Ingest aus Topic 13 (#6645), aber anderes Topic → eigene Raw-Datei + drei neue Wiki-Perspektiven. + +**Actions:** +- raw: `raw/youtube/2026-06-18_deepmind-beyond-transformer.md` (immutable, mit Pit-Header-Notiz + Transkript-Hinweis LOGIN_REQUIRED) +- wiki (NEU): `architecture/deepmind-beyond-transformer.md` — Strategischer Kontrast DeepMind (Diffusion + Hybride + Weltmodelle + Gemma 4 Edge 256k) vs. OpenAI/Anthropic (AR + Scaling) +- wiki (NEU): `concepts/world-models-jepa-vs-generative.md` — Hassabis-vs-LeCun-Debatte strukturiert: Generative Rekonstruktion (VEO, Compute-intensiv) vs. JEPA-Embeddings (V-JEPA, theoretisch effizienter, empirisch noch nicht an der Spitze). AGI-Weltmodell-Wette bis 2028-2030 +- wiki (NEU): `architecture/transformer-foundation.md` — Klassischer Transformer-Stack + Quadratic-Attention-Limit + Skalierungsgrenzen + AR-Only-Gegenposition (OpenAI/Anthropic-Argumente) +- wiki (UPDATE): `concepts/llm/post-transformer-llm-architectures.md` — Schwester-Quelle `youtube/2026-06-18_deepmind-beyond-transformer.md` ergänzt, drei Cross-Links auf die neuen Seiten +- wiki (UPDATE): `index.md` — Header auf 16. Update, zwei neue Architektur-Zeilen, eigene „World Models"-Concepts-Sektion, Raw-Sources-Eintrag +- log: this entry + +**Strategische Entscheidung:** +Die neue Pits Zusammenfassung ist thematisch deckungsgleich mit der 16.06-Version, aber in anderem Topic-Kontext (aGi / eMergence statt News). Statt nur die bestehende Seite zu erweitern, wurde der Inhalt in **drei neue Perspektiven** strukturiert, um Duplikation zu vermeiden und die Lesbarkeit zu verbessern: +1. Architektur-Strategie (DeepMind-Kontrast) +2. Konzept-Debatte (Hassabis vs. LeCun) +3. Basis-Voraussetzung (klassischer Transformer als Fundament) + +Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Übersicht bestehen und verlinkt jetzt auf die drei neuen Perspektiven. + +**Subagent-Modell:** openrouter/deepseek-v4-flash:cloud (wie angewiesen — zai/glm-5.1 Billing leer, openrouter-Fallback verwendet)