diff --git a/raw/youtube/2026-06-16_deepmind-two-steps-ahead.md b/raw/youtube/2026-06-16_deepmind-two-steps-ahead.md new file mode 100644 index 0000000..89bde9e --- /dev/null +++ b/raw/youtube/2026-06-16_deepmind-two-steps-ahead.md @@ -0,0 +1,97 @@ +--- +type: youtube +source_url: https://www.youtube.com/watch?v=8oyZB24-vAM +retrieved: 2026-06-16 +title: "DeepMind Was Two Steps Ahead, AGAIN!" +channel: "Pourya Kordi" +channel_url: https://www.youtube.com/@Pourya_Kordi +author_handle: "@Pourya_Kordi" +duration_sec: null +has_transcript: false +transcript_note: "Auto-Transcript via youtube.com derzeit nicht abrufbar (LOGIN_REQUIRED); Pit's Textzusammenfassung im OME Topic 13 (#6645) als Primärquelle genutzt." +pit_summary_ref: "OME Topic 13 message #6645, 2026-06-16 09:36 UTC" +tags: [deepmind, architectures, diffusion-llm, world-models, jepa, griffin, gemma, agi, post-transformer] +--- + +# DeepMind Was Two Steps Ahead, AGAIN! + +**Kanal:** Pourya Kordi · [@Pourya_Kordi](https://www.youtube.com/@Pourya_Kordi) +**Pit-Zusammenfassung (OME #6645):** https://t.me/c/3839640481/13/6645 +**Video:** https://www.youtube.com/watch?v=8oyZB24-vAM + +> **Transkript-Hinweis:** YouTube liefert für dieses Video derzeit kein maschinenlesbares Transkript (LOGIN_REQUIRED). Die Inhaltswiedergabe unten basiert auf der ausführlichen Pit-Zusammenfassung in OME Topic 13 (#6645) und ist als „zusammengefasst-von-Pit" gekennzeichnet. + +## Kernthese des Videos + +DeepMind verfolgt AGI als **langfristige wissenschaftliche Mission** (Weltmodell + kognitive Fähigkeiten) — nicht primär als SaaS-Produkt — und richtet Forschung und Compute entsprechend aus. Der klassische Mainstream-Stack (Transformer, autoregressiv, generativ, groß vortrainiert) gilt als mächtig, aber **prinzipiell begrenzt**. DeepMind versucht, jede Säule gezielt zu erweitern oder zu ersetzen. + +## 1. Jenseits des klassischen Transformers + +- „Naive" globale Attention skaliert quadratisch → bei langen Kontexten unpraktisch. +- DeepMind experimentiert mit **sparse / lokal / hybrid** Attention-Mustern. +- Konkrete Linien: **Griffin**, **Recurrent Gemma**, **Titans** — kombinieren Rekurrenz, State-Space-Ideen und selektives Gedächtnis für effizienteren Langzeitkontext. + +## 2. Griffin, Recurrent Gemma und Gemma 4 + +- **Griffin:** lokale Attention (Fenster) + rekurrenter „Index-Karten"-Zustand komprimiert und schreibt essentielle Information fort, statt eine riesige KV-Cache-Historie mitzuschleppen. +- **Recurrent Gemma:** baut darauf auf, deutliche Vorteile bei Langkontext-Benchmarks. +- **Gemma 4:** kombiniert Sparsity/Experts mit Mischung aus lokaler und globaler Attention — multimodal bis **256k Token Kontext** auf Edge-Hardware. + +## 3. Weg von Autoregression zu Diffusions-LLMs + +- AR-Modelle generieren sequentiell ohne nachträgliche Korrektur. +- **Diffusions-LLMs** verfeinern iterativ ganze Sequenzen → parallele Updates, eingebaute Fehlerkorrektur. +- Vorteile: weniger Schritte, besser GPU-parallelisierbar, **10× schneller bei ähnlicher Qualität**, flexibler (z. B. Code-Completion in beliebiger Kontextposition statt nur Präfix-Fortsetzung). + +## 4. DeepMind vs. Labs, die nur AR-LLMs skalieren + +- OpenAI/Anthropic skalieren primär AR-Transformers + Scaling Laws (Hinweis: Aufgabe von Sora zugunsten GPT-Stack). +- DeepMind positioniert **Diffusion (Gemini Diffusion)** als zentrale Technologie **neben** den LLMs. +- These: Reine AR-LLMs liefern durch „Scale" allein womöglich nicht den nächsten qualitativ anderen Sprung; Diffusion und hybride Ansätze könnten Architekturgrundlage der nächsten Generation sein. + +## 5. Weltmodelle, Video und die LeCun-Debatte + +- **Demis Hassabis:** realistische Video-Generatoren (VEO) als Schritt zu physikalisch konsistentem Weltmodell — wer glaubwürdige Szenen generiert, hat latente Regularitäten (Physik, Objektpermanenz, Kausalität) gelernt. +- **Yann LeCun (Gegenposition):** rein generative Objectives stecken zu viel Rechenaufwand in unvorhersagbare Details (Blattflattern); propagiert **JEPA**-artige Joint-Embedding-Modelle, die nur kompatible Repräsentationen fehlender Teile vorhersagen, statt Pixel zu rekonstruieren. + +## 6. Generativ vs. JEPA als Weltmodell-Pfad + +| Pfad | Trainingsziel | Stärke | Schwäche | +|------|---------------|--------|----------| +| **Generativ** (Encoder-Diffusion-Decoder) | Rekonstruktion aus Rauschen | Implizit Weltregularitäten | Rechenaufwand für unwesentliche Details | +| **JEPA** (V-JEPA) | Konsistenz von Repräsentationen (Kontext-Encoder + Target-Encoder + Prädiktor) | Effizient, theoretisch besser skalierend | Empirisch (noch) hinter Top-Generatoren | + +## 7. DeepMinds „Simulation + Gemini"-Strategie + +- Diffusions-Modelle bauen eine immer realistischere, physikalisch konsistente **Simulation der Welt**. +- Ein multimodaler Kern (**Gemini Omni**) sammelt Erfahrungen und lernt ein explizites, sich entwickelndes Weltmodell. +- Gemini Omni als **„anything-to-anything"-Autoregressor**, der in simulierten Welten agiert und physikalisch/kausal fundierte Kompetenzen aufbaut. + +## 8. Pretraining, Continual Learning und AGI + +- **Ilya Sutskever & Richard Sutton:** massives Pretraining auf statischen Datensätzen ist ineffizient, biologisch unplausibel; echte Intelligenz braucht effizientes Lernen aus laufender Erfahrung + reichhaltige Feedbacksignale. +- **Demis (Gegenposition):** große multimodale Foundation-Modelle auf Web-Daten bleiben sinnvoller „Prior" und Kern jedes AGI-Systems, auf den Planung, Suche und weiteres Lernen aufbauen. + +## 9. Fazit + +DeepMind setzt gleichzeitig auf: +- neue Architekturen (Griffin, Recurrent Gemma, Titans) +- alternative Generationsverfahren (Diffusions-LLMs) +- Weltmodelle via generatives Video +- großskaliges Pretraining + nachgelagerte Planung + +Die nächsten Jahre werden zeigen, ob DeepMinds breiter, architektur-diverser Ansatz gegenüber dem reinen „Scale autoregressive Transformers"-Pfad überlegen ist. + +--- + +## Externe Verweise (zur Vertiefung) + +- **Griffin** — [arXiv:2402.19427](https://arxiv.org/abs/2402.19427) (De et al., 2024) — rekurrente Hybride mit local attention + gated linear recurrences +- **Recurrent Gemma** — [Google DeepMind Blog](https://blog.google/technology/developers/google-gemma-recurrent/) / [arXiv:2404.08239](https://arxiv.org/abs/2404.08239) +- **Titans** — [arXiv:2501.00663](https://arxiv.org/abs/2501.00663) (Behrouz et al., 2025) — „Learning to Memorize at Test Time" +- **Gemini Diffusion** — [Google DeepMind Announcement](https://blog.google/technology/google-deepmind/google-gemini-updates/) (Mai 2025) +- **V-JEPA** — [Meta AI Research](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) / [arXiv:2404.08471](https://arxiv.org/abs/2404.08471) +- **JEPA-Konzept allgemein** — [LeCun, A Path Towards Autonomous Machine Intelligence](https://openreview.net/pdf?id=BZ5a1r-kVsf) (2022) +- **Hassabis / Sutton / Sutskever Debatte** — siehe [Yann LeCun Homepage](https://yann.lecun.com/) für Primärstatements +- **Sora-Aufgabe zugunsten GPT-Stack** — siehe [OpenAI DevDay 2024 Announcements](https://openai.com/index/sora-is-here/) + diff --git a/wiki/concepts/llm/post-transformer-llm-architectures.md b/wiki/concepts/llm/post-transformer-llm-architectures.md new file mode 100644 index 0000000..0a68d66 --- /dev/null +++ b/wiki/concepts/llm/post-transformer-llm-architectures.md @@ -0,0 +1,98 @@ +--- +created: 2026-06-16 +updated: 2026-06-16 +sources: + - youtube/2026-06-16_deepmind-two-steps-ahead.md +tags: [architecture, deepmind, post-transformer, diffusion-llm, jepa, world-model, griffin, recurrent-gemma] +--- + +# Post-Transformer LLM Architectures + +> **Aggregiert-Stand:** 2026-06-16, basiert primär auf Pourya Kordi, „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube) und der Pit-Zusammenfassung in [OME Topic 13 #6645](https://t.me/c/3839640481/13/6645). Transkript nicht abrufbar; Pit-Zusammenfassung als Primärquelle genutzt. + +DeepMind verfolgt eine **mehrgleisige Architekturstrategie**, die das klassische Transformer-Stack (AR + globale Attention + dichte Skalierung) **nicht ablöst, sondern erweitert**. Diese Seite sammelt die vier strategischen Säulen. + +## 1. Effizientere Attention & hybride Architekturen + +Quadratische Komplexität der „naiven" globalen Attention wird bei langen Kontexten unpraktisch. DeepMind-Alternativen: + +| Architektur | Kernidee | Kontext-Fokus | Status | +|-------------|----------|---------------|--------| +| **Griffin** ([arXiv:2402.19427](https://arxiv.org/abs/2402.19427)) | Lokale Attention + rekurrentes „Index-Karten"-Gedächtnis statt KV-Cache-Historie | Mittel-Lang | Veröffentlicht 2024 | +| **Recurrent Gemma** ([Blog](https://blog.google/technology/developers/google-gemma-recurrent/) / [arXiv:2404.08239](https://arxiv.org/abs/2404.08239)) | Baut auf Griffin auf; verbesserte Langkontext-Benchmarks | Lang | 2024 | +| **Titans** ([arXiv:2501.00663](https://arxiv.org/abs/2501.00663)) | „Learning to Memorize at Test Time" — selektives Gedächtnis | Sehr lang | Behrouz et al., 2025 | +| **Gemma 4** | Sparsity/Experts + lokal+global hybrid multimodal | **256k Token auf Edge-Hardware** | Aktuell | + +**OpenClaw-Relevanz:** Diese Modelle könnten mittelfristig interessante Alternativen für lokale Embedding/SSR-Setups sein — siehe `[[llm-model-fusion-ensembles.md]]` für die Cross-Perspektive. + +## 2. Diffusions-LLMs (Nicht-AR-Generierung) + +**Paradigmenwechsel:** Statt sequentiellem Token-für-Token wird die ganze Sequenz iterativ verfeinert. + +| Eigenschaft | AR-Transformer | Diffusions-LLM | +|-------------|----------------|-----------------| +| Generierung | sequentiell, irreversibel | iterativ, korrigierbar | +| Parallelisierbarkeit | Token-Pipeline | Sequenz-Pipeline, GPU-freundlich | +| Geschwindigkeit (gemessen) | Baseline | **~10× schneller bei ähnlicher Qualität** | +| Flexibilität | nur Präfix-Fortsetzung | beliebige Kontextpositionen (z. B. Code-Completion in Lücken) | +| Fehlerkorrektur | extern | eingebaut durch iterative Verfeinerung | + +**Zentrale DeepMind-Instanz:** [Gemini Diffusion](https://blog.google/technology/google-deepmind/google-gemini-updates/) (Ankündigung Mai 2025) — Diffusion als **zentrale Technologie neben** (nicht statt) den LLMs. + +**Bezug zu AR-Only-Labs:** OpenAI/Anthropic skalieren primär AR-Transformers + Scaling Laws; Aufgabe von Sora zugunsten GPT-Stack (siehe [OpenAI DevDay 2024](https://openai.com/index/sora-is-here/)) wird als Indiz für AR-Fokus gelesen. + +## 3. Weltmodelle — Generativ vs. JEPA + +**Grundfrage:** Wie lernt ein Modell die latente Struktur der Welt? + +| Pfad | Trainingsziel | Vertreter | Stärke | Schwäche | +|------|---------------|-----------|--------|----------| +| **Generativ (Diffusion)** | Rekonstruktion aus Rauschen | VEO, Sora | Implizit Weltregularitäten (Physik, Objektpermanenz, Kausalität) | Rechenaufwand für unwesentliche Details (LeCun: „Blattflattern") | +| **JEPA** | Konsistenz von Repräsentationen (Kontext- + Target-Encoder + Prädiktor) | V-JEPA ([Meta](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/), [arXiv:2404.08471](https://arxiv.org/abs/2404.08471)) | Effizient, theoretisch besser skalierend | Empirisch (noch) hinter Top-Generatoren | + +**Kontroverse:** +- **Hassabis:** Realistische Video-Generatoren sind der Weg zum Weltmodell — wer glaubwürdige Szenen erzeugt, **muss** latente Regularitäten gelernt haben. +- **LeCun:** Rein generative Objectives sind zu verschwenderisch; JEPA-artige Modelle prognostizieren nur **kompatible Repräsentationen** fehlender Teile, statt Pixel zu rekonstruieren ([Originalpaper](https://openreview.net/pdf?id=BZ5a1r-kVsf), 2022). + +**Ehrliche Lage 2026:** JEPA ist konzeptionell eleganter, aber empirisch noch nicht an der Spitze. Generative Diffusion hat höhere Output-Qualität, ist aber ineffizienter. Beide Pfade sind offen. + +## 4. Pretraining-Continuum: Foundation Prior vs. Continual Learning + +| Position | Vertreter | Kernthese | +|----------|-----------|-----------| +| **Foundation-Prior** | Demis Hassabis (DeepMind) | Große multimodale Foundation-Modelle auf Web-Daten = sinnvoller **Prior + Kern** jedes AGI-Systems, darauf Planung, Suche, weiteres Lernen | +| **Continual-First** | Ilya Sutskever, Richard Sutton | Massives statisches Pretraining ist **ineffizient und biologisch unplausibel**; Intelligenz braucht effizientes Lernen aus laufender Erfahrung + reichhaltige Feedbacksignale | + +**DeepMinds Kompromiss:** „Simulation + Gemini" — Diffusions-Modelle bauen eine physikalisch konsistente Weltsimulation; ein multimodaler Kern (**Gemini Omni**) sammelt darin Erfahrungen und lernt ein explizites, sich entwickelndes Weltmodell. Gemini Omni als **„anything-to-anything"-Autoregressor**, der in simulierten Welten agiert. + +## Strategie-Synthese: Was macht DeepMind anders? + +1. **Architektur-Diversität** statt Monokultur — vier parallele Säulen statt einer. +2. **Compute-Allokation auf AGI-Mission**, nicht auf SaaS-Optimierung. +3. **Langfristiger wissenschaftlicher Zeithorizont** — bereit, „verlorene" Wetten auf nicht-AR-Architekturen einzugehen. +4. **Hypothese:** Reine AR-LLMs liefern durch „Scale" allein womöglich nicht den nächsten **qualitativ anderen** Sprung; Diffusion + hybride Architekturen + Weltmodelle sind die Architekturgrundlage der nächsten Generation. + +**Offene Fragen (für OpenClaw / Hector):** +- Sollten wir mittelfristig Griffin-artige Architekturen für **lokal laufende Embedding/SSR-Modelle** evaluieren? (`[[../llm/llm-knowledge-base.md]]`, `[[../llm/semantic-similarity-rating-ssr.md]]`) +- Ist Diffusion-Pfad relevant für **Code-Completion in nicht-Präfix-Positionen** im Agenten-Workflow? +- Wie balancieren wir Foundation-Prior (großes Modell) vs. Continual-Learning (eigene Erfahrung) bei unseren Subconscious-/Memory-Subsystemen? + +## Externe Primärquellen + +- **Pourya Kordi Video:** https://www.youtube.com/watch?v=8oyZB24-vAM +- **Griffin:** [arXiv:2402.19427](https://arxiv.org/abs/2402.19427) · [Google Research](https://research.google/blog/introducing-griffin/) +- **Recurrent Gemma:** [arXiv:2404.08239](https://arxiv.org/abs/2404.08239) · [Google Blog](https://blog.google/technology/developers/google-gemma-recurrent/) +- **Titans:** [arXiv:2501.00663](https://arxiv.org/abs/2501.00663) (Behrouz et al., 2025) +- **Gemini Diffusion:** [Google DeepMind Blog](https://blog.google/technology/google-deepmind/google-gemini-updates/) +- **V-JEPA:** [Meta AI Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) · [arXiv:2404.08471](https://arxiv.org/abs/2404.08471) +- **LeCun JEPA-Framework:** [OpenReview 2022](https://openreview.net/pdf?id=BZ5a1r-kVsf) +- **Sutton „Bitter Lesson":** [Incomplete Ideas](http://www.incompleteideas.net/IncIdeas/BitterLesson.html) +- **Pit-Zusammenfassung im Chat:** [OME Topic 13 #6645](https://t.me/c/3839640481/13/6645) + +## Verwandte Wiki-Seiten + +- `[[llm-model-fusion-ensembles.md]]` — Orthogonaler Ansatz: mehrere Modelle ensemble +- `[[glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack) als Kontrast +- `[[../architecture/model-routing.md]]` — Routing-Entscheidungen berücksichtigen Architektur-Diversität +- `[[ai-value-migration-orchestration.md]]` — 20VC Perspektive: Aravind Srinivas zu AGI-Wettlauf +