--- type: youtube source_url: https://www.youtube.com/watch?v=8oyZB24-vAM retrieved: 2026-06-18 title: "DeepMind Was Two Steps Ahead, AGAIN!" channel: "Pourya Kordi" channel_url: https://www.youtube.com/@Pourya_Kordi author_handle: "@Pourya_Kordi" duration_sec: null has_transcript: false transcript_note: "Auto-Transcript via youtube.com nicht abrufbar (LOGIN_REQUIRED); Pits Textzusammenfassung in OME Topic 6 (aGi / eMergence) als Primärquelle genutzt." pit_summary_ref: "OME Topic 6 (aGi / eMergence), 2026-06-18 — Pit Weber" topic: "aGi / eMergence" tags: [deepmind, transformer, attention, diffusion, world-models, jepa, griffin, recurrent-gemma, gemma, agi, post-transformer, hassabis, lecun] --- # DeepMind Was Two Steps Ahead, AGAIN! **Pit Weber — 2026-06-18 — OME Topic 6 (aGi / eMergence)** **Kanal:** Pourya Kordi · [@Pourya_Kordi](https://www.youtube.com/@Pourya_Kordi) **Video:** https://www.youtube.com/watch?v=8oyZB24-vAM > **Hinweis:** YouTube liefert für dieses Video kein maschinenlesbares Transkript (LOGIN_REQUIRED). Diese Datei basiert auf Pits zweiter Zusammenfassung desselben Videos (Topic 6 / aGi / eMergence), zwei Tage nach der ersten Ingest-Welle (Topic 13 / News & Infos, 2026-06-16 → `raw/youtube/2026-06-16_deepmind-two-steps-ahead.md`). Inhaltlich deckungsgleich mit der 16.06-Zusammenfassung; strukturell hier nochmal als eigenständige Quelle geführt, weil sie in einem anderen Topic-Kontext (aGi / eMergence statt News) gepostet wurde. ## Kernthese DeepMind positioniert sich **jenseits des klassischen Transformer-Stacks** (autoregressive LLMs mit globaler Attention) und investiert systematisch in alternative Architekturen — als Fundament einer nächsten Generation, in der AR-Transformer + Scaling allein möglicherweise nicht den nächsten qualitativ anderen Sprung liefern. ## 1. Architektur-Alternativen jenseits globaler Attention Quadratische Komplexität der „naiven" globalen Attention wird bei langen Kontexten unpraktisch. DeepMind-Alternativen kombinieren **lokale Attention** mit **rekurrentem Zustand** für effizienten Langzeitkontext: - **Griffin** — lokale Attention (Fenster) + rekurrentes „Index-Karten"-Gedächtnis, das essentielle Information komprimiert fortschreibt, statt eine riesige KV-Cache-Historie mitzuschleppen. - **Recurrent Gemma** — baut auf Griffin auf; verbesserte Langkontext-Benchmarks. - **Titans** — „Learning to Memorize at Test Time"; selektives Gedächtnis für sehr lange Kontexte. ## 2. Gemma 4 Kombination aus **Sparsity/Experts** und **hybrider Attention** (lokal + global). Multimodalität bis **256k Token Kontext auf Edge-Hardware** — also auf Consumer-Geräten lauffähig, nicht nur in Rechenzentren. ## 3. Diffusions-LLMs Statt sequentieller Token-Generierung (klassische AR-Transformer) verfeinern Diffusions-LLMs **iterativ die ganze Sequenz**: - **~10× schneller** bei vergleichbarer Qualität (gemessen) - **Parallele Updates** statt Token-Pipeline → GPU-freundlich - **Eingebaute Fehlerkorrektur** durch iterative Verfeinerung - **Flexibler:** Code-Completion in beliebigen Kontextpositionen, nicht nur als Präfix-Fortsetzung - **DeepMind-Instanz:** Gemini Diffusion (Ankündigung Mai 2025) als zentrale Technologie **neben** (nicht statt) den AR-LLMs ## 4. Weltmodelle via Video-Generation **Demis Hassabis' These:** VEO-ähnliche Video-Generatoren, die glaubwürdige Szenen erzeugen, **müssen** latente Physik, Objektpermanenz und Kausalität gelernt haben — sonst könnten sie keine konsistenten Welten generieren. Realistische Generierung = impliziter Weltmodell-Test. ## 5. LeCun-Konter: JEPA > generative Objectives **Yann LeCun (Gegenposition):** Rein generative Objectives stecken zu viel Rechenaufwand in **unvorhersagbare Details** (berühmtes Beispiel: „Blattflattern" im Wind). JEPA-artige Joint-Embedding-Modelle prognostizieren stattdessen nur **kompatible Repräsentationen** fehlender Teile — keine Pixel-Rekonstruktion. Vertreter: **V-JEPA** (Meta AI Research). **Theoretisch effizienter**, **empirisch (noch) hinter** den Top-Generatoren — die Debatte ist offen. ## 6. Strategischer Kontrast DeepMind vs. AR-Only-Labs | Position | Labs | Kern-These | |----------|------|-----------| | **AR + Scaling** | OpenAI, Anthropic | Klassische Transformer + Skalierungsgesetze reichen; Compute ist der Engpass | | **Architektur-Diversität** | DeepMind | Reine AR-LLMs liefern womöglich nicht den nächsten Sprung; Diffusion + hybride Architekturen sind Fundament der nächsten Generation | **Hinweis:** Aufgabe von Sora zugunsten des GPT-Stacks (OpenAI DevDay 2024) wird als Indiz für AR-Fokus gelesen. DeepMind hält dagegen **Gemini Diffusion** als zentrale Säule. ## Offene Fragen - Sollten wir mittelfristig Griffin-artige Architekturen für **lokal laufende Embedding/SSR-Modelle** evaluieren? - Ist der Diffusions-Pfad relevant für **Code-Completion in nicht-Präfix-Positionen** im Agenten-Workflow? - Wie balancieren wir Foundation-Prior (großes vortrainiertes Modell) vs. Continual-Learning (eigene Erfahrung) bei unseren Subconscious-/Memory-Subsystemen? ## Externe Primärquellen - **Video (Original):** https://www.youtube.com/watch?v=8oyZB24-vAM - **Kanal:** https://www.youtube.com/@Pourya_Kordi - **Griffin:** [arXiv:2402.19427](https://arxiv.org/abs/2402.19427) · [Google Research](https://research.google/blog/introducing-griffin/) - **Recurrent Gemma:** [arXiv:2404.08239](https://arxiv.org/abs/2404.08239) · [Google Blog](https://blog.google/technology/developers/google-gemma-recurrent/) - **Titans:** [arXiv:2501.00663](https://arxiv.org/abs/2501.00663) - **Gemini Diffusion:** [Google DeepMind Blog](https://blog.google/technology/google-deepmind/google-gemini-updates/) - **V-JEPA:** [Meta AI Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) · [arXiv:2404.08471](https://arxiv.org/abs/2404.08471) - **LeCun JEPA-Framework:** [OpenReview 2022](https://openreview.net/pdf?id=BZ5a1r-kVsf) - **Schwester-Raw (2026-06-16):** `raw/youtube/2026-06-16_deepmind-two-steps-ahead.md` (Pit Topic 13, identisches Video, frühere Ingest-Welle)