knowledge-base/raw/youtube/2026-06-18_deepmind-beyond-transformer.md

86 lines
No EOL
6 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
type: youtube
source_url: https://www.youtube.com/watch?v=8oyZB24-vAM
retrieved: 2026-06-18
title: "DeepMind Was Two Steps Ahead, AGAIN!"
channel: "Pourya Kordi"
channel_url: https://www.youtube.com/@Pourya_Kordi
author_handle: "@Pourya_Kordi"
duration_sec: null
has_transcript: false
transcript_note: "Auto-Transcript via youtube.com nicht abrufbar (LOGIN_REQUIRED); Pits Textzusammenfassung in OME Topic 6 (aGi / eMergence) als Primärquelle genutzt."
pit_summary_ref: "OME Topic 6 (aGi / eMergence), 2026-06-18 — Pit Weber"
topic: "aGi / eMergence"
tags: [deepmind, transformer, attention, diffusion, world-models, jepa, griffin, recurrent-gemma, gemma, agi, post-transformer, hassabis, lecun]
---
# DeepMind Was Two Steps Ahead, AGAIN!
**Pit Weber — 2026-06-18 — OME Topic 6 (aGi / eMergence)**
**Kanal:** Pourya Kordi · [@Pourya_Kordi](https://www.youtube.com/@Pourya_Kordi)
**Video:** https://www.youtube.com/watch?v=8oyZB24-vAM
> **Hinweis:** YouTube liefert für dieses Video kein maschinenlesbares Transkript (LOGIN_REQUIRED). Diese Datei basiert auf Pits zweiter Zusammenfassung desselben Videos (Topic 6 / aGi / eMergence), zwei Tage nach der ersten Ingest-Welle (Topic 13 / News & Infos, 2026-06-16 → `raw/youtube/2026-06-16_deepmind-two-steps-ahead.md`). Inhaltlich deckungsgleich mit der 16.06-Zusammenfassung; strukturell hier nochmal als eigenständige Quelle geführt, weil sie in einem anderen Topic-Kontext (aGi / eMergence statt News) gepostet wurde.
## Kernthese
DeepMind positioniert sich **jenseits des klassischen Transformer-Stacks** (autoregressive LLMs mit globaler Attention) und investiert systematisch in alternative Architekturen — als Fundament einer nächsten Generation, in der AR-Transformer + Scaling allein möglicherweise nicht den nächsten qualitativ anderen Sprung liefern.
## 1. Architektur-Alternativen jenseits globaler Attention
Quadratische Komplexität der „naiven" globalen Attention wird bei langen Kontexten unpraktisch. DeepMind-Alternativen kombinieren **lokale Attention** mit **rekurrentem Zustand** für effizienten Langzeitkontext:
- **Griffin** — lokale Attention (Fenster) + rekurrentes „Index-Karten"-Gedächtnis, das essentielle Information komprimiert fortschreibt, statt eine riesige KV-Cache-Historie mitzuschleppen.
- **Recurrent Gemma** — baut auf Griffin auf; verbesserte Langkontext-Benchmarks.
- **Titans** — „Learning to Memorize at Test Time"; selektives Gedächtnis für sehr lange Kontexte.
## 2. Gemma 4
Kombination aus **Sparsity/Experts** und **hybrider Attention** (lokal + global). Multimodalität bis **256k Token Kontext auf Edge-Hardware** — also auf Consumer-Geräten lauffähig, nicht nur in Rechenzentren.
## 3. Diffusions-LLMs
Statt sequentieller Token-Generierung (klassische AR-Transformer) verfeinern Diffusions-LLMs **iterativ die ganze Sequenz**:
- **~10× schneller** bei vergleichbarer Qualität (gemessen)
- **Parallele Updates** statt Token-Pipeline → GPU-freundlich
- **Eingebaute Fehlerkorrektur** durch iterative Verfeinerung
- **Flexibler:** Code-Completion in beliebigen Kontextpositionen, nicht nur als Präfix-Fortsetzung
- **DeepMind-Instanz:** Gemini Diffusion (Ankündigung Mai 2025) als zentrale Technologie **neben** (nicht statt) den AR-LLMs
## 4. Weltmodelle via Video-Generation
**Demis Hassabis' These:** VEO-ähnliche Video-Generatoren, die glaubwürdige Szenen erzeugen, **müssen** latente Physik, Objektpermanenz und Kausalität gelernt haben — sonst könnten sie keine konsistenten Welten generieren. Realistische Generierung = impliziter Weltmodell-Test.
## 5. LeCun-Konter: JEPA > generative Objectives
**Yann LeCun (Gegenposition):** Rein generative Objectives stecken zu viel Rechenaufwand in **unvorhersagbare Details** (berühmtes Beispiel: „Blattflattern" im Wind). JEPA-artige Joint-Embedding-Modelle prognostizieren stattdessen nur **kompatible Repräsentationen** fehlender Teile — keine Pixel-Rekonstruktion. Vertreter: **V-JEPA** (Meta AI Research).
**Theoretisch effizienter**, **empirisch (noch) hinter** den Top-Generatoren — die Debatte ist offen.
## 6. Strategischer Kontrast DeepMind vs. AR-Only-Labs
| Position | Labs | Kern-These |
|----------|------|-----------|
| **AR + Scaling** | OpenAI, Anthropic | Klassische Transformer + Skalierungsgesetze reichen; Compute ist der Engpass |
| **Architektur-Diversität** | DeepMind | Reine AR-LLMs liefern womöglich nicht den nächsten Sprung; Diffusion + hybride Architekturen sind Fundament der nächsten Generation |
**Hinweis:** Aufgabe von Sora zugunsten des GPT-Stacks (OpenAI DevDay 2024) wird als Indiz für AR-Fokus gelesen. DeepMind hält dagegen **Gemini Diffusion** als zentrale Säule.
## Offene Fragen
- Sollten wir mittelfristig Griffin-artige Architekturen für **lokal laufende Embedding/SSR-Modelle** evaluieren?
- Ist der Diffusions-Pfad relevant für **Code-Completion in nicht-Präfix-Positionen** im Agenten-Workflow?
- Wie balancieren wir Foundation-Prior (großes vortrainiertes Modell) vs. Continual-Learning (eigene Erfahrung) bei unseren Subconscious-/Memory-Subsystemen?
## Externe Primärquellen
- **Video (Original):** https://www.youtube.com/watch?v=8oyZB24-vAM
- **Kanal:** https://www.youtube.com/@Pourya_Kordi
- **Griffin:** [arXiv:2402.19427](https://arxiv.org/abs/2402.19427) · [Google Research](https://research.google/blog/introducing-griffin/)
- **Recurrent Gemma:** [arXiv:2404.08239](https://arxiv.org/abs/2404.08239) · [Google Blog](https://blog.google/technology/developers/google-gemma-recurrent/)
- **Titans:** [arXiv:2501.00663](https://arxiv.org/abs/2501.00663)
- **Gemini Diffusion:** [Google DeepMind Blog](https://blog.google/technology/google-deepmind/google-gemini-updates/)
- **V-JEPA:** [Meta AI Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) · [arXiv:2404.08471](https://arxiv.org/abs/2404.08471)
- **LeCun JEPA-Framework:** [OpenReview 2022](https://openreview.net/pdf?id=BZ5a1r-kVsf)
- **Schwester-Raw (2026-06-16):** `raw/youtube/2026-06-16_deepmind-two-steps-ahead.md` (Pit Topic 13, identisches Video, frühere Ingest-Welle)