knowledge-base/raw/youtube/2026-06-16_deepmind-two-steps-ahead.md
Hector-Bot 68c359f968 ingest(youtube)+wiki(concepts/llm): DeepMind Two Steps Ahead — Griffin, Diffusion-LLMs, JEPA, Weltmodelle
Pit-Zusammenfassung in OME Topic 13 #6645 als Primärquelle (YouTube Transkript nicht abrufbar, LOGIN_REQUIRED).
Neue Wiki-Seite post-transformer-llm-architectures.md sammelt die vier strategischen Säulen
DeepMinds jenseits der AR-Mainstream-Skalierung.
2026-06-16 11:41:02 +02:00

97 lines
6.7 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
type: youtube
source_url: https://www.youtube.com/watch?v=8oyZB24-vAM
retrieved: 2026-06-16
title: "DeepMind Was Two Steps Ahead, AGAIN!"
channel: "Pourya Kordi"
channel_url: https://www.youtube.com/@Pourya_Kordi
author_handle: "@Pourya_Kordi"
duration_sec: null
has_transcript: false
transcript_note: "Auto-Transcript via youtube.com derzeit nicht abrufbar (LOGIN_REQUIRED); Pit's Textzusammenfassung im OME Topic 13 (#6645) als Primärquelle genutzt."
pit_summary_ref: "OME Topic 13 message #6645, 2026-06-16 09:36 UTC"
tags: [deepmind, architectures, diffusion-llm, world-models, jepa, griffin, gemma, agi, post-transformer]
---
# DeepMind Was Two Steps Ahead, AGAIN!
**Kanal:** Pourya Kordi · [@Pourya_Kordi](https://www.youtube.com/@Pourya_Kordi)
**Pit-Zusammenfassung (OME #6645):** https://t.me/c/3839640481/13/6645
**Video:** https://www.youtube.com/watch?v=8oyZB24-vAM
> **Transkript-Hinweis:** YouTube liefert für dieses Video derzeit kein maschinenlesbares Transkript (LOGIN_REQUIRED). Die Inhaltswiedergabe unten basiert auf der ausführlichen Pit-Zusammenfassung in OME Topic 13 (#6645) und ist als „zusammengefasst-von-Pit" gekennzeichnet.
## Kernthese des Videos
DeepMind verfolgt AGI als **langfristige wissenschaftliche Mission** (Weltmodell + kognitive Fähigkeiten) — nicht primär als SaaS-Produkt — und richtet Forschung und Compute entsprechend aus. Der klassische Mainstream-Stack (Transformer, autoregressiv, generativ, groß vortrainiert) gilt als mächtig, aber **prinzipiell begrenzt**. DeepMind versucht, jede Säule gezielt zu erweitern oder zu ersetzen.
## 1. Jenseits des klassischen Transformers
- „Naive" globale Attention skaliert quadratisch → bei langen Kontexten unpraktisch.
- DeepMind experimentiert mit **sparse / lokal / hybrid** Attention-Mustern.
- Konkrete Linien: **Griffin**, **Recurrent Gemma**, **Titans** — kombinieren Rekurrenz, State-Space-Ideen und selektives Gedächtnis für effizienteren Langzeitkontext.
## 2. Griffin, Recurrent Gemma und Gemma 4
- **Griffin:** lokale Attention (Fenster) + rekurrenter „Index-Karten"-Zustand komprimiert und schreibt essentielle Information fort, statt eine riesige KV-Cache-Historie mitzuschleppen.
- **Recurrent Gemma:** baut darauf auf, deutliche Vorteile bei Langkontext-Benchmarks.
- **Gemma 4:** kombiniert Sparsity/Experts mit Mischung aus lokaler und globaler Attention — multimodal bis **256k Token Kontext** auf Edge-Hardware.
## 3. Weg von Autoregression zu Diffusions-LLMs
- AR-Modelle generieren sequentiell ohne nachträgliche Korrektur.
- **Diffusions-LLMs** verfeinern iterativ ganze Sequenzen → parallele Updates, eingebaute Fehlerkorrektur.
- Vorteile: weniger Schritte, besser GPU-parallelisierbar, **10× schneller bei ähnlicher Qualität**, flexibler (z. B. Code-Completion in beliebiger Kontextposition statt nur Präfix-Fortsetzung).
## 4. DeepMind vs. Labs, die nur AR-LLMs skalieren
- OpenAI/Anthropic skalieren primär AR-Transformers + Scaling Laws (Hinweis: Aufgabe von Sora zugunsten GPT-Stack).
- DeepMind positioniert **Diffusion (Gemini Diffusion)** als zentrale Technologie **neben** den LLMs.
- These: Reine AR-LLMs liefern durch „Scale" allein womöglich nicht den nächsten qualitativ anderen Sprung; Diffusion und hybride Ansätze könnten Architekturgrundlage der nächsten Generation sein.
## 5. Weltmodelle, Video und die LeCun-Debatte
- **Demis Hassabis:** realistische Video-Generatoren (VEO) als Schritt zu physikalisch konsistentem Weltmodell — wer glaubwürdige Szenen generiert, hat latente Regularitäten (Physik, Objektpermanenz, Kausalität) gelernt.
- **Yann LeCun (Gegenposition):** rein generative Objectives stecken zu viel Rechenaufwand in unvorhersagbare Details (Blattflattern); propagiert **JEPA**-artige Joint-Embedding-Modelle, die nur kompatible Repräsentationen fehlender Teile vorhersagen, statt Pixel zu rekonstruieren.
## 6. Generativ vs. JEPA als Weltmodell-Pfad
| Pfad | Trainingsziel | Stärke | Schwäche |
|------|---------------|--------|----------|
| **Generativ** (Encoder-Diffusion-Decoder) | Rekonstruktion aus Rauschen | Implizit Weltregularitäten | Rechenaufwand für unwesentliche Details |
| **JEPA** (V-JEPA) | Konsistenz von Repräsentationen (Kontext-Encoder + Target-Encoder + Prädiktor) | Effizient, theoretisch besser skalierend | Empirisch (noch) hinter Top-Generatoren |
## 7. DeepMinds „Simulation + Gemini"-Strategie
- Diffusions-Modelle bauen eine immer realistischere, physikalisch konsistente **Simulation der Welt**.
- Ein multimodaler Kern (**Gemini Omni**) sammelt Erfahrungen und lernt ein explizites, sich entwickelndes Weltmodell.
- Gemini Omni als **„anything-to-anything"-Autoregressor**, der in simulierten Welten agiert und physikalisch/kausal fundierte Kompetenzen aufbaut.
## 8. Pretraining, Continual Learning und AGI
- **Ilya Sutskever & Richard Sutton:** massives Pretraining auf statischen Datensätzen ist ineffizient, biologisch unplausibel; echte Intelligenz braucht effizientes Lernen aus laufender Erfahrung + reichhaltige Feedbacksignale.
- **Demis (Gegenposition):** große multimodale Foundation-Modelle auf Web-Daten bleiben sinnvoller „Prior" und Kern jedes AGI-Systems, auf den Planung, Suche und weiteres Lernen aufbauen.
## 9. Fazit
DeepMind setzt gleichzeitig auf:
- neue Architekturen (Griffin, Recurrent Gemma, Titans)
- alternative Generationsverfahren (Diffusions-LLMs)
- Weltmodelle via generatives Video
- großskaliges Pretraining + nachgelagerte Planung
Die nächsten Jahre werden zeigen, ob DeepMinds breiter, architektur-diverser Ansatz gegenüber dem reinen „Scale autoregressive Transformers"-Pfad überlegen ist.
---
## Externe Verweise (zur Vertiefung)
- **Griffin** — [arXiv:2402.19427](https://arxiv.org/abs/2402.19427) (De et al., 2024) — rekurrente Hybride mit local attention + gated linear recurrences
- **Recurrent Gemma** — [Google DeepMind Blog](https://blog.google/technology/developers/google-gemma-recurrent/) / [arXiv:2404.08239](https://arxiv.org/abs/2404.08239)
- **Titans** — [arXiv:2501.00663](https://arxiv.org/abs/2501.00663) (Behrouz et al., 2025) — „Learning to Memorize at Test Time"
- **Gemini Diffusion** — [Google DeepMind Announcement](https://blog.google/technology/google-deepmind/google-gemini-updates/) (Mai 2025)
- **V-JEPA** — [Meta AI Research](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) / [arXiv:2404.08471](https://arxiv.org/abs/2404.08471)
- **JEPA-Konzept allgemein** — [LeCun, A Path Towards Autonomous Machine Intelligence](https://openreview.net/pdf?id=BZ5a1r-kVsf) (2022)
- **Hassabis / Sutton / Sutskever Debatte** — siehe [Yann LeCun Homepage](https://yann.lecun.com/) für Primärstatements
- **Sora-Aufgabe zugunsten GPT-Stack** — siehe [OpenAI DevDay 2024 Announcements](https://openai.com/index/sora-is-here/)