98 lines
6.7 KiB
Markdown
98 lines
6.7 KiB
Markdown
|
|
---
|
|||
|
|
type: youtube
|
|||
|
|
source_url: https://www.youtube.com/watch?v=8oyZB24-vAM
|
|||
|
|
retrieved: 2026-06-16
|
|||
|
|
title: "DeepMind Was Two Steps Ahead, AGAIN!"
|
|||
|
|
channel: "Pourya Kordi"
|
|||
|
|
channel_url: https://www.youtube.com/@Pourya_Kordi
|
|||
|
|
author_handle: "@Pourya_Kordi"
|
|||
|
|
duration_sec: null
|
|||
|
|
has_transcript: false
|
|||
|
|
transcript_note: "Auto-Transcript via youtube.com derzeit nicht abrufbar (LOGIN_REQUIRED); Pit's Textzusammenfassung im OME Topic 13 (#6645) als Primärquelle genutzt."
|
|||
|
|
pit_summary_ref: "OME Topic 13 message #6645, 2026-06-16 09:36 UTC"
|
|||
|
|
tags: [deepmind, architectures, diffusion-llm, world-models, jepa, griffin, gemma, agi, post-transformer]
|
|||
|
|
---
|
|||
|
|
|
|||
|
|
# DeepMind Was Two Steps Ahead, AGAIN!
|
|||
|
|
|
|||
|
|
**Kanal:** Pourya Kordi · [@Pourya_Kordi](https://www.youtube.com/@Pourya_Kordi)
|
|||
|
|
**Pit-Zusammenfassung (OME #6645):** https://t.me/c/3839640481/13/6645
|
|||
|
|
**Video:** https://www.youtube.com/watch?v=8oyZB24-vAM
|
|||
|
|
|
|||
|
|
> **Transkript-Hinweis:** YouTube liefert für dieses Video derzeit kein maschinenlesbares Transkript (LOGIN_REQUIRED). Die Inhaltswiedergabe unten basiert auf der ausführlichen Pit-Zusammenfassung in OME Topic 13 (#6645) und ist als „zusammengefasst-von-Pit" gekennzeichnet.
|
|||
|
|
|
|||
|
|
## Kernthese des Videos
|
|||
|
|
|
|||
|
|
DeepMind verfolgt AGI als **langfristige wissenschaftliche Mission** (Weltmodell + kognitive Fähigkeiten) — nicht primär als SaaS-Produkt — und richtet Forschung und Compute entsprechend aus. Der klassische Mainstream-Stack (Transformer, autoregressiv, generativ, groß vortrainiert) gilt als mächtig, aber **prinzipiell begrenzt**. DeepMind versucht, jede Säule gezielt zu erweitern oder zu ersetzen.
|
|||
|
|
|
|||
|
|
## 1. Jenseits des klassischen Transformers
|
|||
|
|
|
|||
|
|
- „Naive" globale Attention skaliert quadratisch → bei langen Kontexten unpraktisch.
|
|||
|
|
- DeepMind experimentiert mit **sparse / lokal / hybrid** Attention-Mustern.
|
|||
|
|
- Konkrete Linien: **Griffin**, **Recurrent Gemma**, **Titans** — kombinieren Rekurrenz, State-Space-Ideen und selektives Gedächtnis für effizienteren Langzeitkontext.
|
|||
|
|
|
|||
|
|
## 2. Griffin, Recurrent Gemma und Gemma 4
|
|||
|
|
|
|||
|
|
- **Griffin:** lokale Attention (Fenster) + rekurrenter „Index-Karten"-Zustand komprimiert und schreibt essentielle Information fort, statt eine riesige KV-Cache-Historie mitzuschleppen.
|
|||
|
|
- **Recurrent Gemma:** baut darauf auf, deutliche Vorteile bei Langkontext-Benchmarks.
|
|||
|
|
- **Gemma 4:** kombiniert Sparsity/Experts mit Mischung aus lokaler und globaler Attention — multimodal bis **256k Token Kontext** auf Edge-Hardware.
|
|||
|
|
|
|||
|
|
## 3. Weg von Autoregression zu Diffusions-LLMs
|
|||
|
|
|
|||
|
|
- AR-Modelle generieren sequentiell ohne nachträgliche Korrektur.
|
|||
|
|
- **Diffusions-LLMs** verfeinern iterativ ganze Sequenzen → parallele Updates, eingebaute Fehlerkorrektur.
|
|||
|
|
- Vorteile: weniger Schritte, besser GPU-parallelisierbar, **10× schneller bei ähnlicher Qualität**, flexibler (z. B. Code-Completion in beliebiger Kontextposition statt nur Präfix-Fortsetzung).
|
|||
|
|
|
|||
|
|
## 4. DeepMind vs. Labs, die nur AR-LLMs skalieren
|
|||
|
|
|
|||
|
|
- OpenAI/Anthropic skalieren primär AR-Transformers + Scaling Laws (Hinweis: Aufgabe von Sora zugunsten GPT-Stack).
|
|||
|
|
- DeepMind positioniert **Diffusion (Gemini Diffusion)** als zentrale Technologie **neben** den LLMs.
|
|||
|
|
- These: Reine AR-LLMs liefern durch „Scale" allein womöglich nicht den nächsten qualitativ anderen Sprung; Diffusion und hybride Ansätze könnten Architekturgrundlage der nächsten Generation sein.
|
|||
|
|
|
|||
|
|
## 5. Weltmodelle, Video und die LeCun-Debatte
|
|||
|
|
|
|||
|
|
- **Demis Hassabis:** realistische Video-Generatoren (VEO) als Schritt zu physikalisch konsistentem Weltmodell — wer glaubwürdige Szenen generiert, hat latente Regularitäten (Physik, Objektpermanenz, Kausalität) gelernt.
|
|||
|
|
- **Yann LeCun (Gegenposition):** rein generative Objectives stecken zu viel Rechenaufwand in unvorhersagbare Details (Blattflattern); propagiert **JEPA**-artige Joint-Embedding-Modelle, die nur kompatible Repräsentationen fehlender Teile vorhersagen, statt Pixel zu rekonstruieren.
|
|||
|
|
|
|||
|
|
## 6. Generativ vs. JEPA als Weltmodell-Pfad
|
|||
|
|
|
|||
|
|
| Pfad | Trainingsziel | Stärke | Schwäche |
|
|||
|
|
|------|---------------|--------|----------|
|
|||
|
|
| **Generativ** (Encoder-Diffusion-Decoder) | Rekonstruktion aus Rauschen | Implizit Weltregularitäten | Rechenaufwand für unwesentliche Details |
|
|||
|
|
| **JEPA** (V-JEPA) | Konsistenz von Repräsentationen (Kontext-Encoder + Target-Encoder + Prädiktor) | Effizient, theoretisch besser skalierend | Empirisch (noch) hinter Top-Generatoren |
|
|||
|
|
|
|||
|
|
## 7. DeepMinds „Simulation + Gemini"-Strategie
|
|||
|
|
|
|||
|
|
- Diffusions-Modelle bauen eine immer realistischere, physikalisch konsistente **Simulation der Welt**.
|
|||
|
|
- Ein multimodaler Kern (**Gemini Omni**) sammelt Erfahrungen und lernt ein explizites, sich entwickelndes Weltmodell.
|
|||
|
|
- Gemini Omni als **„anything-to-anything"-Autoregressor**, der in simulierten Welten agiert und physikalisch/kausal fundierte Kompetenzen aufbaut.
|
|||
|
|
|
|||
|
|
## 8. Pretraining, Continual Learning und AGI
|
|||
|
|
|
|||
|
|
- **Ilya Sutskever & Richard Sutton:** massives Pretraining auf statischen Datensätzen ist ineffizient, biologisch unplausibel; echte Intelligenz braucht effizientes Lernen aus laufender Erfahrung + reichhaltige Feedbacksignale.
|
|||
|
|
- **Demis (Gegenposition):** große multimodale Foundation-Modelle auf Web-Daten bleiben sinnvoller „Prior" und Kern jedes AGI-Systems, auf den Planung, Suche und weiteres Lernen aufbauen.
|
|||
|
|
|
|||
|
|
## 9. Fazit
|
|||
|
|
|
|||
|
|
DeepMind setzt gleichzeitig auf:
|
|||
|
|
- neue Architekturen (Griffin, Recurrent Gemma, Titans)
|
|||
|
|
- alternative Generationsverfahren (Diffusions-LLMs)
|
|||
|
|
- Weltmodelle via generatives Video
|
|||
|
|
- großskaliges Pretraining + nachgelagerte Planung
|
|||
|
|
|
|||
|
|
Die nächsten Jahre werden zeigen, ob DeepMinds breiter, architektur-diverser Ansatz gegenüber dem reinen „Scale autoregressive Transformers"-Pfad überlegen ist.
|
|||
|
|
|
|||
|
|
---
|
|||
|
|
|
|||
|
|
## Externe Verweise (zur Vertiefung)
|
|||
|
|
|
|||
|
|
- **Griffin** — [arXiv:2402.19427](https://arxiv.org/abs/2402.19427) (De et al., 2024) — rekurrente Hybride mit local attention + gated linear recurrences
|
|||
|
|
- **Recurrent Gemma** — [Google DeepMind Blog](https://blog.google/technology/developers/google-gemma-recurrent/) / [arXiv:2404.08239](https://arxiv.org/abs/2404.08239)
|
|||
|
|
- **Titans** — [arXiv:2501.00663](https://arxiv.org/abs/2501.00663) (Behrouz et al., 2025) — „Learning to Memorize at Test Time"
|
|||
|
|
- **Gemini Diffusion** — [Google DeepMind Announcement](https://blog.google/technology/google-deepmind/google-gemini-updates/) (Mai 2025)
|
|||
|
|
- **V-JEPA** — [Meta AI Research](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) / [arXiv:2404.08471](https://arxiv.org/abs/2404.08471)
|
|||
|
|
- **JEPA-Konzept allgemein** — [LeCun, A Path Towards Autonomous Machine Intelligence](https://openreview.net/pdf?id=BZ5a1r-kVsf) (2022)
|
|||
|
|
- **Hassabis / Sutton / Sutskever Debatte** — siehe [Yann LeCun Homepage](https://yann.lecun.com/) für Primärstatements
|
|||
|
|
- **Sora-Aufgabe zugunsten GPT-Stack** — siehe [OpenAI DevDay 2024 Announcements](https://openai.com/index/sora-is-here/)
|
|||
|
|
|