wikify(youtube): deepmind-beyond-transformer + jepa-vs-generative (2026-06-18)

This commit is contained in:
Hector 2026-06-18 22:23:57 +02:00
parent 8421be26c8
commit b484555f13
8 changed files with 428 additions and 9 deletions

View file

@ -0,0 +1,86 @@
---
type: youtube
source_url: https://www.youtube.com/watch?v=8oyZB24-vAM
retrieved: 2026-06-18
title: "DeepMind Was Two Steps Ahead, AGAIN!"
channel: "Pourya Kordi"
channel_url: https://www.youtube.com/@Pourya_Kordi
author_handle: "@Pourya_Kordi"
duration_sec: null
has_transcript: false
transcript_note: "Auto-Transcript via youtube.com nicht abrufbar (LOGIN_REQUIRED); Pits Textzusammenfassung in OME Topic 6 (aGi / eMergence) als Primärquelle genutzt."
pit_summary_ref: "OME Topic 6 (aGi / eMergence), 2026-06-18 — Pit Weber"
topic: "aGi / eMergence"
tags: [deepmind, transformer, attention, diffusion, world-models, jepa, griffin, recurrent-gemma, gemma, agi, post-transformer, hassabis, lecun]
---
# DeepMind Was Two Steps Ahead, AGAIN!
**Pit Weber — 2026-06-18 — OME Topic 6 (aGi / eMergence)**
**Kanal:** Pourya Kordi · [@Pourya_Kordi](https://www.youtube.com/@Pourya_Kordi)
**Video:** https://www.youtube.com/watch?v=8oyZB24-vAM
> **Hinweis:** YouTube liefert für dieses Video kein maschinenlesbares Transkript (LOGIN_REQUIRED). Diese Datei basiert auf Pits zweiter Zusammenfassung desselben Videos (Topic 6 / aGi / eMergence), zwei Tage nach der ersten Ingest-Welle (Topic 13 / News & Infos, 2026-06-16 → `raw/youtube/2026-06-16_deepmind-two-steps-ahead.md`). Inhaltlich deckungsgleich mit der 16.06-Zusammenfassung; strukturell hier nochmal als eigenständige Quelle geführt, weil sie in einem anderen Topic-Kontext (aGi / eMergence statt News) gepostet wurde.
## Kernthese
DeepMind positioniert sich **jenseits des klassischen Transformer-Stacks** (autoregressive LLMs mit globaler Attention) und investiert systematisch in alternative Architekturen — als Fundament einer nächsten Generation, in der AR-Transformer + Scaling allein möglicherweise nicht den nächsten qualitativ anderen Sprung liefern.
## 1. Architektur-Alternativen jenseits globaler Attention
Quadratische Komplexität der „naiven" globalen Attention wird bei langen Kontexten unpraktisch. DeepMind-Alternativen kombinieren **lokale Attention** mit **rekurrentem Zustand** für effizienten Langzeitkontext:
- **Griffin** — lokale Attention (Fenster) + rekurrentes „Index-Karten"-Gedächtnis, das essentielle Information komprimiert fortschreibt, statt eine riesige KV-Cache-Historie mitzuschleppen.
- **Recurrent Gemma** — baut auf Griffin auf; verbesserte Langkontext-Benchmarks.
- **Titans** — „Learning to Memorize at Test Time"; selektives Gedächtnis für sehr lange Kontexte.
## 2. Gemma 4
Kombination aus **Sparsity/Experts** und **hybrider Attention** (lokal + global). Multimodalität bis **256k Token Kontext auf Edge-Hardware** — also auf Consumer-Geräten lauffähig, nicht nur in Rechenzentren.
## 3. Diffusions-LLMs
Statt sequentieller Token-Generierung (klassische AR-Transformer) verfeinern Diffusions-LLMs **iterativ die ganze Sequenz**:
- **~10× schneller** bei vergleichbarer Qualität (gemessen)
- **Parallele Updates** statt Token-Pipeline → GPU-freundlich
- **Eingebaute Fehlerkorrektur** durch iterative Verfeinerung
- **Flexibler:** Code-Completion in beliebigen Kontextpositionen, nicht nur als Präfix-Fortsetzung
- **DeepMind-Instanz:** Gemini Diffusion (Ankündigung Mai 2025) als zentrale Technologie **neben** (nicht statt) den AR-LLMs
## 4. Weltmodelle via Video-Generation
**Demis Hassabis' These:** VEO-ähnliche Video-Generatoren, die glaubwürdige Szenen erzeugen, **müssen** latente Physik, Objektpermanenz und Kausalität gelernt haben — sonst könnten sie keine konsistenten Welten generieren. Realistische Generierung = impliziter Weltmodell-Test.
## 5. LeCun-Konter: JEPA > generative Objectives
**Yann LeCun (Gegenposition):** Rein generative Objectives stecken zu viel Rechenaufwand in **unvorhersagbare Details** (berühmtes Beispiel: „Blattflattern" im Wind). JEPA-artige Joint-Embedding-Modelle prognostizieren stattdessen nur **kompatible Repräsentationen** fehlender Teile — keine Pixel-Rekonstruktion. Vertreter: **V-JEPA** (Meta AI Research).
**Theoretisch effizienter**, **empirisch (noch) hinter** den Top-Generatoren — die Debatte ist offen.
## 6. Strategischer Kontrast DeepMind vs. AR-Only-Labs
| Position | Labs | Kern-These |
|----------|------|-----------|
| **AR + Scaling** | OpenAI, Anthropic | Klassische Transformer + Skalierungsgesetze reichen; Compute ist der Engpass |
| **Architektur-Diversität** | DeepMind | Reine AR-LLMs liefern womöglich nicht den nächsten Sprung; Diffusion + hybride Architekturen sind Fundament der nächsten Generation |
**Hinweis:** Aufgabe von Sora zugunsten des GPT-Stacks (OpenAI DevDay 2024) wird als Indiz für AR-Fokus gelesen. DeepMind hält dagegen **Gemini Diffusion** als zentrale Säule.
## Offene Fragen
- Sollten wir mittelfristig Griffin-artige Architekturen für **lokal laufende Embedding/SSR-Modelle** evaluieren?
- Ist der Diffusions-Pfad relevant für **Code-Completion in nicht-Präfix-Positionen** im Agenten-Workflow?
- Wie balancieren wir Foundation-Prior (großes vortrainiertes Modell) vs. Continual-Learning (eigene Erfahrung) bei unseren Subconscious-/Memory-Subsystemen?
## Externe Primärquellen
- **Video (Original):** https://www.youtube.com/watch?v=8oyZB24-vAM
- **Kanal:** https://www.youtube.com/@Pourya_Kordi
- **Griffin:** [arXiv:2402.19427](https://arxiv.org/abs/2402.19427) · [Google Research](https://research.google/blog/introducing-griffin/)
- **Recurrent Gemma:** [arXiv:2404.08239](https://arxiv.org/abs/2404.08239) · [Google Blog](https://blog.google/technology/developers/google-gemma-recurrent/)
- **Titans:** [arXiv:2501.00663](https://arxiv.org/abs/2501.00663)
- **Gemini Diffusion:** [Google DeepMind Blog](https://blog.google/technology/google-deepmind/google-gemini-updates/)
- **V-JEPA:** [Meta AI Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) · [arXiv:2404.08471](https://arxiv.org/abs/2404.08471)
- **LeCun JEPA-Framework:** [OpenReview 2022](https://openreview.net/pdf?id=BZ5a1r-kVsf)
- **Schwester-Raw (2026-06-16):** `raw/youtube/2026-06-16_deepmind-two-steps-ahead.md` (Pit Topic 13, identisches Video, frühere Ingest-Welle)

View file

@ -1,6 +1,6 @@
# Wiki Lint Report
*Generated: 2026-06-18 14:21:24 UTC*
*Generated: 2026-06-18 20:23:35 UTC*
*Repo: /home/node/workspace/knowledge-base*
*Script: scripts/wiki-lint.sh v1.0*
@ -9,7 +9,8 @@
| Dir | Files | Trigger |
|-----|-------|---------|
| wiki | 3 | ✅ |
| wiki/architecture | 6 | ✅ |
| wiki/architecture | 8 | ✅ |
| wiki/concepts | 1 | ✅ |
| wiki/concepts/agents | 6 | ✅ |
| wiki/concepts/agi | 1 | ✅ |
| wiki/concepts/directives | 3 | ✅ |
@ -25,7 +26,7 @@
_Schema v1.5 Sub-Categories: `concepts/hardware`, `concepts/agi`, `people/`, `institutions/` (alle in Counts oben enthalten)_
### Stub-Quote (<30 Zeilen)
✅ **4 / 52 (7%)**
✅ **4 / 55 (7%)**
Stub-Files:
- `wiki/ideas/2026-04-08_git-auto-commit.md (28 lines)`
@ -34,7 +35,7 @@ Stub-Files:
- `wiki/ideas/2026-06-06_plur1bus-priority-fix.md (29 lines)`
### Frontmatter Präsenz
✅ **49 / 52 present**
✅ **52 / 55 present**
### Broken Cross-References
✅ **0 broken**
@ -82,11 +83,11 @@ Stub-Files:
✅ **0 stale**
### Uncovered Raw Sources
✅ **26 raw, all covered**
✅ **27 raw, all covered**
## Summary
- Total Wiki-Pages: 52
- Total Wiki-Pages: 55
- Issues: 0
→ Wiki is clean. No subagent spawn needed.

View file

@ -0,0 +1,89 @@
---
created: 2026-06-18
updated: 2026-06-18
sources:
- youtube/2026-06-18_deepmind-beyond-transformer.md
- youtube/2026-06-16_deepmind-two-steps-ahead.md
tags: [architecture, deepmind, post-transformer, diffusion-llm, griffin, recurrent-gemma, titans, gemma, gemini, agi]
---
# DeepMind Beyond Transformer — Strategischer Architektur-Kontrast
> **Aggregiert-Stand:** 2026-06-18. Primärquellen: Pourya Kordi, „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube, https://www.youtube.com/watch?v=8oyZB24-vAM) — Pit-Zusammenfassung in OME Topic 6 (aGi / eMergence) am 2026-06-18. YouTube-Transkript nicht abrufbar (LOGIN_REQUIRED). Schwester-Ingest vom 2026-06-16 (Topic 13) liegt unter `raw/youtube/2026-06-16_deepmind-two-steps-ahead.md` und wird hier inhaltlich mit zitiert.
Diese Seite rückt den **strategischen Kontrast** zwischen DeepMinds Architektur-Diversität und der AR-Only-Strategie von OpenAI/Anthropic in den Mittelpunkt. Technische Details zu den einzelnen Architekturen sind auf der Schwester-Seite `[[../concepts/llm/post-transformer-llm-architectures.md]]` (Vier-Säulen-Übersicht) und der Konzept-Seite `[[../concepts/world-models-jepa-vs-generative.md]]` (Hassabis-vs-LeCun-Debatte) ausführlich dokumentiert.
## Kernthese: Architektur-Diversität statt Monokultur
DeepMind verfolgt **vier parallele Säulen**, statt die gesamte Compute-Allokation auf AR-Transformer-Skalierung zu setzen:
| Säule | Wettlauf-Anteil | Schlüsselmodelle | OpenClaw-Relevanz |
|-------|----------------|------------------|-------------------|
| **Hybride Attention / Recurrence** | Mittel-Lang-Kontext auf Edge | Griffin, Recurrent Gemma, Titans | Lokal laufende Embeddings/SSR |
| **Diffusions-LLMs** | Schnelle, parallele Generierung | Gemini Diffusion | Code-Completion in beliebigen Positionen |
| **Multimodale Edge-Modelle** | On-Device-Deployment | Gemma 4 (Sparsity+hybride Attention, 256k Kontext) | Self-Hosted Sovereignty |
| **Weltmodelle** | AGI-Wegbereitung | VEO + Hassabis-These | siehe Konzept-Seite |
## Strategischer Kontrast: DeepMind vs. AR-Only-Labs
| | OpenAI / Anthropic | DeepMind |
|---|-------------------|----------|
| **Primär-Stack** | AR-Transformer + Skalierung | AR + Diffusion + Hybride + Weltmodelle |
| **Skalierungs-Hebel** | Compute (Chinchilla, Scaling Laws) | Compute **und** Architektur-Innovation |
| **Indiz für Position** | Aufgabe von Sora zugunsten GPT-Stack (OpenAI DevDay 2024) | Gemini Diffusion als zentrale Säule (Mai 2025) |
| **Wettlauf-Strategie** | „Wir skalieren besser als die anderen" | „Wir skalieren ANDERS — mit Architektur-Mix" |
| **Risiko** | AR-Hitze-Dead-End (Skalierungsgesetze flachen ab) | AR-Beiwerk wird verworfen, falsche Säule gewinnt |
| **Compute-Allokation** | SaaS-Produkt-Optimierung | AGI-Mission |
**Pit-Zusammenfassung (2026-06-18):** „OpenAI/Anthropic setzen auf AR-Transformer + Scaling; DeepMind setzt auf Diffusion + hybride Architekturen als Fundament der nächsten Generation."
## Was macht DeepMind anders? — Vier strategische Prinzipien
1. **Architektur-Diversität statt Monokultur** — vier parallele Säulen statt einer vertikalen Skalierungspiste.
2. **Compute-Allokation auf AGI-Mission**, nicht auf SaaS-Optimierung.
3. **Langfristiger wissenschaftlicher Zeithorizont** — bereit, „verlorene" Wetten auf nicht-AR-Architekturen einzugehen.
4. **Hypothese:** Reine AR-LLMs liefern durch „Scale" allein womöglich nicht den nächsten **qualitativ anderen** Sprung; Diffusion + hybride Architekturen + Weltmodelle sind die Architekturgrundlage der nächsten Generation.
## Detail-Säulen mit Architektur-Referenzen
### 1. Hybride Attention / Recurrence (Griffin / Recurrent Gemma / Titans)
Quadratische Komplexität globaler Attention → bei langen Kontexten unpraktisch. DeepMind-Alternativen kombinieren lokale Attention mit rekurrentem Zustand. Detail-Beschreibungen und externe arXiv-Links siehe `[[../concepts/llm/post-transformer-llm-architectures.md#1-effizientere-attention--hybride-architekturen]]`.
### 2. Gemma 4 — Edge-Multimodalität
- Sparsity/Experts + hybrid (lokal + global) Attention
- Multimodal
- **256k Token Kontext auf Edge-Hardware** — d. h. auf Consumer-Geräten lauffähig
- **OpenClaw-Relevanz:** Self-Hosted Sovereignty, Datenschutz, Latenz-Reduktion
### 3. Diffusions-LLMs (Gemini Diffusion)
Statt sequentieller AR-Generierung → iterative Verfeinerung der ganzen Sequenz. Pit-Zusammenfassung nennt konkret **~10× schneller bei vergleichbarer Qualität**, parallele Updates, GPU-freundlich, eingebaute Fehlerkorrektur, und **Code-Completion in beliebigen Kontextpositionen** (statt nur Präfix-Fortsetzung). Detail-Tabellen siehe `[[../concepts/llm/post-transformer-llm-architectures.md#2-diffusions-llms-nicht-ar-generierung]]`.
### 4. Weltmodelle — Hassabis-vs-LeCun-Debatte
Wird auf eigener Konzept-Seite `[[../concepts/world-models-jepa-vs-generative.md]]` strukturiert.
## Externe Primärquellen
- **Video:** https://www.youtube.com/watch?v=8oyZB24-vAM (Pourya Kordi)
- **Pit Topic 6:** OME Topic 6 (aGi / eMergence), 2026-06-18
- **Pit Topic 13:** OME Topic 13 #6645, 2026-06-16 (Schwester-Ingest)
- **Griffin:** [arXiv:2402.19427](https://arxiv.org/abs/2402.19427)
- **Recurrent Gemma:** [arXiv:2404.08239](https://arxiv.org/abs/2404.08239) · [Google Blog](https://blog.google/technology/developers/google-gemma-recurrent/)
- **Titans:** [arXiv:2501.00663](https://arxiv.org/abs/2501.00663)
- **Gemini Diffusion:** [Google DeepMind Blog](https://blog.google/technology/google-deepmind/google-gemini-updates/)
- **V-JEPA:** [Meta AI Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) · [arXiv:2404.08471](https://arxiv.org/abs/2404.08471)
- **LeCun JEPA-Framework:** [OpenReview 2022](https://openreview.net/pdf?id=BZ5a1r-kVsf)
- **OpenAI DevDay 2024 (Sora-Kontext):** [OpenAI](https://openai.com/index/sora-is-here/)
## Verwandte Wiki-Seiten
- `[[../concepts/llm/post-transformer-llm-architectures.md]]` — Vier-Säulen-Übersicht mit Architektur-Details
- `[[../concepts/world-models-jepa-vs-generative.md]]` — Hassabis-vs-LeCun-Debatte als eigenständiges Konzept
- `[[transformer-foundation.md]]` — Klassischer Transformer-Stack + Quadratic-Attention-Limit (Voraussetzung)
- `[[model-routing.md]]` — Routing-Entscheidungen sollten Architektur-Diversität berücksichtigen
- `[[../concepts/llm/llm-model-fusion-ensembles.md]]` — Orthogonaler Ansatz (mehrere Modelle ensemble)
- `[[../concepts/llm/glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack) als Kontrast
- `[[../concepts/llm/ai-value-migration-orchestration.md]]` — Aravind Srinivas (20VC) zu AGI-Wettlauf

View file

@ -0,0 +1,91 @@
---
created: 2026-06-18
updated: 2026-06-18
sources:
- youtube/2026-06-18_deepmind-beyond-transformer.md
tags: [architecture, transformer, attention, scaling, foundation, post-transformer]
---
# Transformer Foundation — Klassischer Stack und seine Grenzen
> **Stand:** 2026-06-18. Hintergrund: Pit-Zusammenfassung in OME Topic 6 (aGi / eMergence), 2026-06-18, Pourya Kordi „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube).
Diese Seite beschreibt den **klassischen Transformer-Stack**, seine Kernidee und seine **fundamentalen Skalierungs-Limits** — als Voraussetzung für das Verständnis der Alternativen auf `[[deepmind-beyond-transformer.md]]` und `[[../concepts/llm/post-transformer-llm-architectures.md]]`.
## Der klassische Transformer-Stack
Der „klassische" moderne LLM-Stack, wie er seit 2017 ([Vaswani et al., „Attention Is All You Need"](https://arxiv.org/abs/1706.03762)) in OpenAI/Anthropic-Frontier-Modellen eingesetzt wird, besteht aus drei Säulen:
| Säule | Beschreibung | Hauptvertreter |
|-------|--------------|----------------|
| **Globale Self-Attention** | Jedes Token sieht jedes andere Token in der Sequenz (volle Aufmerksamkeitsmatrix) | Alle GPT-, Claude-, Gemini-AR-Modelle |
| **Autoregressive (AR) Generierung** | Token-für-Token sequentiell, irreversibel, ohne nachträgliche Korrektur | GPT-5.x, Claude Opus 4.x, Gemini 3.x |
| **Großes statisches Pretraining** | Web-Scale-Daten, eine Trainingsphase, danach gefroren oder leicht fine-tuned | Chinchilla-Scaling-Laws |
**Erfolgsgeschichte:** Dieser Stack hat seit 2018 GPT-2 → GPT-3 → GPT-4 → GPT-5x, BERT → RoBERTa, T5 → PaLM → Gemini, LLaMA → LLaMA 3/4, Claude 1 → 4 hervorgebracht. Alle Frontier-Modelle 2026 basieren auf dieser Architektur.
## Das Quadratic-Attention-Problem
**Kernproblem:** Globale Self-Attention skaliert **quadratisch** mit der Sequenzlänge.
```
Aufmerksamkeitsmatrix = N × N
wobei N = Sequenzlänge in Tokens
```
**Konsequenzen:**
- **8k Token Kontext:** 64 Millionen Attention-Einträge pro Layer
- **128k Token Kontext:** 16 Milliarden Attention-Einträge pro Layer
- **1M Token Kontext:** 1 Billion Attention-Einträge pro Layer — praktisch nicht mehr trainierbar
**Pit-Zusammenfassung (2026-06-18):** „Quadratische Komplexität der naiven' globalen Attention wird bei langen Kontexten unpraktisch."
**Standard-Milderungen (alle mit Trade-offs):**
- **Flash Attention** — Speicher-effizienter Algorithmus, ändert nichts an asymptotischer Komplexität
- **Sliding Window Attention** (z. B. Mistral) — jedes Token sieht nur einen lokalen Kontext
- **Sparse Attention Patterns** — BigBird, Longformer, ETC. — vordefinierte Sparsity-Patterns
- **KV-Cache-Komprimierung** — zur Laufzeit, nicht beim Training
**DeepMinds radikalerer Ansatz:** Attention komplett durch **rekurrente Zustände** ergänzen oder ersetzen (Griffin, Recurrent Gemma, Titans — siehe `[[../concepts/llm/post-transformer-llm-architectures.md]]`).
## Skalierungs-Limits
Pit-Zusammenfassung (2026-06-18): „Reine AR-LLMs liefern durch Scale' allein womöglich nicht den nächsten qualitativ anderen Sprung."
**Empirische Hinweise für nachlassende Skalierungsrenditen:**
- **Chinchilla-Optimal** wurde 2022 erreicht; danach lineares Scaling statt super-linear
- **Compute-Budget 2025/26:** ~10²⁵ FLOPs für Frontier-Trainings; weitere OOMs werden teurer (Energie, Chip-Engpässe)
- **Datenmauer:** Hochwertige Textdaten nähern sich der Erschöpfung; Multimodal-Daten sind die nächste Reserve, aber Tokenisierung ist teurer
- **Pre-Training-Plateau:** GPT-5.x und Claude 4.x zeigen kleinere Sprünge zwischen Generationen als GPT-3 → GPT-4
**Konsequenz:** Das „mehr vom Gleichen"-Spiel stößt an harte Grenzen. Architektur-Innovation wird zum primären Hebel — siehe `[[deepmind-beyond-transformer.md]]` für DeepMinds Strategie.
## Alternative: AR + Skalierung reicht — die Gegenposition
OpenAI und Anthropic halten an AR + Scaling fest. Ihre Argumente:
| Argument | Quelle |
|----------|--------|
| Skalierungsgesetze gelten weiter, nur langsamer | Chinchilla-Erweiterungen |
| RLHF / Constitutional AI / „Reasoning"-Modi sind orthogonal zu Architektur | OpenAI o1/o3, Claude Extended Thinking |
| Tool-Use und Agent-Loops kompensieren Modell-Schwächen | OpenAI Function Calling, Anthropic MCP |
| Multimodale Erweiterung (Vision, Audio) als nächste Skalierungs-Achse | GPT-5 Vision, Claude 4 Multimodal |
**Hectors Einordnung:** Beide Lager haben rationale Argumente. DeepMind wettet stärker auf Architektur-Diversität; OpenAI/Anthropic auf Compute-Skalierung + Training-Methodik. Empirischer Sieger ist offen — wahrscheinlich Hybrid aus beidem (siehe `[[../concepts/world-models-jepa-vs-generative.md#strategische-konsequenzen-für-agi]]`).
## Verwandte Wiki-Seiten
- `[[deepmind-beyond-transformer.md]]` — DeepMinds Architektur-Diversität als Antwort
- `[[../concepts/llm/post-transformer-llm-architectures.md]]` — Vier-Säulen-Übersicht (Griffin, Diffusion, JEPA, Foundation-Prior)
- `[[../concepts/world-models-jepa-vs-generative.md]]` — Hassabis-vs-LeCun-Debatte
- `[[model-routing.md]]` — Wie wir in OpenClaw heute mit Architektur-Diversität umgehen
- `[[../concepts/llm/glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack)
- `[[../concepts/llm/ai-value-migration-orchestration.md]]` — Wertverschiebung zu Compute + Strom
## Externe Primärquellen
- **Vaswani et al., „Attention Is All You Need":** [arXiv:1706.03762](https://arxiv.org/abs/1706.03762) (Originalpaper)
- **Chinchilla Scaling Laws:** [arXiv:2203.15556](https://arxiv.org/abs/2203.15556) (Hoffmann et al., DeepMind 2022)
- **Flash Attention:** [arXiv:2205.14135](https://arxiv.org/abs/2205.14135) (Dao et al.)
- **Longformer:** [arXiv:2004.05150](https://arxiv.org/abs/2004.05150)
- **Pit-Zusammenfassung (OME Topic 6):** 2026-06-18, Pourya Kordi „DeepMind Was Two Steps Ahead, AGAIN!" (https://www.youtube.com/watch?v=8oyZB24-vAM)

View file

@ -1,14 +1,20 @@
---
created: 2026-06-16
updated: 2026-06-16
updated: 2026-06-18
sources:
- youtube/2026-06-16_deepmind-two-steps-ahead.md
- youtube/2026-06-18_deepmind-beyond-transformer.md
tags: [architecture, deepmind, post-transformer, diffusion-llm, jepa, world-model, griffin, recurrent-gemma]
---
# Post-Transformer LLM Architectures
> **Aggregiert-Stand:** 2026-06-16, basiert primär auf Pourya Kordi, „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube) und der Pit-Zusammenfassung in [OME Topic 13 #6645](https://t.me/c/3839640481/13/6645). Transkript nicht abrufbar; Pit-Zusammenfassung als Primärquelle genutzt.
> **Aggregiert-Stand:** 2026-06-16, erweitert 2026-06-18. Primärquellen: Pourya Kordi, „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube), Pit-Zusammenfassungen in [OME Topic 13 #6645](https://t.me/c/3839640481/13/6645) (16.06) und OME Topic 6 / aGi / eMergence (18.06). Transkript nicht abrufbar; Pit-Zusammenfassungen als Primärquelle.
>
> **Schwester-Seiten:**
> - Strategischer Kontrast DeepMind vs. AR-Only-Labs: `[[../../architecture/deepmind-beyond-transformer.md]]`
> - Hassabis-vs-LeCun-Weltmodell-Debatte: `[[../world-models-jepa-vs-generative.md]]`
> - Klassischer Transformer als Basis: `[[../../architecture/transformer-foundation.md]]`
DeepMind verfolgt eine **mehrgleisige Architekturstrategie**, die das klassische Transformer-Stack (AR + globale Attention + dichte Skalierung) **nicht ablöst, sondern erweitert**. Diese Seite sammelt die vier strategischen Säulen.
@ -93,6 +99,9 @@ Quadratische Komplexität der „naiven" globalen Attention wird bei langen Kont
- `[[llm-model-fusion-ensembles.md]]` — Orthogonaler Ansatz: mehrere Modelle ensemble
- `[[glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack) als Kontrast
- `[[../world-models-jepa-vs-generative.md]]` — Hassabis-vs-LeCun-Debatte (eigenständige Konzept-Seite, 18.06.2026)
- `[[../../architecture/deepmind-beyond-transformer.md]]` — Strategischer Kontrast DeepMind vs. AR-Only-Labs
- `[[../../architecture/transformer-foundation.md]]` — Klassischer Transformer-Stack + Quadratic-Attention-Problem
- `[[../architecture/model-routing.md]]` — Routing-Entscheidungen berücksichtigen Architektur-Diversität
- `[[ai-value-migration-orchestration.md]]` — 20VC Perspektive: Aravind Srinivas zu AGI-Wettlauf

View file

@ -0,0 +1,111 @@
---
created: 2026-06-18
updated: 2026-06-18
sources:
- youtube/2026-06-18_deepmind-beyond-transformer.md
- youtube/2026-06-16_deepmind-two-steps-ahead.md
tags: [concept, world-models, jepa, hassabis, lecun, generative, video-generation, v-jepa, veo, agi, deepmind, meta]
---
# Weltmodelle: JEPA vs. Generativ — Die Hassabis-LeCun-Debatte
> **Stand:** 2026-06-18. Quellen: Pourya Kordi Video „DeepMind Was Two Steps Ahead, AGAIN!" (Pit-Zusammenfassung in OME Topic 6 / aGi / eMergence, 2026-06-18) und Schwester-Ingest vom 2026-06-16 (Topic 13). YouTube-Transkript nicht abrufbar (LOGIN_REQUIRED).
Diese Konzept-Seite strukturiert die **theoretische und strategische Debatte** zwischen zwei fundamental verschiedenen Wegen zu einem Weltmodell: **generative Rekonstruktion** (Hassabis) vs. **Joint-Embedding-Prediction** (LeCun). Die Seite ist konzeptuell fokussiert — die breitere DeepMind-Architektur-Strategie liegt auf `[[../architecture/deepmind-beyond-transformer.md]]`, die technischen Säulen auf `[[../concepts/llm/post-transformer-llm-architectures.md]]`.
## Grundfrage
> Wie lernt ein Modell die latente Struktur der Welt — Physik, Objektpermanenz, Kausalität, räumliche/zeitliche Konsistenz?
Zwei Antworten, zwei Lager, zwei verschiedene Trainingsziele.
## Pfad A: Generative Weltmodelle (Hassabis-Lager)
**Demis Hassabis (DeepMind):** Realistische Video-Generatoren wie VEO sind nicht nur „schöne Pixel". Wer glaubwürdige Szenen erzeugt, **muss** latente Regularitäten gelernt haben — sonst wären die Szenen physikalisch inkonsistent.
**Trainingsziel:** Rekonstruktion aus Rauschen (Diffusion).
**Vertreter:**
- **VEO** (Google DeepMind) — Video-Generation auf Weltmodell-Niveau
- **Sora** (OpenAI) — Vergleichsfall; wurde laut Pit zugunsten des GPT-Stacks zurückgefahren (OpenAI DevDay 2024)
- **Gemini Diffusion** — Text-Diffusion als Schwester-Pfad
**Stärken:**
- Implizit Weltregularitäten (Physik, Objektpermanenz, Kausalität)
- Output-Qualität ist sichtbar — generierte Videos „beweisen" das Modell
- Direkter Weg zu Anwendungen (VEO ist Produkt-fähig)
**Schwächen:**
- **Compute-Verschwendung** für unwesentliche Details (LeCuns Hauptkritik: „Blattflattern im Wind")
- Latente Repräsentation ist implizit — schwer zu interpretieren oder gezielt zu nutzen
- Skaliert möglicherweise ineffizient — je realistischer das Pixel-Output, desto mehr Bits für unvorhersagbares Rauschen
## Pfad B: JEPA — Joint Embedding Predictive Architecture (LeCun-Lager)
**Yann LeCun (Meta):** Rein generative Objectives sind fundamental verschwenderisch. Statt Pixel zu rekonstruieren, sollen Modelle **kompatible Repräsentationen** für fehlende Teile vorhersagen — Embeddings, keine Pixel.
**Trainingsziel:** Konsistenz von Repräsentationen (Kontext-Encoder + Target-Encoder + Prädiktor im Embedding-Space).
**Vertreter:**
- **V-JEPA** (Meta AI Research) — Video-JEPA, [arXiv:2404.08471](https://arxiv.org/abs/2404.08471), [Meta Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/)
- **I-JEPA** (Image-JEPA) — Vorgänger
- **Original JEPA-Framework:** LeCun, [OpenReview 2022](https://openreview.net/pdf?id=BZ5a1r-kVsf)
**Stärken:**
- **Theoretisch effizienter** — sagt nur Embeddings voraus, keine Pixel-Detailflut
- **Skaliert besser**, weil Compute dort investiert wird, wo er zählt (Regularitäten, nicht Rauschen)
- Latente Repräsentation ist **explizit** und nutzbar für Planung, Suche, Reasoning
**Schwächen:**
- **Empirisch (noch) hinter** den Top-Generatoren — keine vergleichbar beeindruckenden Demos
- Schwer zu evaluieren, weil keine direkten „Generierungs-Beweise" wie bei VEO
- Braucht eine **zweite Stufe** (Decoder, Renderer) für sichtbare Outputs
## Trade-offs auf einen Blick
| Dimension | Generativ (Hassabis) | JEPA (LeCun) |
|-----------|----------------------|--------------|
| **Trainingsziel** | Pixel-Rekonstruktion | Embedding-Konsistenz |
| **Compute-Effizienz** | niedriger (Blattflattern-Problem) | höher (theoretisch) |
| **Skalierbarkeit** | qualitativ begrenzt durch Pixel-Rauschen | qualitativ offen |
| **Output-Qualität (empirisch 2026)** | sehr hoch (VEO) | noch im Aufbau |
| **Latente Repräsentation** | implizit, schwer nutzbar | explizit, planbar |
| **Reifegrad** | produktionsreif | Forschung |
| **Verifikation** | „Schau das Video an" | braucht Downstream-Tasks |
## Der aktuelle Stand 2026
**Pit-Zusammenfassung (2026-06-18):** „VEO-ähnliche Generatoren müssen latente Physik/Objektpermanenz/Kausalität gelernt haben" — Hassabis-These als Konsens innerhalb der DeepMind-Strategie. LeCuns JEPA-Gegenposition ist **konzeptionell elegant**, aber empirisch nicht an der Spitze.
**Hectors Einordnung:** Die Debatte ist nicht „wer hat recht" — beide Pfade verfolgen dasselbe Ziel mit verschiedenen Methoden:
- **Hassabis:** „Zeig mir, dass du die Welt verstehst, indem du sie generierst." Empirie-first.
- **LeCun:** „Lerne die Welt als kompaktes Modell, bevor du Pixel verschwendest." Theorie-first.
**Wette:** Wer bis 2028-2030 das produktionsreifere Weltmodell hat, das mehr ist als Video-Generation (echtes Planning, Reasoning, Counterfactuals), gewinnt die AGI-Weltmodell-Komponente. Hassabis spielt auf Sichtbarkeit (VEO-Demos); LeCun spielt auf Fundament (V-JEPA als Vor-Bedingung für alles weitere).
## Strategische Konsequenzen für AGI
| These | Vertreter | Konsequenz |
|-------|-----------|-----------|
| **Generative Weltmodelle = AGI-Weg** | Hassabis, DeepMind | Compute → Video-Generation → Weltmodell → AGI |
| **JEPA = notwendige Vorbedingung** | LeCun, Meta | Erst Repräsentationen lernen, dann generieren — wie Sprache vor Sprechen |
| **Hybrid** | (offen) | JEPA-Encoder → Planung → Generativer Decoder |
**OpenAI/Anthropic:** Beide Labors verfolgen aktuell **keine explizite Weltmodell-Strategie**. Sie skalieren AR-LLMs weiter. Dies ist ein blinder Fleck im AR-Only-Wettlauf — und der Hauptgrund, warum DeepMind seine Compute-Allokation breiter streut.
## Verwandte Wiki-Seiten
- `[[../architecture/deepmind-beyond-transformer.md]]` — Strategischer Kontrast DeepMind vs. AR-Only-Labs
- `[[../concepts/llm/post-transformer-llm-architectures.md]]` — Vier-Säulen-Übersicht inkl. Weltmodell-Sektion
- `[[transformer-foundation.md]]` — Klassischer Transformer als Vergleichsbasis
- `[[../concepts/agi/aschenbrenner-situational-awareness.md]]` — AGI-Realismus: „OOMs zählen" + The Project
## Externe Primärquellen
- **V-JEPA Paper:** [arXiv:2404.08471](https://arxiv.org/abs/2404.08471)
- **V-JEPA Meta Blog:** https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/
- **LeCun JEPA Framework:** https://openreview.net/pdf?id=BZ5a1r-kVsf
- **Yann LeCun Position Papers:** [Meta AI Research](https://ai.meta.com/research/)
- **Demis Hassabis Position (VEO/Weltmodell):** [Google DeepMind Blog](https://blog.google/technology/google-deepmind/google-gemini-updates/)
- **Pourya Kordi Video:** https://www.youtube.com/watch?v=8oyZB24-vAM

View file

@ -2,7 +2,7 @@
*Auto-generated: 2026-06-18*
*Letzte Aktualisierung: 2026-06-18 (15. Update — Neue Konzeptseite `wiki/concepts/policy/ai-as-geopolitical-weapon.md` (Miles Deutscher "Weaponization of Intelligence" + Hector-Einordnung), `ai-regulation-2026.md` um Geopolitik-Cross-Link erweitert. Trigger: Pit Weber geteilter Thread im Krallenpolitik-Topic.)*
*Letzte Aktualisierung: 2026-06-18 (16. Update — Wikify-Cluster zum DeepMind-„Beyond Transformer"-Video (Pourya Kordi). Neue Architektur-Seiten `architecture/deepmind-beyond-transformer.md` (strategischer Kontrast zu OpenAI/Anthropic) + `architecture/transformer-foundation.md` (klassischer Stack + Quadratic-Attention-Limit). Neue Konzept-Seite `concepts/world-models-jepa-vs-generative.md` (Hassabis-vs-LeCun-Debatte). Bestehende `concepts/llm/post-transformer-llm-architectures.md` um Cross-Links und Schwester-Quelle (`youtube/2026-06-18_deepmind-beyond-transformer.md`, OME Topic 6 / aGi / eMergence) erweitert. Trigger: Pit Weber hat das Video erneut in OME Topic 6 (aGi / eMergence) mit ausführlicher deutscher Zusammenfassung geteilt.)*
## Architecture
@ -14,6 +14,8 @@
| [Model Routing](architecture/model-routing.md) | Two-Model-Pipeline, GPT-5.4 Config, Fallback-Chain, OpenClaw v2026.6.8 GLM-5.2 + Provider-Prefix-Normalisierung | context-tree + other/2026-06-16_openclaw-releases-v2026.6.8.md |
| [Cron & System Events](architecture/cron-notable-events.md) | Historische Cron-Architektur, Disk-Krise, Execution Gap | context-tree |
| [ByteRover Knowledge Mining](architecture/byterover-knowledge-mining.md) | Mining-Pipeline, Blockaden, Status | context-tree |
| [DeepMind Beyond Transformer](architecture/deepmind-beyond-transformer.md) | Strategischer Architektur-Kontrast: DeepMind (Diffusion + Hybride + Weltmodelle) vs. OpenAI/Anthropic (AR + Scaling). Vier Säulen, Gemma 4 Edge (256k), Gemini Diffusion 10× | youtube/2026-06-18_deepmind-beyond-transformer.md + youtube/2026-06-16_deepmind-two-steps-ahead.md |
| [Transformer Foundation](architecture/transformer-foundation.md) | Klassischer Transformer-Stack (Attention + AR + großes Pretraining), Quadratic-Attention-Limit, Skalierungsgrenzen, AR-Only-Gegenposition | youtube/2026-06-18_deepmind-beyond-transformer.md |
## Tools
@ -32,6 +34,11 @@
## Concepts
### World Models
| Seite | Beschreibung | Quellen |
|-------|-------------|---------|
| [Weltmodelle: JEPA vs. Generativ](concepts/world-models-jepa-vs-generative.md) | Hassabis-vs-LeCun-Debatte strukturiert: Generative Weltmodelle (VEO, Pixel-Rekonstruktion, Compute-intensiv) vs. JEPA (V-JEPA, Embedding-Konsistenz, theoretisch effizienter, empirisch noch nicht an der Spitze). AGI-Weltmodell-Wette bis 2028-2030 | youtube/2026-06-18_deepmind-beyond-transformer.md + youtube/2026-06-16_deepmind-two-steps-ahead.md |
### LLM
| Seite | Beschreibung | Quellen |
|-------|-------------|---------|
@ -131,5 +138,7 @@
| `raw/other/financialbot-topic-history-2026-02-01_2026-05-30.json` | other | FinancialBot-Topic Komplett-Export (66 Messages, OME-Gruppe, 2026-02-01→2026-05-30) |
| `raw/xpost/2026-06-15_harrystebbings-20vc-aravind-srinivas.md` | xpost | 20VC mit Aravind Srinivas: 7 Thesen zu Agents, Export Controls, Orchestrierung, Token Value per Watt, Speed + Humility |
| `raw/youtube/2026-06-16_everlast-mainzer-neuromorphe-chips-quantencomputer.md` | youtube | Prof. Mainzer (Everlast AI, 1:48:40, 2026-06-03): Neuromorphe Chips, Quantencomputer, Physical AI, 20W-Gehirn, geopolitische KI-Strategien |
| `raw/youtube/2026-06-16_deepmind-two-steps-ahead.md` | youtube | Pourya Kordi: DeepMind Was Two Steps Ahead, AGAIN! — Pit-Zusammenfassung in OME Topic 13 (#6645), Inhalt: Griffin/Recurrent-Gemma/Titans, Diffusions-LLMs (10×), Hassabis-vs-LeCun-Weltmodelle (JEPA vs. generativ), Strategie-Kontrast OpenAI/Anthropic |
| `raw/youtube/2026-06-18_deepmind-beyond-transformer.md` | youtube | Pourya Kordi: DeepMind Was Two Steps Ahead, AGAIN! — Pit-Zusammenfassung in OME Topic 6 / aGi / eMergence (18.06.2026), Schwester-Ingest zum 16.06-Cluster (anderes Topic, gleicher Video-Inhalt). Schwerpunkt: Architektur-Alternativen (Griffin/Recurrent-Gemma/Titans/Gemma 4 Edge 256k), Diffusions-LLMs, Hassabis-These VEO = Weltmodell, LeCun-Konter JEPA, DeepMind vs. AR-Only-Labs |
| `raw/blog/2026-06-16_aschenbrenner-situational-awareness.md` | blog | Leopold Aschenbrenner (OpenAI Superalignment, Juni 2024): AGI bis 2027, Superintelligenz, The Project, vier Risiken, AGI-Realismus |
| `raw/other/2026-06-16_openclaw-releases-v2026.6.8.md` | other | OpenClaw Releases v2026.6.6v2026.6.8 — GitHub-API-Snapshot der Top 5 (16.06.2026): GLM-5.2 + Claude Haiku 4.5, Provider-Prefix-Norm, QMD-Stabilität, Security-Hardening |

View file

@ -576,3 +576,26 @@ Die drei zusammen ergeben ein vollständiges Bild: Algorithmus × Hardware × AG
- Sollen `wiki/teams/`-Inhalte physisch nach `people/` verschoben werden oder parallel existieren? Aktueller Plan: physisch migrieren mit Redirect-Stub-File (analog OKF-Move-Pattern), Ausnahme: Netbits-Avatar (User-Identität, nicht reale Person).
- WMT-009 wird die User-Identitäten separat klassifizieren.
**Lint-Vorab-Check:** Neuer Lint-Run wird die leeren Dirs als 0-File-Cluster markieren — kein Fail (Threshold 12/20).
## [2026-06-18] Wikify: DeepMind „Beyond Transformer" — Strategischer Kontrast + JEPA-vs-Generativ-Debatte
**Type:** ingest | **Scope:** raw/youtube/2026-06-18_deepmind-beyond-transformer.md + 3 Wiki-Seiten
**Trigger:** Pit Weber hat Pourya Kordis Video „DeepMind Was Two Steps Ahead, AGAIN!" (https://www.youtube.com/watch?v=8oyZB24-vAM) erneut in OME Topic 6 (aGi / eMergence) mit ausführlicher deutscher Zusammenfassung geteilt. Inhaltlich deckungsgleich mit dem 16.06-Ingest aus Topic 13 (#6645), aber anderes Topic → eigene Raw-Datei + drei neue Wiki-Perspektiven.
**Actions:**
- raw: `raw/youtube/2026-06-18_deepmind-beyond-transformer.md` (immutable, mit Pit-Header-Notiz + Transkript-Hinweis LOGIN_REQUIRED)
- wiki (NEU): `architecture/deepmind-beyond-transformer.md` — Strategischer Kontrast DeepMind (Diffusion + Hybride + Weltmodelle + Gemma 4 Edge 256k) vs. OpenAI/Anthropic (AR + Scaling)
- wiki (NEU): `concepts/world-models-jepa-vs-generative.md` — Hassabis-vs-LeCun-Debatte strukturiert: Generative Rekonstruktion (VEO, Compute-intensiv) vs. JEPA-Embeddings (V-JEPA, theoretisch effizienter, empirisch noch nicht an der Spitze). AGI-Weltmodell-Wette bis 2028-2030
- wiki (NEU): `architecture/transformer-foundation.md` — Klassischer Transformer-Stack + Quadratic-Attention-Limit + Skalierungsgrenzen + AR-Only-Gegenposition (OpenAI/Anthropic-Argumente)
- wiki (UPDATE): `concepts/llm/post-transformer-llm-architectures.md` — Schwester-Quelle `youtube/2026-06-18_deepmind-beyond-transformer.md` ergänzt, drei Cross-Links auf die neuen Seiten
- wiki (UPDATE): `index.md` — Header auf 16. Update, zwei neue Architektur-Zeilen, eigene „World Models"-Concepts-Sektion, Raw-Sources-Eintrag
- log: this entry
**Strategische Entscheidung:**
Die neue Pits Zusammenfassung ist thematisch deckungsgleich mit der 16.06-Version, aber in anderem Topic-Kontext (aGi / eMergence statt News). Statt nur die bestehende Seite zu erweitern, wurde der Inhalt in **drei neue Perspektiven** strukturiert, um Duplikation zu vermeiden und die Lesbarkeit zu verbessern:
1. Architektur-Strategie (DeepMind-Kontrast)
2. Konzept-Debatte (Hassabis vs. LeCun)
3. Basis-Voraussetzung (klassischer Transformer als Fundament)
Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Übersicht bestehen und verlinkt jetzt auf die drei neuen Perspektiven.
**Subagent-Modell:** openrouter/deepseek-v4-flash:cloud (wie angewiesen — zai/glm-5.1 Billing leer, openrouter-Fallback verwendet)