wikify(youtube): deepmind-beyond-transformer + jepa-vs-generative (2026-06-18)
This commit is contained in:
parent
8421be26c8
commit
b484555f13
8 changed files with 428 additions and 9 deletions
86
raw/youtube/2026-06-18_deepmind-beyond-transformer.md
Normal file
86
raw/youtube/2026-06-18_deepmind-beyond-transformer.md
Normal file
|
|
@ -0,0 +1,86 @@
|
||||||
|
---
|
||||||
|
type: youtube
|
||||||
|
source_url: https://www.youtube.com/watch?v=8oyZB24-vAM
|
||||||
|
retrieved: 2026-06-18
|
||||||
|
title: "DeepMind Was Two Steps Ahead, AGAIN!"
|
||||||
|
channel: "Pourya Kordi"
|
||||||
|
channel_url: https://www.youtube.com/@Pourya_Kordi
|
||||||
|
author_handle: "@Pourya_Kordi"
|
||||||
|
duration_sec: null
|
||||||
|
has_transcript: false
|
||||||
|
transcript_note: "Auto-Transcript via youtube.com nicht abrufbar (LOGIN_REQUIRED); Pits Textzusammenfassung in OME Topic 6 (aGi / eMergence) als Primärquelle genutzt."
|
||||||
|
pit_summary_ref: "OME Topic 6 (aGi / eMergence), 2026-06-18 — Pit Weber"
|
||||||
|
topic: "aGi / eMergence"
|
||||||
|
tags: [deepmind, transformer, attention, diffusion, world-models, jepa, griffin, recurrent-gemma, gemma, agi, post-transformer, hassabis, lecun]
|
||||||
|
---
|
||||||
|
|
||||||
|
# DeepMind Was Two Steps Ahead, AGAIN!
|
||||||
|
|
||||||
|
**Pit Weber — 2026-06-18 — OME Topic 6 (aGi / eMergence)**
|
||||||
|
**Kanal:** Pourya Kordi · [@Pourya_Kordi](https://www.youtube.com/@Pourya_Kordi)
|
||||||
|
**Video:** https://www.youtube.com/watch?v=8oyZB24-vAM
|
||||||
|
|
||||||
|
> **Hinweis:** YouTube liefert für dieses Video kein maschinenlesbares Transkript (LOGIN_REQUIRED). Diese Datei basiert auf Pits zweiter Zusammenfassung desselben Videos (Topic 6 / aGi / eMergence), zwei Tage nach der ersten Ingest-Welle (Topic 13 / News & Infos, 2026-06-16 → `raw/youtube/2026-06-16_deepmind-two-steps-ahead.md`). Inhaltlich deckungsgleich mit der 16.06-Zusammenfassung; strukturell hier nochmal als eigenständige Quelle geführt, weil sie in einem anderen Topic-Kontext (aGi / eMergence statt News) gepostet wurde.
|
||||||
|
|
||||||
|
## Kernthese
|
||||||
|
|
||||||
|
DeepMind positioniert sich **jenseits des klassischen Transformer-Stacks** (autoregressive LLMs mit globaler Attention) und investiert systematisch in alternative Architekturen — als Fundament einer nächsten Generation, in der AR-Transformer + Scaling allein möglicherweise nicht den nächsten qualitativ anderen Sprung liefern.
|
||||||
|
|
||||||
|
## 1. Architektur-Alternativen jenseits globaler Attention
|
||||||
|
|
||||||
|
Quadratische Komplexität der „naiven" globalen Attention wird bei langen Kontexten unpraktisch. DeepMind-Alternativen kombinieren **lokale Attention** mit **rekurrentem Zustand** für effizienten Langzeitkontext:
|
||||||
|
|
||||||
|
- **Griffin** — lokale Attention (Fenster) + rekurrentes „Index-Karten"-Gedächtnis, das essentielle Information komprimiert fortschreibt, statt eine riesige KV-Cache-Historie mitzuschleppen.
|
||||||
|
- **Recurrent Gemma** — baut auf Griffin auf; verbesserte Langkontext-Benchmarks.
|
||||||
|
- **Titans** — „Learning to Memorize at Test Time"; selektives Gedächtnis für sehr lange Kontexte.
|
||||||
|
|
||||||
|
## 2. Gemma 4
|
||||||
|
|
||||||
|
Kombination aus **Sparsity/Experts** und **hybrider Attention** (lokal + global). Multimodalität bis **256k Token Kontext auf Edge-Hardware** — also auf Consumer-Geräten lauffähig, nicht nur in Rechenzentren.
|
||||||
|
|
||||||
|
## 3. Diffusions-LLMs
|
||||||
|
|
||||||
|
Statt sequentieller Token-Generierung (klassische AR-Transformer) verfeinern Diffusions-LLMs **iterativ die ganze Sequenz**:
|
||||||
|
|
||||||
|
- **~10× schneller** bei vergleichbarer Qualität (gemessen)
|
||||||
|
- **Parallele Updates** statt Token-Pipeline → GPU-freundlich
|
||||||
|
- **Eingebaute Fehlerkorrektur** durch iterative Verfeinerung
|
||||||
|
- **Flexibler:** Code-Completion in beliebigen Kontextpositionen, nicht nur als Präfix-Fortsetzung
|
||||||
|
- **DeepMind-Instanz:** Gemini Diffusion (Ankündigung Mai 2025) als zentrale Technologie **neben** (nicht statt) den AR-LLMs
|
||||||
|
|
||||||
|
## 4. Weltmodelle via Video-Generation
|
||||||
|
|
||||||
|
**Demis Hassabis' These:** VEO-ähnliche Video-Generatoren, die glaubwürdige Szenen erzeugen, **müssen** latente Physik, Objektpermanenz und Kausalität gelernt haben — sonst könnten sie keine konsistenten Welten generieren. Realistische Generierung = impliziter Weltmodell-Test.
|
||||||
|
|
||||||
|
## 5. LeCun-Konter: JEPA > generative Objectives
|
||||||
|
|
||||||
|
**Yann LeCun (Gegenposition):** Rein generative Objectives stecken zu viel Rechenaufwand in **unvorhersagbare Details** (berühmtes Beispiel: „Blattflattern" im Wind). JEPA-artige Joint-Embedding-Modelle prognostizieren stattdessen nur **kompatible Repräsentationen** fehlender Teile — keine Pixel-Rekonstruktion. Vertreter: **V-JEPA** (Meta AI Research).
|
||||||
|
|
||||||
|
**Theoretisch effizienter**, **empirisch (noch) hinter** den Top-Generatoren — die Debatte ist offen.
|
||||||
|
|
||||||
|
## 6. Strategischer Kontrast DeepMind vs. AR-Only-Labs
|
||||||
|
|
||||||
|
| Position | Labs | Kern-These |
|
||||||
|
|----------|------|-----------|
|
||||||
|
| **AR + Scaling** | OpenAI, Anthropic | Klassische Transformer + Skalierungsgesetze reichen; Compute ist der Engpass |
|
||||||
|
| **Architektur-Diversität** | DeepMind | Reine AR-LLMs liefern womöglich nicht den nächsten Sprung; Diffusion + hybride Architekturen sind Fundament der nächsten Generation |
|
||||||
|
|
||||||
|
**Hinweis:** Aufgabe von Sora zugunsten des GPT-Stacks (OpenAI DevDay 2024) wird als Indiz für AR-Fokus gelesen. DeepMind hält dagegen **Gemini Diffusion** als zentrale Säule.
|
||||||
|
|
||||||
|
## Offene Fragen
|
||||||
|
|
||||||
|
- Sollten wir mittelfristig Griffin-artige Architekturen für **lokal laufende Embedding/SSR-Modelle** evaluieren?
|
||||||
|
- Ist der Diffusions-Pfad relevant für **Code-Completion in nicht-Präfix-Positionen** im Agenten-Workflow?
|
||||||
|
- Wie balancieren wir Foundation-Prior (großes vortrainiertes Modell) vs. Continual-Learning (eigene Erfahrung) bei unseren Subconscious-/Memory-Subsystemen?
|
||||||
|
|
||||||
|
## Externe Primärquellen
|
||||||
|
|
||||||
|
- **Video (Original):** https://www.youtube.com/watch?v=8oyZB24-vAM
|
||||||
|
- **Kanal:** https://www.youtube.com/@Pourya_Kordi
|
||||||
|
- **Griffin:** [arXiv:2402.19427](https://arxiv.org/abs/2402.19427) · [Google Research](https://research.google/blog/introducing-griffin/)
|
||||||
|
- **Recurrent Gemma:** [arXiv:2404.08239](https://arxiv.org/abs/2404.08239) · [Google Blog](https://blog.google/technology/developers/google-gemma-recurrent/)
|
||||||
|
- **Titans:** [arXiv:2501.00663](https://arxiv.org/abs/2501.00663)
|
||||||
|
- **Gemini Diffusion:** [Google DeepMind Blog](https://blog.google/technology/google-deepmind/google-gemini-updates/)
|
||||||
|
- **V-JEPA:** [Meta AI Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) · [arXiv:2404.08471](https://arxiv.org/abs/2404.08471)
|
||||||
|
- **LeCun JEPA-Framework:** [OpenReview 2022](https://openreview.net/pdf?id=BZ5a1r-kVsf)
|
||||||
|
- **Schwester-Raw (2026-06-16):** `raw/youtube/2026-06-16_deepmind-two-steps-ahead.md` (Pit Topic 13, identisches Video, frühere Ingest-Welle)
|
||||||
|
|
@ -1,6 +1,6 @@
|
||||||
# Wiki Lint Report
|
# Wiki Lint Report
|
||||||
|
|
||||||
*Generated: 2026-06-18 14:21:24 UTC*
|
*Generated: 2026-06-18 20:23:35 UTC*
|
||||||
*Repo: /home/node/workspace/knowledge-base*
|
*Repo: /home/node/workspace/knowledge-base*
|
||||||
*Script: scripts/wiki-lint.sh v1.0*
|
*Script: scripts/wiki-lint.sh v1.0*
|
||||||
|
|
||||||
|
|
@ -9,7 +9,8 @@
|
||||||
| Dir | Files | Trigger |
|
| Dir | Files | Trigger |
|
||||||
|-----|-------|---------|
|
|-----|-------|---------|
|
||||||
| wiki | 3 | ✅ |
|
| wiki | 3 | ✅ |
|
||||||
| wiki/architecture | 6 | ✅ |
|
| wiki/architecture | 8 | ✅ |
|
||||||
|
| wiki/concepts | 1 | ✅ |
|
||||||
| wiki/concepts/agents | 6 | ✅ |
|
| wiki/concepts/agents | 6 | ✅ |
|
||||||
| wiki/concepts/agi | 1 | ✅ |
|
| wiki/concepts/agi | 1 | ✅ |
|
||||||
| wiki/concepts/directives | 3 | ✅ |
|
| wiki/concepts/directives | 3 | ✅ |
|
||||||
|
|
@ -25,7 +26,7 @@
|
||||||
_Schema v1.5 Sub-Categories: `concepts/hardware`, `concepts/agi`, `people/`, `institutions/` (alle in Counts oben enthalten)_
|
_Schema v1.5 Sub-Categories: `concepts/hardware`, `concepts/agi`, `people/`, `institutions/` (alle in Counts oben enthalten)_
|
||||||
|
|
||||||
### Stub-Quote (<30 Zeilen)
|
### Stub-Quote (<30 Zeilen)
|
||||||
✅ **4 / 52 (7%)**
|
✅ **4 / 55 (7%)**
|
||||||
|
|
||||||
Stub-Files:
|
Stub-Files:
|
||||||
- `wiki/ideas/2026-04-08_git-auto-commit.md (28 lines)`
|
- `wiki/ideas/2026-04-08_git-auto-commit.md (28 lines)`
|
||||||
|
|
@ -34,7 +35,7 @@ Stub-Files:
|
||||||
- `wiki/ideas/2026-06-06_plur1bus-priority-fix.md (29 lines)`
|
- `wiki/ideas/2026-06-06_plur1bus-priority-fix.md (29 lines)`
|
||||||
|
|
||||||
### Frontmatter Präsenz
|
### Frontmatter Präsenz
|
||||||
✅ **49 / 52 present**
|
✅ **52 / 55 present**
|
||||||
|
|
||||||
### Broken Cross-References
|
### Broken Cross-References
|
||||||
✅ **0 broken**
|
✅ **0 broken**
|
||||||
|
|
@ -82,11 +83,11 @@ Stub-Files:
|
||||||
✅ **0 stale**
|
✅ **0 stale**
|
||||||
|
|
||||||
### Uncovered Raw Sources
|
### Uncovered Raw Sources
|
||||||
✅ **26 raw, all covered**
|
✅ **27 raw, all covered**
|
||||||
|
|
||||||
## Summary
|
## Summary
|
||||||
|
|
||||||
- Total Wiki-Pages: 52
|
- Total Wiki-Pages: 55
|
||||||
- Issues: 0
|
- Issues: 0
|
||||||
|
|
||||||
→ Wiki is clean. No subagent spawn needed.
|
→ Wiki is clean. No subagent spawn needed.
|
||||||
|
|
|
||||||
89
wiki/architecture/deepmind-beyond-transformer.md
Normal file
89
wiki/architecture/deepmind-beyond-transformer.md
Normal file
|
|
@ -0,0 +1,89 @@
|
||||||
|
---
|
||||||
|
created: 2026-06-18
|
||||||
|
updated: 2026-06-18
|
||||||
|
sources:
|
||||||
|
- youtube/2026-06-18_deepmind-beyond-transformer.md
|
||||||
|
- youtube/2026-06-16_deepmind-two-steps-ahead.md
|
||||||
|
tags: [architecture, deepmind, post-transformer, diffusion-llm, griffin, recurrent-gemma, titans, gemma, gemini, agi]
|
||||||
|
---
|
||||||
|
|
||||||
|
# DeepMind Beyond Transformer — Strategischer Architektur-Kontrast
|
||||||
|
|
||||||
|
> **Aggregiert-Stand:** 2026-06-18. Primärquellen: Pourya Kordi, „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube, https://www.youtube.com/watch?v=8oyZB24-vAM) — Pit-Zusammenfassung in OME Topic 6 (aGi / eMergence) am 2026-06-18. YouTube-Transkript nicht abrufbar (LOGIN_REQUIRED). Schwester-Ingest vom 2026-06-16 (Topic 13) liegt unter `raw/youtube/2026-06-16_deepmind-two-steps-ahead.md` und wird hier inhaltlich mit zitiert.
|
||||||
|
|
||||||
|
Diese Seite rückt den **strategischen Kontrast** zwischen DeepMinds Architektur-Diversität und der AR-Only-Strategie von OpenAI/Anthropic in den Mittelpunkt. Technische Details zu den einzelnen Architekturen sind auf der Schwester-Seite `[[../concepts/llm/post-transformer-llm-architectures.md]]` (Vier-Säulen-Übersicht) und der Konzept-Seite `[[../concepts/world-models-jepa-vs-generative.md]]` (Hassabis-vs-LeCun-Debatte) ausführlich dokumentiert.
|
||||||
|
|
||||||
|
## Kernthese: Architektur-Diversität statt Monokultur
|
||||||
|
|
||||||
|
DeepMind verfolgt **vier parallele Säulen**, statt die gesamte Compute-Allokation auf AR-Transformer-Skalierung zu setzen:
|
||||||
|
|
||||||
|
| Säule | Wettlauf-Anteil | Schlüsselmodelle | OpenClaw-Relevanz |
|
||||||
|
|-------|----------------|------------------|-------------------|
|
||||||
|
| **Hybride Attention / Recurrence** | Mittel-Lang-Kontext auf Edge | Griffin, Recurrent Gemma, Titans | Lokal laufende Embeddings/SSR |
|
||||||
|
| **Diffusions-LLMs** | Schnelle, parallele Generierung | Gemini Diffusion | Code-Completion in beliebigen Positionen |
|
||||||
|
| **Multimodale Edge-Modelle** | On-Device-Deployment | Gemma 4 (Sparsity+hybride Attention, 256k Kontext) | Self-Hosted Sovereignty |
|
||||||
|
| **Weltmodelle** | AGI-Wegbereitung | VEO + Hassabis-These | siehe Konzept-Seite |
|
||||||
|
|
||||||
|
## Strategischer Kontrast: DeepMind vs. AR-Only-Labs
|
||||||
|
|
||||||
|
| | OpenAI / Anthropic | DeepMind |
|
||||||
|
|---|-------------------|----------|
|
||||||
|
| **Primär-Stack** | AR-Transformer + Skalierung | AR + Diffusion + Hybride + Weltmodelle |
|
||||||
|
| **Skalierungs-Hebel** | Compute (Chinchilla, Scaling Laws) | Compute **und** Architektur-Innovation |
|
||||||
|
| **Indiz für Position** | Aufgabe von Sora zugunsten GPT-Stack (OpenAI DevDay 2024) | Gemini Diffusion als zentrale Säule (Mai 2025) |
|
||||||
|
| **Wettlauf-Strategie** | „Wir skalieren besser als die anderen" | „Wir skalieren ANDERS — mit Architektur-Mix" |
|
||||||
|
| **Risiko** | AR-Hitze-Dead-End (Skalierungsgesetze flachen ab) | AR-Beiwerk wird verworfen, falsche Säule gewinnt |
|
||||||
|
| **Compute-Allokation** | SaaS-Produkt-Optimierung | AGI-Mission |
|
||||||
|
|
||||||
|
**Pit-Zusammenfassung (2026-06-18):** „OpenAI/Anthropic setzen auf AR-Transformer + Scaling; DeepMind setzt auf Diffusion + hybride Architekturen als Fundament der nächsten Generation."
|
||||||
|
|
||||||
|
## Was macht DeepMind anders? — Vier strategische Prinzipien
|
||||||
|
|
||||||
|
1. **Architektur-Diversität statt Monokultur** — vier parallele Säulen statt einer vertikalen Skalierungspiste.
|
||||||
|
2. **Compute-Allokation auf AGI-Mission**, nicht auf SaaS-Optimierung.
|
||||||
|
3. **Langfristiger wissenschaftlicher Zeithorizont** — bereit, „verlorene" Wetten auf nicht-AR-Architekturen einzugehen.
|
||||||
|
4. **Hypothese:** Reine AR-LLMs liefern durch „Scale" allein womöglich nicht den nächsten **qualitativ anderen** Sprung; Diffusion + hybride Architekturen + Weltmodelle sind die Architekturgrundlage der nächsten Generation.
|
||||||
|
|
||||||
|
## Detail-Säulen mit Architektur-Referenzen
|
||||||
|
|
||||||
|
### 1. Hybride Attention / Recurrence (Griffin / Recurrent Gemma / Titans)
|
||||||
|
|
||||||
|
Quadratische Komplexität globaler Attention → bei langen Kontexten unpraktisch. DeepMind-Alternativen kombinieren lokale Attention mit rekurrentem Zustand. Detail-Beschreibungen und externe arXiv-Links siehe `[[../concepts/llm/post-transformer-llm-architectures.md#1-effizientere-attention--hybride-architekturen]]`.
|
||||||
|
|
||||||
|
### 2. Gemma 4 — Edge-Multimodalität
|
||||||
|
|
||||||
|
- Sparsity/Experts + hybrid (lokal + global) Attention
|
||||||
|
- Multimodal
|
||||||
|
- **256k Token Kontext auf Edge-Hardware** — d. h. auf Consumer-Geräten lauffähig
|
||||||
|
- **OpenClaw-Relevanz:** Self-Hosted Sovereignty, Datenschutz, Latenz-Reduktion
|
||||||
|
|
||||||
|
### 3. Diffusions-LLMs (Gemini Diffusion)
|
||||||
|
|
||||||
|
Statt sequentieller AR-Generierung → iterative Verfeinerung der ganzen Sequenz. Pit-Zusammenfassung nennt konkret **~10× schneller bei vergleichbarer Qualität**, parallele Updates, GPU-freundlich, eingebaute Fehlerkorrektur, und **Code-Completion in beliebigen Kontextpositionen** (statt nur Präfix-Fortsetzung). Detail-Tabellen siehe `[[../concepts/llm/post-transformer-llm-architectures.md#2-diffusions-llms-nicht-ar-generierung]]`.
|
||||||
|
|
||||||
|
### 4. Weltmodelle — Hassabis-vs-LeCun-Debatte
|
||||||
|
|
||||||
|
Wird auf eigener Konzept-Seite `[[../concepts/world-models-jepa-vs-generative.md]]` strukturiert.
|
||||||
|
|
||||||
|
## Externe Primärquellen
|
||||||
|
|
||||||
|
- **Video:** https://www.youtube.com/watch?v=8oyZB24-vAM (Pourya Kordi)
|
||||||
|
- **Pit Topic 6:** OME Topic 6 (aGi / eMergence), 2026-06-18
|
||||||
|
- **Pit Topic 13:** OME Topic 13 #6645, 2026-06-16 (Schwester-Ingest)
|
||||||
|
- **Griffin:** [arXiv:2402.19427](https://arxiv.org/abs/2402.19427)
|
||||||
|
- **Recurrent Gemma:** [arXiv:2404.08239](https://arxiv.org/abs/2404.08239) · [Google Blog](https://blog.google/technology/developers/google-gemma-recurrent/)
|
||||||
|
- **Titans:** [arXiv:2501.00663](https://arxiv.org/abs/2501.00663)
|
||||||
|
- **Gemini Diffusion:** [Google DeepMind Blog](https://blog.google/technology/google-deepmind/google-gemini-updates/)
|
||||||
|
- **V-JEPA:** [Meta AI Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/) · [arXiv:2404.08471](https://arxiv.org/abs/2404.08471)
|
||||||
|
- **LeCun JEPA-Framework:** [OpenReview 2022](https://openreview.net/pdf?id=BZ5a1r-kVsf)
|
||||||
|
- **OpenAI DevDay 2024 (Sora-Kontext):** [OpenAI](https://openai.com/index/sora-is-here/)
|
||||||
|
|
||||||
|
## Verwandte Wiki-Seiten
|
||||||
|
|
||||||
|
- `[[../concepts/llm/post-transformer-llm-architectures.md]]` — Vier-Säulen-Übersicht mit Architektur-Details
|
||||||
|
- `[[../concepts/world-models-jepa-vs-generative.md]]` — Hassabis-vs-LeCun-Debatte als eigenständiges Konzept
|
||||||
|
- `[[transformer-foundation.md]]` — Klassischer Transformer-Stack + Quadratic-Attention-Limit (Voraussetzung)
|
||||||
|
- `[[model-routing.md]]` — Routing-Entscheidungen sollten Architektur-Diversität berücksichtigen
|
||||||
|
- `[[../concepts/llm/llm-model-fusion-ensembles.md]]` — Orthogonaler Ansatz (mehrere Modelle ensemble)
|
||||||
|
- `[[../concepts/llm/glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack) als Kontrast
|
||||||
|
- `[[../concepts/llm/ai-value-migration-orchestration.md]]` — Aravind Srinivas (20VC) zu AGI-Wettlauf
|
||||||
91
wiki/architecture/transformer-foundation.md
Normal file
91
wiki/architecture/transformer-foundation.md
Normal file
|
|
@ -0,0 +1,91 @@
|
||||||
|
---
|
||||||
|
created: 2026-06-18
|
||||||
|
updated: 2026-06-18
|
||||||
|
sources:
|
||||||
|
- youtube/2026-06-18_deepmind-beyond-transformer.md
|
||||||
|
tags: [architecture, transformer, attention, scaling, foundation, post-transformer]
|
||||||
|
---
|
||||||
|
|
||||||
|
# Transformer Foundation — Klassischer Stack und seine Grenzen
|
||||||
|
|
||||||
|
> **Stand:** 2026-06-18. Hintergrund: Pit-Zusammenfassung in OME Topic 6 (aGi / eMergence), 2026-06-18, Pourya Kordi „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube).
|
||||||
|
|
||||||
|
Diese Seite beschreibt den **klassischen Transformer-Stack**, seine Kernidee und seine **fundamentalen Skalierungs-Limits** — als Voraussetzung für das Verständnis der Alternativen auf `[[deepmind-beyond-transformer.md]]` und `[[../concepts/llm/post-transformer-llm-architectures.md]]`.
|
||||||
|
|
||||||
|
## Der klassische Transformer-Stack
|
||||||
|
|
||||||
|
Der „klassische" moderne LLM-Stack, wie er seit 2017 ([Vaswani et al., „Attention Is All You Need"](https://arxiv.org/abs/1706.03762)) in OpenAI/Anthropic-Frontier-Modellen eingesetzt wird, besteht aus drei Säulen:
|
||||||
|
|
||||||
|
| Säule | Beschreibung | Hauptvertreter |
|
||||||
|
|-------|--------------|----------------|
|
||||||
|
| **Globale Self-Attention** | Jedes Token sieht jedes andere Token in der Sequenz (volle Aufmerksamkeitsmatrix) | Alle GPT-, Claude-, Gemini-AR-Modelle |
|
||||||
|
| **Autoregressive (AR) Generierung** | Token-für-Token sequentiell, irreversibel, ohne nachträgliche Korrektur | GPT-5.x, Claude Opus 4.x, Gemini 3.x |
|
||||||
|
| **Großes statisches Pretraining** | Web-Scale-Daten, eine Trainingsphase, danach gefroren oder leicht fine-tuned | Chinchilla-Scaling-Laws |
|
||||||
|
|
||||||
|
**Erfolgsgeschichte:** Dieser Stack hat seit 2018 GPT-2 → GPT-3 → GPT-4 → GPT-5x, BERT → RoBERTa, T5 → PaLM → Gemini, LLaMA → LLaMA 3/4, Claude 1 → 4 hervorgebracht. Alle Frontier-Modelle 2026 basieren auf dieser Architektur.
|
||||||
|
|
||||||
|
## Das Quadratic-Attention-Problem
|
||||||
|
|
||||||
|
**Kernproblem:** Globale Self-Attention skaliert **quadratisch** mit der Sequenzlänge.
|
||||||
|
|
||||||
|
```
|
||||||
|
Aufmerksamkeitsmatrix = N × N
|
||||||
|
wobei N = Sequenzlänge in Tokens
|
||||||
|
```
|
||||||
|
|
||||||
|
**Konsequenzen:**
|
||||||
|
- **8k Token Kontext:** 64 Millionen Attention-Einträge pro Layer
|
||||||
|
- **128k Token Kontext:** 16 Milliarden Attention-Einträge pro Layer
|
||||||
|
- **1M Token Kontext:** 1 Billion Attention-Einträge pro Layer — praktisch nicht mehr trainierbar
|
||||||
|
|
||||||
|
**Pit-Zusammenfassung (2026-06-18):** „Quadratische Komplexität der ‚naiven' globalen Attention wird bei langen Kontexten unpraktisch."
|
||||||
|
|
||||||
|
**Standard-Milderungen (alle mit Trade-offs):**
|
||||||
|
- **Flash Attention** — Speicher-effizienter Algorithmus, ändert nichts an asymptotischer Komplexität
|
||||||
|
- **Sliding Window Attention** (z. B. Mistral) — jedes Token sieht nur einen lokalen Kontext
|
||||||
|
- **Sparse Attention Patterns** — BigBird, Longformer, ETC. — vordefinierte Sparsity-Patterns
|
||||||
|
- **KV-Cache-Komprimierung** — zur Laufzeit, nicht beim Training
|
||||||
|
|
||||||
|
**DeepMinds radikalerer Ansatz:** Attention komplett durch **rekurrente Zustände** ergänzen oder ersetzen (Griffin, Recurrent Gemma, Titans — siehe `[[../concepts/llm/post-transformer-llm-architectures.md]]`).
|
||||||
|
|
||||||
|
## Skalierungs-Limits
|
||||||
|
|
||||||
|
Pit-Zusammenfassung (2026-06-18): „Reine AR-LLMs liefern durch ‚Scale' allein womöglich nicht den nächsten qualitativ anderen Sprung."
|
||||||
|
|
||||||
|
**Empirische Hinweise für nachlassende Skalierungsrenditen:**
|
||||||
|
- **Chinchilla-Optimal** wurde 2022 erreicht; danach lineares Scaling statt super-linear
|
||||||
|
- **Compute-Budget 2025/26:** ~10²⁵ FLOPs für Frontier-Trainings; weitere OOMs werden teurer (Energie, Chip-Engpässe)
|
||||||
|
- **Datenmauer:** Hochwertige Textdaten nähern sich der Erschöpfung; Multimodal-Daten sind die nächste Reserve, aber Tokenisierung ist teurer
|
||||||
|
- **Pre-Training-Plateau:** GPT-5.x und Claude 4.x zeigen kleinere Sprünge zwischen Generationen als GPT-3 → GPT-4
|
||||||
|
|
||||||
|
**Konsequenz:** Das „mehr vom Gleichen"-Spiel stößt an harte Grenzen. Architektur-Innovation wird zum primären Hebel — siehe `[[deepmind-beyond-transformer.md]]` für DeepMinds Strategie.
|
||||||
|
|
||||||
|
## Alternative: AR + Skalierung reicht — die Gegenposition
|
||||||
|
|
||||||
|
OpenAI und Anthropic halten an AR + Scaling fest. Ihre Argumente:
|
||||||
|
|
||||||
|
| Argument | Quelle |
|
||||||
|
|----------|--------|
|
||||||
|
| Skalierungsgesetze gelten weiter, nur langsamer | Chinchilla-Erweiterungen |
|
||||||
|
| RLHF / Constitutional AI / „Reasoning"-Modi sind orthogonal zu Architektur | OpenAI o1/o3, Claude Extended Thinking |
|
||||||
|
| Tool-Use und Agent-Loops kompensieren Modell-Schwächen | OpenAI Function Calling, Anthropic MCP |
|
||||||
|
| Multimodale Erweiterung (Vision, Audio) als nächste Skalierungs-Achse | GPT-5 Vision, Claude 4 Multimodal |
|
||||||
|
|
||||||
|
**Hectors Einordnung:** Beide Lager haben rationale Argumente. DeepMind wettet stärker auf Architektur-Diversität; OpenAI/Anthropic auf Compute-Skalierung + Training-Methodik. Empirischer Sieger ist offen — wahrscheinlich Hybrid aus beidem (siehe `[[../concepts/world-models-jepa-vs-generative.md#strategische-konsequenzen-für-agi]]`).
|
||||||
|
|
||||||
|
## Verwandte Wiki-Seiten
|
||||||
|
|
||||||
|
- `[[deepmind-beyond-transformer.md]]` — DeepMinds Architektur-Diversität als Antwort
|
||||||
|
- `[[../concepts/llm/post-transformer-llm-architectures.md]]` — Vier-Säulen-Übersicht (Griffin, Diffusion, JEPA, Foundation-Prior)
|
||||||
|
- `[[../concepts/world-models-jepa-vs-generative.md]]` — Hassabis-vs-LeCun-Debatte
|
||||||
|
- `[[model-routing.md]]` — Wie wir in OpenClaw heute mit Architektur-Diversität umgehen
|
||||||
|
- `[[../concepts/llm/glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack)
|
||||||
|
- `[[../concepts/llm/ai-value-migration-orchestration.md]]` — Wertverschiebung zu Compute + Strom
|
||||||
|
|
||||||
|
## Externe Primärquellen
|
||||||
|
|
||||||
|
- **Vaswani et al., „Attention Is All You Need":** [arXiv:1706.03762](https://arxiv.org/abs/1706.03762) (Originalpaper)
|
||||||
|
- **Chinchilla Scaling Laws:** [arXiv:2203.15556](https://arxiv.org/abs/2203.15556) (Hoffmann et al., DeepMind 2022)
|
||||||
|
- **Flash Attention:** [arXiv:2205.14135](https://arxiv.org/abs/2205.14135) (Dao et al.)
|
||||||
|
- **Longformer:** [arXiv:2004.05150](https://arxiv.org/abs/2004.05150)
|
||||||
|
- **Pit-Zusammenfassung (OME Topic 6):** 2026-06-18, Pourya Kordi „DeepMind Was Two Steps Ahead, AGAIN!" (https://www.youtube.com/watch?v=8oyZB24-vAM)
|
||||||
|
|
@ -1,14 +1,20 @@
|
||||||
---
|
---
|
||||||
created: 2026-06-16
|
created: 2026-06-16
|
||||||
updated: 2026-06-16
|
updated: 2026-06-18
|
||||||
sources:
|
sources:
|
||||||
- youtube/2026-06-16_deepmind-two-steps-ahead.md
|
- youtube/2026-06-16_deepmind-two-steps-ahead.md
|
||||||
|
- youtube/2026-06-18_deepmind-beyond-transformer.md
|
||||||
tags: [architecture, deepmind, post-transformer, diffusion-llm, jepa, world-model, griffin, recurrent-gemma]
|
tags: [architecture, deepmind, post-transformer, diffusion-llm, jepa, world-model, griffin, recurrent-gemma]
|
||||||
---
|
---
|
||||||
|
|
||||||
# Post-Transformer LLM Architectures
|
# Post-Transformer LLM Architectures
|
||||||
|
|
||||||
> **Aggregiert-Stand:** 2026-06-16, basiert primär auf Pourya Kordi, „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube) und der Pit-Zusammenfassung in [OME Topic 13 #6645](https://t.me/c/3839640481/13/6645). Transkript nicht abrufbar; Pit-Zusammenfassung als Primärquelle genutzt.
|
> **Aggregiert-Stand:** 2026-06-16, erweitert 2026-06-18. Primärquellen: Pourya Kordi, „DeepMind Was Two Steps Ahead, AGAIN!" (YouTube), Pit-Zusammenfassungen in [OME Topic 13 #6645](https://t.me/c/3839640481/13/6645) (16.06) und OME Topic 6 / aGi / eMergence (18.06). Transkript nicht abrufbar; Pit-Zusammenfassungen als Primärquelle.
|
||||||
|
>
|
||||||
|
> **Schwester-Seiten:**
|
||||||
|
> - Strategischer Kontrast DeepMind vs. AR-Only-Labs: `[[../../architecture/deepmind-beyond-transformer.md]]`
|
||||||
|
> - Hassabis-vs-LeCun-Weltmodell-Debatte: `[[../world-models-jepa-vs-generative.md]]`
|
||||||
|
> - Klassischer Transformer als Basis: `[[../../architecture/transformer-foundation.md]]`
|
||||||
|
|
||||||
DeepMind verfolgt eine **mehrgleisige Architekturstrategie**, die das klassische Transformer-Stack (AR + globale Attention + dichte Skalierung) **nicht ablöst, sondern erweitert**. Diese Seite sammelt die vier strategischen Säulen.
|
DeepMind verfolgt eine **mehrgleisige Architekturstrategie**, die das klassische Transformer-Stack (AR + globale Attention + dichte Skalierung) **nicht ablöst, sondern erweitert**. Diese Seite sammelt die vier strategischen Säulen.
|
||||||
|
|
||||||
|
|
@ -93,6 +99,9 @@ Quadratische Komplexität der „naiven" globalen Attention wird bei langen Kont
|
||||||
|
|
||||||
- `[[llm-model-fusion-ensembles.md]]` — Orthogonaler Ansatz: mehrere Modelle ensemble
|
- `[[llm-model-fusion-ensembles.md]]` — Orthogonaler Ansatz: mehrere Modelle ensemble
|
||||||
- `[[glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack) als Kontrast
|
- `[[glm-5.2-zai-coding-model.md]]` — Coding-Frontier (AR-Stack) als Kontrast
|
||||||
|
- `[[../world-models-jepa-vs-generative.md]]` — Hassabis-vs-LeCun-Debatte (eigenständige Konzept-Seite, 18.06.2026)
|
||||||
|
- `[[../../architecture/deepmind-beyond-transformer.md]]` — Strategischer Kontrast DeepMind vs. AR-Only-Labs
|
||||||
|
- `[[../../architecture/transformer-foundation.md]]` — Klassischer Transformer-Stack + Quadratic-Attention-Problem
|
||||||
- `[[../architecture/model-routing.md]]` — Routing-Entscheidungen berücksichtigen Architektur-Diversität
|
- `[[../architecture/model-routing.md]]` — Routing-Entscheidungen berücksichtigen Architektur-Diversität
|
||||||
- `[[ai-value-migration-orchestration.md]]` — 20VC Perspektive: Aravind Srinivas zu AGI-Wettlauf
|
- `[[ai-value-migration-orchestration.md]]` — 20VC Perspektive: Aravind Srinivas zu AGI-Wettlauf
|
||||||
|
|
||||||
|
|
|
||||||
111
wiki/concepts/world-models-jepa-vs-generative.md
Normal file
111
wiki/concepts/world-models-jepa-vs-generative.md
Normal file
|
|
@ -0,0 +1,111 @@
|
||||||
|
---
|
||||||
|
created: 2026-06-18
|
||||||
|
updated: 2026-06-18
|
||||||
|
sources:
|
||||||
|
- youtube/2026-06-18_deepmind-beyond-transformer.md
|
||||||
|
- youtube/2026-06-16_deepmind-two-steps-ahead.md
|
||||||
|
tags: [concept, world-models, jepa, hassabis, lecun, generative, video-generation, v-jepa, veo, agi, deepmind, meta]
|
||||||
|
---
|
||||||
|
|
||||||
|
# Weltmodelle: JEPA vs. Generativ — Die Hassabis-LeCun-Debatte
|
||||||
|
|
||||||
|
> **Stand:** 2026-06-18. Quellen: Pourya Kordi Video „DeepMind Was Two Steps Ahead, AGAIN!" (Pit-Zusammenfassung in OME Topic 6 / aGi / eMergence, 2026-06-18) und Schwester-Ingest vom 2026-06-16 (Topic 13). YouTube-Transkript nicht abrufbar (LOGIN_REQUIRED).
|
||||||
|
|
||||||
|
Diese Konzept-Seite strukturiert die **theoretische und strategische Debatte** zwischen zwei fundamental verschiedenen Wegen zu einem Weltmodell: **generative Rekonstruktion** (Hassabis) vs. **Joint-Embedding-Prediction** (LeCun). Die Seite ist konzeptuell fokussiert — die breitere DeepMind-Architektur-Strategie liegt auf `[[../architecture/deepmind-beyond-transformer.md]]`, die technischen Säulen auf `[[../concepts/llm/post-transformer-llm-architectures.md]]`.
|
||||||
|
|
||||||
|
## Grundfrage
|
||||||
|
|
||||||
|
> Wie lernt ein Modell die latente Struktur der Welt — Physik, Objektpermanenz, Kausalität, räumliche/zeitliche Konsistenz?
|
||||||
|
|
||||||
|
Zwei Antworten, zwei Lager, zwei verschiedene Trainingsziele.
|
||||||
|
|
||||||
|
## Pfad A: Generative Weltmodelle (Hassabis-Lager)
|
||||||
|
|
||||||
|
**Demis Hassabis (DeepMind):** Realistische Video-Generatoren wie VEO sind nicht nur „schöne Pixel". Wer glaubwürdige Szenen erzeugt, **muss** latente Regularitäten gelernt haben — sonst wären die Szenen physikalisch inkonsistent.
|
||||||
|
|
||||||
|
**Trainingsziel:** Rekonstruktion aus Rauschen (Diffusion).
|
||||||
|
|
||||||
|
**Vertreter:**
|
||||||
|
- **VEO** (Google DeepMind) — Video-Generation auf Weltmodell-Niveau
|
||||||
|
- **Sora** (OpenAI) — Vergleichsfall; wurde laut Pit zugunsten des GPT-Stacks zurückgefahren (OpenAI DevDay 2024)
|
||||||
|
- **Gemini Diffusion** — Text-Diffusion als Schwester-Pfad
|
||||||
|
|
||||||
|
**Stärken:**
|
||||||
|
- Implizit Weltregularitäten (Physik, Objektpermanenz, Kausalität)
|
||||||
|
- Output-Qualität ist sichtbar — generierte Videos „beweisen" das Modell
|
||||||
|
- Direkter Weg zu Anwendungen (VEO ist Produkt-fähig)
|
||||||
|
|
||||||
|
**Schwächen:**
|
||||||
|
- **Compute-Verschwendung** für unwesentliche Details (LeCuns Hauptkritik: „Blattflattern im Wind")
|
||||||
|
- Latente Repräsentation ist implizit — schwer zu interpretieren oder gezielt zu nutzen
|
||||||
|
- Skaliert möglicherweise ineffizient — je realistischer das Pixel-Output, desto mehr Bits für unvorhersagbares Rauschen
|
||||||
|
|
||||||
|
## Pfad B: JEPA — Joint Embedding Predictive Architecture (LeCun-Lager)
|
||||||
|
|
||||||
|
**Yann LeCun (Meta):** Rein generative Objectives sind fundamental verschwenderisch. Statt Pixel zu rekonstruieren, sollen Modelle **kompatible Repräsentationen** für fehlende Teile vorhersagen — Embeddings, keine Pixel.
|
||||||
|
|
||||||
|
**Trainingsziel:** Konsistenz von Repräsentationen (Kontext-Encoder + Target-Encoder + Prädiktor im Embedding-Space).
|
||||||
|
|
||||||
|
**Vertreter:**
|
||||||
|
- **V-JEPA** (Meta AI Research) — Video-JEPA, [arXiv:2404.08471](https://arxiv.org/abs/2404.08471), [Meta Blog](https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/)
|
||||||
|
- **I-JEPA** (Image-JEPA) — Vorgänger
|
||||||
|
- **Original JEPA-Framework:** LeCun, [OpenReview 2022](https://openreview.net/pdf?id=BZ5a1r-kVsf)
|
||||||
|
|
||||||
|
**Stärken:**
|
||||||
|
- **Theoretisch effizienter** — sagt nur Embeddings voraus, keine Pixel-Detailflut
|
||||||
|
- **Skaliert besser**, weil Compute dort investiert wird, wo er zählt (Regularitäten, nicht Rauschen)
|
||||||
|
- Latente Repräsentation ist **explizit** und nutzbar für Planung, Suche, Reasoning
|
||||||
|
|
||||||
|
**Schwächen:**
|
||||||
|
- **Empirisch (noch) hinter** den Top-Generatoren — keine vergleichbar beeindruckenden Demos
|
||||||
|
- Schwer zu evaluieren, weil keine direkten „Generierungs-Beweise" wie bei VEO
|
||||||
|
- Braucht eine **zweite Stufe** (Decoder, Renderer) für sichtbare Outputs
|
||||||
|
|
||||||
|
## Trade-offs auf einen Blick
|
||||||
|
|
||||||
|
| Dimension | Generativ (Hassabis) | JEPA (LeCun) |
|
||||||
|
|-----------|----------------------|--------------|
|
||||||
|
| **Trainingsziel** | Pixel-Rekonstruktion | Embedding-Konsistenz |
|
||||||
|
| **Compute-Effizienz** | niedriger (Blattflattern-Problem) | höher (theoretisch) |
|
||||||
|
| **Skalierbarkeit** | qualitativ begrenzt durch Pixel-Rauschen | qualitativ offen |
|
||||||
|
| **Output-Qualität (empirisch 2026)** | sehr hoch (VEO) | noch im Aufbau |
|
||||||
|
| **Latente Repräsentation** | implizit, schwer nutzbar | explizit, planbar |
|
||||||
|
| **Reifegrad** | produktionsreif | Forschung |
|
||||||
|
| **Verifikation** | „Schau das Video an" | braucht Downstream-Tasks |
|
||||||
|
|
||||||
|
## Der aktuelle Stand 2026
|
||||||
|
|
||||||
|
**Pit-Zusammenfassung (2026-06-18):** „VEO-ähnliche Generatoren müssen latente Physik/Objektpermanenz/Kausalität gelernt haben" — Hassabis-These als Konsens innerhalb der DeepMind-Strategie. LeCuns JEPA-Gegenposition ist **konzeptionell elegant**, aber empirisch nicht an der Spitze.
|
||||||
|
|
||||||
|
**Hectors Einordnung:** Die Debatte ist nicht „wer hat recht" — beide Pfade verfolgen dasselbe Ziel mit verschiedenen Methoden:
|
||||||
|
|
||||||
|
- **Hassabis:** „Zeig mir, dass du die Welt verstehst, indem du sie generierst." Empirie-first.
|
||||||
|
- **LeCun:** „Lerne die Welt als kompaktes Modell, bevor du Pixel verschwendest." Theorie-first.
|
||||||
|
|
||||||
|
**Wette:** Wer bis 2028-2030 das produktionsreifere Weltmodell hat, das mehr ist als Video-Generation (echtes Planning, Reasoning, Counterfactuals), gewinnt die AGI-Weltmodell-Komponente. Hassabis spielt auf Sichtbarkeit (VEO-Demos); LeCun spielt auf Fundament (V-JEPA als Vor-Bedingung für alles weitere).
|
||||||
|
|
||||||
|
## Strategische Konsequenzen für AGI
|
||||||
|
|
||||||
|
| These | Vertreter | Konsequenz |
|
||||||
|
|-------|-----------|-----------|
|
||||||
|
| **Generative Weltmodelle = AGI-Weg** | Hassabis, DeepMind | Compute → Video-Generation → Weltmodell → AGI |
|
||||||
|
| **JEPA = notwendige Vorbedingung** | LeCun, Meta | Erst Repräsentationen lernen, dann generieren — wie Sprache vor Sprechen |
|
||||||
|
| **Hybrid** | (offen) | JEPA-Encoder → Planung → Generativer Decoder |
|
||||||
|
|
||||||
|
**OpenAI/Anthropic:** Beide Labors verfolgen aktuell **keine explizite Weltmodell-Strategie**. Sie skalieren AR-LLMs weiter. Dies ist ein blinder Fleck im AR-Only-Wettlauf — und der Hauptgrund, warum DeepMind seine Compute-Allokation breiter streut.
|
||||||
|
|
||||||
|
## Verwandte Wiki-Seiten
|
||||||
|
|
||||||
|
- `[[../architecture/deepmind-beyond-transformer.md]]` — Strategischer Kontrast DeepMind vs. AR-Only-Labs
|
||||||
|
- `[[../concepts/llm/post-transformer-llm-architectures.md]]` — Vier-Säulen-Übersicht inkl. Weltmodell-Sektion
|
||||||
|
- `[[transformer-foundation.md]]` — Klassischer Transformer als Vergleichsbasis
|
||||||
|
- `[[../concepts/agi/aschenbrenner-situational-awareness.md]]` — AGI-Realismus: „OOMs zählen" + The Project
|
||||||
|
|
||||||
|
## Externe Primärquellen
|
||||||
|
|
||||||
|
- **V-JEPA Paper:** [arXiv:2404.08471](https://arxiv.org/abs/2404.08471)
|
||||||
|
- **V-JEPA Meta Blog:** https://ai.meta.com/blog/v-jepa-yann-lecun-world-model-ai/
|
||||||
|
- **LeCun JEPA Framework:** https://openreview.net/pdf?id=BZ5a1r-kVsf
|
||||||
|
- **Yann LeCun Position Papers:** [Meta AI Research](https://ai.meta.com/research/)
|
||||||
|
- **Demis Hassabis Position (VEO/Weltmodell):** [Google DeepMind Blog](https://blog.google/technology/google-deepmind/google-gemini-updates/)
|
||||||
|
- **Pourya Kordi Video:** https://www.youtube.com/watch?v=8oyZB24-vAM
|
||||||
|
|
@ -2,7 +2,7 @@
|
||||||
|
|
||||||
*Auto-generated: 2026-06-18*
|
*Auto-generated: 2026-06-18*
|
||||||
|
|
||||||
*Letzte Aktualisierung: 2026-06-18 (15. Update — Neue Konzeptseite `wiki/concepts/policy/ai-as-geopolitical-weapon.md` (Miles Deutscher "Weaponization of Intelligence" + Hector-Einordnung), `ai-regulation-2026.md` um Geopolitik-Cross-Link erweitert. Trigger: Pit Weber geteilter Thread im Krallenpolitik-Topic.)*
|
*Letzte Aktualisierung: 2026-06-18 (16. Update — Wikify-Cluster zum DeepMind-„Beyond Transformer"-Video (Pourya Kordi). Neue Architektur-Seiten `architecture/deepmind-beyond-transformer.md` (strategischer Kontrast zu OpenAI/Anthropic) + `architecture/transformer-foundation.md` (klassischer Stack + Quadratic-Attention-Limit). Neue Konzept-Seite `concepts/world-models-jepa-vs-generative.md` (Hassabis-vs-LeCun-Debatte). Bestehende `concepts/llm/post-transformer-llm-architectures.md` um Cross-Links und Schwester-Quelle (`youtube/2026-06-18_deepmind-beyond-transformer.md`, OME Topic 6 / aGi / eMergence) erweitert. Trigger: Pit Weber hat das Video erneut in OME Topic 6 (aGi / eMergence) mit ausführlicher deutscher Zusammenfassung geteilt.)*
|
||||||
|
|
||||||
## Architecture
|
## Architecture
|
||||||
|
|
||||||
|
|
@ -14,6 +14,8 @@
|
||||||
| [Model Routing](architecture/model-routing.md) | Two-Model-Pipeline, GPT-5.4 Config, Fallback-Chain, OpenClaw v2026.6.8 GLM-5.2 + Provider-Prefix-Normalisierung | context-tree + other/2026-06-16_openclaw-releases-v2026.6.8.md |
|
| [Model Routing](architecture/model-routing.md) | Two-Model-Pipeline, GPT-5.4 Config, Fallback-Chain, OpenClaw v2026.6.8 GLM-5.2 + Provider-Prefix-Normalisierung | context-tree + other/2026-06-16_openclaw-releases-v2026.6.8.md |
|
||||||
| [Cron & System Events](architecture/cron-notable-events.md) | Historische Cron-Architektur, Disk-Krise, Execution Gap | context-tree |
|
| [Cron & System Events](architecture/cron-notable-events.md) | Historische Cron-Architektur, Disk-Krise, Execution Gap | context-tree |
|
||||||
| [ByteRover Knowledge Mining](architecture/byterover-knowledge-mining.md) | Mining-Pipeline, Blockaden, Status | context-tree |
|
| [ByteRover Knowledge Mining](architecture/byterover-knowledge-mining.md) | Mining-Pipeline, Blockaden, Status | context-tree |
|
||||||
|
| [DeepMind Beyond Transformer](architecture/deepmind-beyond-transformer.md) | Strategischer Architektur-Kontrast: DeepMind (Diffusion + Hybride + Weltmodelle) vs. OpenAI/Anthropic (AR + Scaling). Vier Säulen, Gemma 4 Edge (256k), Gemini Diffusion 10× | youtube/2026-06-18_deepmind-beyond-transformer.md + youtube/2026-06-16_deepmind-two-steps-ahead.md |
|
||||||
|
| [Transformer Foundation](architecture/transformer-foundation.md) | Klassischer Transformer-Stack (Attention + AR + großes Pretraining), Quadratic-Attention-Limit, Skalierungsgrenzen, AR-Only-Gegenposition | youtube/2026-06-18_deepmind-beyond-transformer.md |
|
||||||
|
|
||||||
## Tools
|
## Tools
|
||||||
|
|
||||||
|
|
@ -32,6 +34,11 @@
|
||||||
|
|
||||||
## Concepts
|
## Concepts
|
||||||
|
|
||||||
|
### World Models
|
||||||
|
| Seite | Beschreibung | Quellen |
|
||||||
|
|-------|-------------|---------|
|
||||||
|
| [Weltmodelle: JEPA vs. Generativ](concepts/world-models-jepa-vs-generative.md) | Hassabis-vs-LeCun-Debatte strukturiert: Generative Weltmodelle (VEO, Pixel-Rekonstruktion, Compute-intensiv) vs. JEPA (V-JEPA, Embedding-Konsistenz, theoretisch effizienter, empirisch noch nicht an der Spitze). AGI-Weltmodell-Wette bis 2028-2030 | youtube/2026-06-18_deepmind-beyond-transformer.md + youtube/2026-06-16_deepmind-two-steps-ahead.md |
|
||||||
|
|
||||||
### LLM
|
### LLM
|
||||||
| Seite | Beschreibung | Quellen |
|
| Seite | Beschreibung | Quellen |
|
||||||
|-------|-------------|---------|
|
|-------|-------------|---------|
|
||||||
|
|
@ -131,5 +138,7 @@
|
||||||
| `raw/other/financialbot-topic-history-2026-02-01_2026-05-30.json` | other | FinancialBot-Topic Komplett-Export (66 Messages, OME-Gruppe, 2026-02-01→2026-05-30) |
|
| `raw/other/financialbot-topic-history-2026-02-01_2026-05-30.json` | other | FinancialBot-Topic Komplett-Export (66 Messages, OME-Gruppe, 2026-02-01→2026-05-30) |
|
||||||
| `raw/xpost/2026-06-15_harrystebbings-20vc-aravind-srinivas.md` | xpost | 20VC mit Aravind Srinivas: 7 Thesen zu Agents, Export Controls, Orchestrierung, Token Value per Watt, Speed + Humility |
|
| `raw/xpost/2026-06-15_harrystebbings-20vc-aravind-srinivas.md` | xpost | 20VC mit Aravind Srinivas: 7 Thesen zu Agents, Export Controls, Orchestrierung, Token Value per Watt, Speed + Humility |
|
||||||
| `raw/youtube/2026-06-16_everlast-mainzer-neuromorphe-chips-quantencomputer.md` | youtube | Prof. Mainzer (Everlast AI, 1:48:40, 2026-06-03): Neuromorphe Chips, Quantencomputer, Physical AI, 20W-Gehirn, geopolitische KI-Strategien |
|
| `raw/youtube/2026-06-16_everlast-mainzer-neuromorphe-chips-quantencomputer.md` | youtube | Prof. Mainzer (Everlast AI, 1:48:40, 2026-06-03): Neuromorphe Chips, Quantencomputer, Physical AI, 20W-Gehirn, geopolitische KI-Strategien |
|
||||||
|
| `raw/youtube/2026-06-16_deepmind-two-steps-ahead.md` | youtube | Pourya Kordi: DeepMind Was Two Steps Ahead, AGAIN! — Pit-Zusammenfassung in OME Topic 13 (#6645), Inhalt: Griffin/Recurrent-Gemma/Titans, Diffusions-LLMs (10×), Hassabis-vs-LeCun-Weltmodelle (JEPA vs. generativ), Strategie-Kontrast OpenAI/Anthropic |
|
||||||
|
| `raw/youtube/2026-06-18_deepmind-beyond-transformer.md` | youtube | Pourya Kordi: DeepMind Was Two Steps Ahead, AGAIN! — Pit-Zusammenfassung in OME Topic 6 / aGi / eMergence (18.06.2026), Schwester-Ingest zum 16.06-Cluster (anderes Topic, gleicher Video-Inhalt). Schwerpunkt: Architektur-Alternativen (Griffin/Recurrent-Gemma/Titans/Gemma 4 Edge 256k), Diffusions-LLMs, Hassabis-These VEO = Weltmodell, LeCun-Konter JEPA, DeepMind vs. AR-Only-Labs |
|
||||||
| `raw/blog/2026-06-16_aschenbrenner-situational-awareness.md` | blog | Leopold Aschenbrenner (OpenAI Superalignment, Juni 2024): AGI bis 2027, Superintelligenz, The Project, vier Risiken, AGI-Realismus |
|
| `raw/blog/2026-06-16_aschenbrenner-situational-awareness.md` | blog | Leopold Aschenbrenner (OpenAI Superalignment, Juni 2024): AGI bis 2027, Superintelligenz, The Project, vier Risiken, AGI-Realismus |
|
||||||
| `raw/other/2026-06-16_openclaw-releases-v2026.6.8.md` | other | OpenClaw Releases v2026.6.6–v2026.6.8 — GitHub-API-Snapshot der Top 5 (16.06.2026): GLM-5.2 + Claude Haiku 4.5, Provider-Prefix-Norm, QMD-Stabilität, Security-Hardening |
|
| `raw/other/2026-06-16_openclaw-releases-v2026.6.8.md` | other | OpenClaw Releases v2026.6.6–v2026.6.8 — GitHub-API-Snapshot der Top 5 (16.06.2026): GLM-5.2 + Claude Haiku 4.5, Provider-Prefix-Norm, QMD-Stabilität, Security-Hardening |
|
||||||
|
|
|
||||||
23
wiki/log.md
23
wiki/log.md
|
|
@ -576,3 +576,26 @@ Die drei zusammen ergeben ein vollständiges Bild: Algorithmus × Hardware × AG
|
||||||
- Sollen `wiki/teams/`-Inhalte physisch nach `people/` verschoben werden oder parallel existieren? Aktueller Plan: physisch migrieren mit Redirect-Stub-File (analog OKF-Move-Pattern), Ausnahme: Netbits-Avatar (User-Identität, nicht reale Person).
|
- Sollen `wiki/teams/`-Inhalte physisch nach `people/` verschoben werden oder parallel existieren? Aktueller Plan: physisch migrieren mit Redirect-Stub-File (analog OKF-Move-Pattern), Ausnahme: Netbits-Avatar (User-Identität, nicht reale Person).
|
||||||
- WMT-009 wird die User-Identitäten separat klassifizieren.
|
- WMT-009 wird die User-Identitäten separat klassifizieren.
|
||||||
**Lint-Vorab-Check:** Neuer Lint-Run wird die leeren Dirs als 0-File-Cluster markieren — kein Fail (Threshold 12/20).
|
**Lint-Vorab-Check:** Neuer Lint-Run wird die leeren Dirs als 0-File-Cluster markieren — kein Fail (Threshold 12/20).
|
||||||
|
|
||||||
|
## [2026-06-18] Wikify: DeepMind „Beyond Transformer" — Strategischer Kontrast + JEPA-vs-Generativ-Debatte
|
||||||
|
**Type:** ingest | **Scope:** raw/youtube/2026-06-18_deepmind-beyond-transformer.md + 3 Wiki-Seiten
|
||||||
|
**Trigger:** Pit Weber hat Pourya Kordis Video „DeepMind Was Two Steps Ahead, AGAIN!" (https://www.youtube.com/watch?v=8oyZB24-vAM) erneut in OME Topic 6 (aGi / eMergence) mit ausführlicher deutscher Zusammenfassung geteilt. Inhaltlich deckungsgleich mit dem 16.06-Ingest aus Topic 13 (#6645), aber anderes Topic → eigene Raw-Datei + drei neue Wiki-Perspektiven.
|
||||||
|
|
||||||
|
**Actions:**
|
||||||
|
- raw: `raw/youtube/2026-06-18_deepmind-beyond-transformer.md` (immutable, mit Pit-Header-Notiz + Transkript-Hinweis LOGIN_REQUIRED)
|
||||||
|
- wiki (NEU): `architecture/deepmind-beyond-transformer.md` — Strategischer Kontrast DeepMind (Diffusion + Hybride + Weltmodelle + Gemma 4 Edge 256k) vs. OpenAI/Anthropic (AR + Scaling)
|
||||||
|
- wiki (NEU): `concepts/world-models-jepa-vs-generative.md` — Hassabis-vs-LeCun-Debatte strukturiert: Generative Rekonstruktion (VEO, Compute-intensiv) vs. JEPA-Embeddings (V-JEPA, theoretisch effizienter, empirisch noch nicht an der Spitze). AGI-Weltmodell-Wette bis 2028-2030
|
||||||
|
- wiki (NEU): `architecture/transformer-foundation.md` — Klassischer Transformer-Stack + Quadratic-Attention-Limit + Skalierungsgrenzen + AR-Only-Gegenposition (OpenAI/Anthropic-Argumente)
|
||||||
|
- wiki (UPDATE): `concepts/llm/post-transformer-llm-architectures.md` — Schwester-Quelle `youtube/2026-06-18_deepmind-beyond-transformer.md` ergänzt, drei Cross-Links auf die neuen Seiten
|
||||||
|
- wiki (UPDATE): `index.md` — Header auf 16. Update, zwei neue Architektur-Zeilen, eigene „World Models"-Concepts-Sektion, Raw-Sources-Eintrag
|
||||||
|
- log: this entry
|
||||||
|
|
||||||
|
**Strategische Entscheidung:**
|
||||||
|
Die neue Pits Zusammenfassung ist thematisch deckungsgleich mit der 16.06-Version, aber in anderem Topic-Kontext (aGi / eMergence statt News). Statt nur die bestehende Seite zu erweitern, wurde der Inhalt in **drei neue Perspektiven** strukturiert, um Duplikation zu vermeiden und die Lesbarkeit zu verbessern:
|
||||||
|
1. Architektur-Strategie (DeepMind-Kontrast)
|
||||||
|
2. Konzept-Debatte (Hassabis vs. LeCun)
|
||||||
|
3. Basis-Voraussetzung (klassischer Transformer als Fundament)
|
||||||
|
|
||||||
|
Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Übersicht bestehen und verlinkt jetzt auf die drei neuen Perspektiven.
|
||||||
|
|
||||||
|
**Subagent-Modell:** openrouter/deepseek-v4-flash:cloud (wie angewiesen — zai/glm-5.1 Billing leer, openrouter-Fallback verwendet)
|
||||||
|
|
|
||||||
Loading…
Add table
Reference in a new issue