- 23 new institutions pages (alby, anthropic, blink-wallet, carnegie-mellon, deepmind, epoch-ai, fincept, google-cloud, hugging-face, lightning-labs, linux-foundation, mit, moonshot-ai, mozilla-foundation, openai, openai-superalignment, openrouter, polymarket, stanford-ai-lab, tu-muenchen, xai, z-ai) - institutions-ingest-runner.md script - modified concepts (agi, hardware, llm) + tools pages - wiki-lint-report update
5.6 KiB
| created | updated | sources | related_raw | tags | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-06-23 | 2026-06-23 |
|
|
|
Edge-Inferenz als Cloud-Alternative — AMDs Lunchbox-PC
"../../people/lisa-su.md betritt die Bühne mit einem lunchbox-format PC — und führt ein 235-Milliarden-Parameter-Modell lokal aus. 128 GB unified memory, 3× schneller als eine RTX 5080. Das ist nicht die Zukunft — das ist heute." — @0xJokker, X-Post, 2026-06-16
Kernthese
Edge-Inferenz hat 2026 ein neues Kapazitätslevel erreicht. AMDs Ryzen AI Max+ 395 (Strix Halo) beweist, dass 235-Milliarden-Parameter-Modelle lokal auf einem lunchbox-format PC laufen — ohne Cloud, ohne Server-Rack, ohne GPU-Karte. Das bedeutet: die Cloud-Exit-These ist nicht mehr nur eine Mac-only-Bewegung (siehe cloud-exit-and-local-superiority.md), sondern erreicht jetzt die x86-Welt.
Der Breakthrough: Unified Memory
Der entscheidende Architektur-Bruch ist Unified Memory: Erstmals in einer mainstream x86-Plattform teilen CPU und GPU denselben Memory-Pool.
| Eigenschaft | RTX 5090 | RTX 5080 | AMD Ryzen AI Max+ 395 |
|---|---|---|---|
| VRAM / Unified Memory | 32 GB GDDR7 | 16 GB GDDR7 | 128 GB unified |
| Architecture | Separate GPU | Separate GPU | CPU+GPU shared pool |
| Data Movement | PCIe bottleneck | PCIe bottleneck | Zero-copy |
| Form Factor | Desktop GPU card | Desktop GPU card | Lunchbox APU |
| Price (System) | ~$1,999+ (GPU alone) | ~$1,199+ (GPU alone) | $1,499 (complete PC) |
- Bis zu 96 GB des 128 GB können als VRAM via Variable Graphics Memory (VGM) zugewiesen werden
- 256 GB/s Speicherbandbreite — genug für große LLM-Inferenz ohne Swapping
- Modelle wie Qwen3 235B, DeepSeek V3 laufen vollständig lokal
Performance: 3× RTX 5080 bei 235B Inference
AMDs eigene Benchmarks (verifiziert via AIM Network YouTube + AMD Blog):
| Workload | AMD Ryzen AI Max+ 395 | Competition | Faktor |
|---|---|---|---|
| DeepSeek R1 235B Inference | 3× faster | RTX 5080 | 3.0× |
| 7B/8B Model TTFT | — | Intel Core Ultra 258V | 9.1× |
| 14B Model TTFT | — | Intel Core Ultra 258V | 12.2× |
| 16B Token Throughput | — | Intel Arc 140V | 2.2× |
TTFT = Time to First Token. Höherer Faktor bei größeren Modellen, weil Unified Memory das Model-Loading eliminisiert.
Warum das relevant ist: Drei Anschlüsse ans Wiki
1. Cloud-Exit bekommt eine x86-Option
Bisher war die Cloud-Exit-These (cloud-exit-and-local-superiority.md) eine Mac-only-Bewegung: Apple M-Series mit 64-128 GB unified memory als alleinige Option. AMDs Strix Halo öffnet die x86-Welt: 128 GB unified memory, LM Studio Kompatibilität, $1.499 Einstiegspreis. Die Hardware-Tabelle in cloud-exit-and-local-superiority.md bekommt eine neue Zeile.
2. ../../people/klaus-mainzer.md Energie-Argument: Gehirn 20W vs. LLM-Megawatt
../../people/klaus-mainzer.md (neuromorphic-chips-und-quantencomputer.md) argumentiert, dass das Gehirn mit ~20 W leistet, wofür LLM-Cluster Megawatt brauchen. AMDs Lunchbox-PC ist kein neuromorpher Chip — aber er schließt die Lücke teilweise: 235B-Parameter-Inferenz in einem Watt-Klassen-Gerät, nicht in einem Megawatt-Datacenter. Edge-Inferenz als Zwischenschritt zur neuromorphen Hardware.
3. ../../people/aravind-srinivas.md Token Value per Watt per User
../../people/aravind-srinivas.md (ai-value-migration-orchestration.md) sagt: "The key metric is token value per watt per user." AMDs unified-memory-Ansatz maximiert genau das: lokale Inferenz ohne Netzwerk-Latenz, ohne Server-Kühlung, ohne Cloud-Overhead. 235B lokal = maximale Token-Density pro Watt. Die Wertschöpfung verschiebt sich von Cloud-Compute zur lokalen Hardware.
Grenzen und offene Fragen
- Keine Trainings-Hardware: Strix Halo ist Inferenz-only. Training großer Modelle bleibt im Datacenter.
- AMD-Benchmarks: Die 3× RTX 5080-Behauptung stammt von AMD selbst. Unabhängige Bestätigung steht aus.
- Modell-Quantisierung: 235B läuft nur mit aggressiver Quantisierung (Q4 K_M oder niedriger) in 128 GB. Genauigkeitseinbußen möglich.
- Verfügbarkeit: Erste Systeme (ASUS ROG Flow Z13, HP ZBook Ultra G1a, GMKtec Evo-X2) verfügbar, aber Nischen-Markt.
Verbindung zu anderen Wiki-Seiten
- Cloud-Exit & Lokale Überlegenheit — Direkte Erweiterung: x86-Alternative zur Mac-only-Bewegung
- Neuromorphe Chips & Quantencomputer — Mainzers Energie-Argument: Edge-Inferenz als Zwischenschritt
- AI Value Migration — Orchestration — Aravinds Token/Watt/User-Metrik: AMD maximiert lokale Token-Density
- Aschenbrenner — Situational Awareness — Compute-Skalierung ergänzt durch Edge-Inferenz