> *"[[../../people/lisa-su.md|Lisa Su]] betritt die Bühne mit einem lunchbox-format PC — und führt ein 235-Milliarden-Parameter-Modell lokal aus. 128 GB unified memory, 3× schneller als eine RTX 5080. Das ist nicht die Zukunft — das ist heute."*
**Edge-Inferenz hat 2026 ein neues Kapazitätslevel erreicht.** AMDs Ryzen AI Max+ 395 (Strix Halo) beweist, dass 235-Milliarden-Parameter-Modelle lokal auf einem lunchbox-format PC laufen — ohne Cloud, ohne Server-Rack, ohne GPU-Karte. Das bedeutet: die Cloud-Exit-These ist nicht mehr nur eine Mac-only-Bewegung (siehe [[cloud-exit-and-local-superiority.md]]), sondern erreicht jetzt die x86-Welt.
## Der Breakthrough: Unified Memory
Der entscheidende Architektur-Bruch ist **Unified Memory**: Erstmals in einer mainstream x86-Plattform teilen CPU und GPU **denselben Memory-Pool**.
TTFT = Time to First Token. Höherer Faktor bei größeren Modellen, weil Unified Memory das Model-Loading eliminisiert.
## Warum das relevant ist: Drei Anschlüsse ans Wiki
### 1. Cloud-Exit bekommt eine x86-Option
Bisher war die Cloud-Exit-These ([[cloud-exit-and-local-superiority.md]]) eine Mac-only-Bewegung: Apple M-Series mit 64-128 GB unified memory als alleinige Option. AMDs Strix Halo öffnet die x86-Welt: 128 GB unified memory, LM Studio Kompatibilität, $1.499 Einstiegspreis. Die Hardware-Tabelle in [[cloud-exit-and-local-superiority.md]] bekommt eine neue Zeile.
### 2. [[../../people/klaus-mainzer.md|Mainzers]] Energie-Argument: Gehirn 20W vs. LLM-Megawatt
[[../../people/klaus-mainzer.md|Prof. Mainzer]] ([[neuromorphic-chips-und-quantencomputer.md]]) argumentiert, dass das Gehirn mit ~20 W leistet, wofür LLM-Cluster Megawatt brauchen. AMDs Lunchbox-PC ist kein neuromorpher Chip — aber er schließt die Lücke teilweise: 235B-Parameter-Inferenz in einem Watt-Klassen-Gerät, nicht in einem Megawatt-Datacenter. Edge-Inferenz als Zwischenschritt zur neuromorphen Hardware.
[[../../people/aravind-srinivas.md|Aravind Srinivas]] ([[../llm/ai-value-migration-orchestration.md]]) sagt: "The key metric is token value per watt per user." AMDs unified-memory-Ansatz maximiert genau das: lokale Inferenz ohne Netzwerk-Latenz, ohne Server-Kühlung, ohne Cloud-Overhead. 235B lokal = maximale Token-Density pro Watt. Die Wertschöpfung verschiebt sich von Cloud-Compute zur lokalen Hardware.
- [AMD Blog: Ryzen AI Max+ 395 Breakthrough AI Performance](https://www.amd.com/en/blogs/2025/amd-ryzen-ai-max-395-processor-breakthrough-ai-.html)
- [AIM Network YouTube: AMD Just Destroyed NVIDIA's RTX 5080 With a "Lunchbox"](https://www.youtube.com/watch?v=MeMc3WgmFJQ) — 05:09, 23K views, 2026-06-15
- [Pillitteri: Ryzen AI Max+ 395: Run a 235B Model Locally on a Mini PC](https://pasqualepillitteri.it/en/news/5058/ryzen-ai-max-395-235b-model-local-mini-pc)