knowledge-base/wiki/concepts/hardware/edge-inference-als-cloud-alternative.md
Hector 0e02fdbd59 feat: people-pages for all TODO institutions markers
- Created 27 new people-pages for all TODO-marked persons
- Replaced all TODO: people-page markers with wiki-links in institutions
- Cross-referenced back to institutions from each people-page
- 0 TODO markers remaining

New people-pages:
  shayne-coplan, jim-zemlin, wang-changhu, yang-bingyang, demis-hassabis,
  clement-delangue, thomas-kurian, fei-fei-li, christopher-manning,
  sam-altman, ilya-sutskever, moritz-kaminski, elon-musk, nicolas-burtey,
  elizabeth-stark, olaoluwa-osuntokun, jan-leike, oren-etzioni,
  ali-farhadi, jaime-sevilla, max-tegmark, daniela-rus, jared-kaplan,
  alex-atallah, andrew-moore, tuomas-sandholm, mitchell-baker
2026-06-25 21:44:25 +02:00

79 lines
No EOL
5.6 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-06-23
updated: 2026-06-23
sources:
- raw/xpost/2026-06-16_amd-ryzen-ai-edge-inferenz.md
related_raw:
- raw/xpost/2026-06-16_amd-ryzen-ai-edge-inferenz.md
tags: [concept, hardware, edge-inference, amd, ryzen-ai, strix-halo, unified-memory, local-ai, cloud-exit, qwen3-235b, lisa-su]
---
# Edge-Inferenz als Cloud-Alternative — AMDs Lunchbox-PC
> *"[[../../people/lisa-su.md|Lisa Su]] betritt die Bühne mit einem lunchbox-format PC — und führt ein 235-Milliarden-Parameter-Modell lokal aus. 128 GB unified memory, 3× schneller als eine RTX 5080. Das ist nicht die Zukunft — das ist heute."*
> — @0xJokker, X-Post, 2026-06-16
## Kernthese
**Edge-Inferenz hat 2026 ein neues Kapazitätslevel erreicht.** AMDs Ryzen AI Max+ 395 (Strix Halo) beweist, dass 235-Milliarden-Parameter-Modelle lokal auf einem lunchbox-format PC laufen — ohne Cloud, ohne Server-Rack, ohne GPU-Karte. Das bedeutet: die Cloud-Exit-These ist nicht mehr nur eine Mac-only-Bewegung (siehe [[cloud-exit-and-local-superiority.md]]), sondern erreicht jetzt die x86-Welt.
## Der Breakthrough: Unified Memory
Der entscheidende Architektur-Bruch ist **Unified Memory**: Erstmals in einer mainstream x86-Plattform teilen CPU und GPU **denselben Memory-Pool**.
| Eigenschaft | RTX 5090 | RTX 5080 | AMD Ryzen AI Max+ 395 |
|---|---|---|---|
| VRAM / Unified Memory | 32 GB GDDR7 | 16 GB GDDR7 | **128 GB unified** |
| Architecture | Separate GPU | Separate GPU | CPU+GPU shared pool |
| Data Movement | PCIe bottleneck | PCIe bottleneck | **Zero-copy** |
| Form Factor | Desktop GPU card | Desktop GPU card | **Lunchbox APU** |
| Price (System) | ~$1,999+ (GPU alone) | ~$1,199+ (GPU alone) | **$1,499 (complete PC)** |
- Bis zu 96 GB des 128 GB können als VRAM via Variable Graphics Memory (VGM) zugewiesen werden
- 256 GB/s Speicherbandbreite — genug für große LLM-Inferenz ohne Swapping
- Modelle wie Qwen3 235B, DeepSeek V3 laufen vollständig lokal
## Performance: 3× RTX 5080 bei 235B Inference
AMDs eigene Benchmarks (verifiziert via AIM Network YouTube + AMD Blog):
| Workload | AMD Ryzen AI Max+ 395 | Competition | Faktor |
|---|---|---|---|
| DeepSeek R1 235B Inference | 3× faster | RTX 5080 | **3.0×** |
| 7B/8B Model TTFT | — | Intel Core Ultra 258V | **9.1×** |
| 14B Model TTFT | — | Intel Core Ultra 258V | **12.2×** |
| 16B Token Throughput | — | Intel Arc 140V | **2.2×** |
TTFT = Time to First Token. Höherer Faktor bei größeren Modellen, weil Unified Memory das Model-Loading eliminisiert.
## Warum das relevant ist: Drei Anschlüsse ans Wiki
### 1. Cloud-Exit bekommt eine x86-Option
Bisher war die Cloud-Exit-These ([[cloud-exit-and-local-superiority.md]]) eine Mac-only-Bewegung: Apple M-Series mit 64-128 GB unified memory als alleinige Option. AMDs Strix Halo öffnet die x86-Welt: 128 GB unified memory, LM Studio Kompatibilität, $1.499 Einstiegspreis. Die Hardware-Tabelle in [[cloud-exit-and-local-superiority.md]] bekommt eine neue Zeile.
### 2. [[../../people/klaus-mainzer.md|Mainzers]] Energie-Argument: Gehirn 20W vs. LLM-Megawatt
[[../../people/klaus-mainzer.md|Prof. Mainzer]] ([[neuromorphic-chips-und-quantencomputer.md]]) argumentiert, dass das Gehirn mit ~20 W leistet, wofür LLM-Cluster Megawatt brauchen. AMDs Lunchbox-PC ist kein neuromorpher Chip — aber er schließt die Lücke teilweise: 235B-Parameter-Inferenz in einem Watt-Klassen-Gerät, nicht in einem Megawatt-Datacenter. Edge-Inferenz als Zwischenschritt zur neuromorphen Hardware.
### 3. [[../../people/aravind-srinivas.md|Aravinds]] Token Value per Watt per User
[[../../people/aravind-srinivas.md|Aravind Srinivas]] ([[../llm/ai-value-migration-orchestration.md]]) sagt: "The key metric is token value per watt per user." AMDs unified-memory-Ansatz maximiert genau das: lokale Inferenz ohne Netzwerk-Latenz, ohne Server-Kühlung, ohne Cloud-Overhead. 235B lokal = maximale Token-Density pro Watt. Die Wertschöpfung verschiebt sich von Cloud-Compute zur lokalen Hardware.
## Grenzen und offene Fragen
- **Keine Trainings-Hardware:** Strix Halo ist Inferenz-only. Training großer Modelle bleibt im Datacenter.
- **AMD-Benchmarks:** Die 3× RTX 5080-Behauptung stammt von AMD selbst. Unabhängige Bestätigung steht aus.
- **Modell-Quantisierung:** 235B läuft nur mit aggressiver Quantisierung (Q4 K_M oder niedriger) in 128 GB. Genauigkeitseinbußen möglich.
- **Verfügbarkeit:** Erste Systeme (ASUS ROG Flow Z13, HP ZBook Ultra G1a, GMKtec Evo-X2) verfügbar, aber Nischen-Markt.
## Verbindung zu anderen Wiki-Seiten
- **[Cloud-Exit & Lokale Überlegenheit](cloud-exit-and-local-superiority.md)** — Direkte Erweiterung: x86-Alternative zur Mac-only-Bewegung
- **[Neuromorphe Chips & Quantencomputer](neuromorphic-chips-und-quantencomputer.md)** — Mainzers Energie-Argument: Edge-Inferenz als Zwischenschritt
- **[AI Value Migration — Orchestration](../llm/ai-value-migration-orchestration.md)** — Aravinds Token/Watt/User-Metrik: AMD maximiert lokale Token-Density
- **[Aschenbrenner — Situational Awareness](../agi/aschenbrenner-situational-awareness.md)** — Compute-Skalierung ergänzt durch Edge-Inferenz
## Quellen
- [X-Post @0xJokker, 2026-06-16](../../../raw/xpost/2026-06-16_amd-ryzen-ai-edge-inferenz.md) — Auslösender Post
- [AMD Blog: Ryzen AI Max+ 395 Breakthrough AI Performance](https://www.amd.com/en/blogs/2025/amd-ryzen-ai-max-395-processor-breakthrough-ai-.html)
- [AIM Network YouTube: AMD Just Destroyed NVIDIA's RTX 5080 With a "Lunchbox"](https://www.youtube.com/watch?v=MeMc3WgmFJQ) — 05:09, 23K views, 2026-06-15
- [Pillitteri: Ryzen AI Max+ 395: Run a 235B Model Locally on a Mini PC](https://pasqualepillitteri.it/en/news/5058/ryzen-ai-max-395-235b-model-local-mini-pc)