- 23 new institutions pages (alby, anthropic, blink-wallet, carnegie-mellon, deepmind, epoch-ai, fincept, google-cloud, hugging-face, lightning-labs, linux-foundation, mit, moonshot-ai, mozilla-foundation, openai, openai-superalignment, openrouter, polymarket, stanford-ai-lab, tu-muenchen, xai, z-ai) - institutions-ingest-runner.md script - modified concepts (agi, hardware, llm) + tools pages - wiki-lint-report update
79 lines
No EOL
5.6 KiB
Markdown
79 lines
No EOL
5.6 KiB
Markdown
---
|
||
created: 2026-06-23
|
||
updated: 2026-06-23
|
||
sources:
|
||
- raw/xpost/2026-06-16_amd-ryzen-ai-edge-inferenz.md
|
||
related_raw:
|
||
- raw/xpost/2026-06-16_amd-ryzen-ai-edge-inferenz.md
|
||
tags: [concept, hardware, edge-inference, amd, ryzen-ai, strix-halo, unified-memory, local-ai, cloud-exit, qwen3-235b, lisa-su]
|
||
---
|
||
|
||
# Edge-Inferenz als Cloud-Alternative — AMDs Lunchbox-PC
|
||
|
||
> *"[[../../people/lisa-su.md|Lisa Su]] betritt die Bühne mit einem lunchbox-format PC — und führt ein 235-Milliarden-Parameter-Modell lokal aus. 128 GB unified memory, 3× schneller als eine RTX 5080. Das ist nicht die Zukunft — das ist heute."*
|
||
> — @0xJokker, X-Post, 2026-06-16
|
||
|
||
## Kernthese
|
||
|
||
**Edge-Inferenz hat 2026 ein neues Kapazitätslevel erreicht.** AMDs Ryzen AI Max+ 395 (Strix Halo) beweist, dass 235-Milliarden-Parameter-Modelle lokal auf einem lunchbox-format PC laufen — ohne Cloud, ohne Server-Rack, ohne GPU-Karte. Das bedeutet: die Cloud-Exit-These ist nicht mehr nur eine Mac-only-Bewegung (siehe [[cloud-exit-and-local-superiority.md]]), sondern erreicht jetzt die x86-Welt.
|
||
|
||
## Der Breakthrough: Unified Memory
|
||
|
||
Der entscheidende Architektur-Bruch ist **Unified Memory**: Erstmals in einer mainstream x86-Plattform teilen CPU und GPU **denselben Memory-Pool**.
|
||
|
||
| Eigenschaft | RTX 5090 | RTX 5080 | AMD Ryzen AI Max+ 395 |
|
||
|---|---|---|---|
|
||
| VRAM / Unified Memory | 32 GB GDDR7 | 16 GB GDDR7 | **128 GB unified** |
|
||
| Architecture | Separate GPU | Separate GPU | CPU+GPU shared pool |
|
||
| Data Movement | PCIe bottleneck | PCIe bottleneck | **Zero-copy** |
|
||
| Form Factor | Desktop GPU card | Desktop GPU card | **Lunchbox APU** |
|
||
| Price (System) | ~$1,999+ (GPU alone) | ~$1,199+ (GPU alone) | **$1,499 (complete PC)** |
|
||
|
||
- Bis zu 96 GB des 128 GB können als VRAM via Variable Graphics Memory (VGM) zugewiesen werden
|
||
- 256 GB/s Speicherbandbreite — genug für große LLM-Inferenz ohne Swapping
|
||
- Modelle wie Qwen3 235B, DeepSeek V3 laufen vollständig lokal
|
||
|
||
## Performance: 3× RTX 5080 bei 235B Inference
|
||
|
||
AMDs eigene Benchmarks (verifiziert via AIM Network YouTube + AMD Blog):
|
||
|
||
| Workload | AMD Ryzen AI Max+ 395 | Competition | Faktor |
|
||
|---|---|---|---|
|
||
| DeepSeek R1 235B Inference | 3× faster | RTX 5080 | **3.0×** |
|
||
| 7B/8B Model TTFT | — | Intel Core Ultra 258V | **9.1×** |
|
||
| 14B Model TTFT | — | Intel Core Ultra 258V | **12.2×** |
|
||
| 16B Token Throughput | — | Intel Arc 140V | **2.2×** |
|
||
|
||
TTFT = Time to First Token. Höherer Faktor bei größeren Modellen, weil Unified Memory das Model-Loading eliminisiert.
|
||
|
||
## Warum das relevant ist: Drei Anschlüsse ans Wiki
|
||
|
||
### 1. Cloud-Exit bekommt eine x86-Option
|
||
Bisher war die Cloud-Exit-These ([[cloud-exit-and-local-superiority.md]]) eine Mac-only-Bewegung: Apple M-Series mit 64-128 GB unified memory als alleinige Option. AMDs Strix Halo öffnet die x86-Welt: 128 GB unified memory, LM Studio Kompatibilität, $1.499 Einstiegspreis. Die Hardware-Tabelle in [[cloud-exit-and-local-superiority.md]] bekommt eine neue Zeile.
|
||
|
||
### 2. [[../../people/klaus-mainzer.md|Mainzers]] Energie-Argument: Gehirn 20W vs. LLM-Megawatt
|
||
[[../../people/klaus-mainzer.md|Prof. Mainzer]] ([[neuromorphic-chips-und-quantencomputer.md]]) argumentiert, dass das Gehirn mit ~20 W leistet, wofür LLM-Cluster Megawatt brauchen. AMDs Lunchbox-PC ist kein neuromorpher Chip — aber er schließt die Lücke teilweise: 235B-Parameter-Inferenz in einem Watt-Klassen-Gerät, nicht in einem Megawatt-Datacenter. Edge-Inferenz als Zwischenschritt zur neuromorphen Hardware.
|
||
|
||
### 3. [[../../people/aravind-srinivas.md|Aravinds]] Token Value per Watt per User
|
||
[[../../people/aravind-srinivas.md|Aravind Srinivas]] ([[ai-value-migration-orchestration.md]]) sagt: "The key metric is token value per watt per user." AMDs unified-memory-Ansatz maximiert genau das: lokale Inferenz ohne Netzwerk-Latenz, ohne Server-Kühlung, ohne Cloud-Overhead. 235B lokal = maximale Token-Density pro Watt. Die Wertschöpfung verschiebt sich von Cloud-Compute zur lokalen Hardware.
|
||
|
||
## Grenzen und offene Fragen
|
||
|
||
- **Keine Trainings-Hardware:** Strix Halo ist Inferenz-only. Training großer Modelle bleibt im Datacenter.
|
||
- **AMD-Benchmarks:** Die 3× RTX 5080-Behauptung stammt von AMD selbst. Unabhängige Bestätigung steht aus.
|
||
- **Modell-Quantisierung:** 235B läuft nur mit aggressiver Quantisierung (Q4 K_M oder niedriger) in 128 GB. Genauigkeitseinbußen möglich.
|
||
- **Verfügbarkeit:** Erste Systeme (ASUS ROG Flow Z13, HP ZBook Ultra G1a, GMKtec Evo-X2) verfügbar, aber Nischen-Markt.
|
||
|
||
## Verbindung zu anderen Wiki-Seiten
|
||
|
||
- **[Cloud-Exit & Lokale Überlegenheit](cloud-exit-and-local-superiority.md)** — Direkte Erweiterung: x86-Alternative zur Mac-only-Bewegung
|
||
- **[Neuromorphe Chips & Quantencomputer](neuromorphic-chips-und-quantencomputer.md)** — Mainzers Energie-Argument: Edge-Inferenz als Zwischenschritt
|
||
- **[AI Value Migration — Orchestration](../llm/ai-value-migration-orchestration.md)** — Aravinds Token/Watt/User-Metrik: AMD maximiert lokale Token-Density
|
||
- **[Aschenbrenner — Situational Awareness](../agi/aschenbrenner-situational-awareness.md)** — Compute-Skalierung ergänzt durch Edge-Inferenz
|
||
|
||
## Quellen
|
||
|
||
- [X-Post @0xJokker, 2026-06-16](../../../raw/xpost/2026-06-16_amd-ryzen-ai-edge-inferenz.md) — Auslösender Post
|
||
- [AMD Blog: Ryzen AI Max+ 395 Breakthrough AI Performance](https://www.amd.com/en/blogs/2025/amd-ryzen-ai-max-395-processor-breakthrough-ai-.html)
|
||
- [AIM Network YouTube: AMD Just Destroyed NVIDIA's RTX 5080 With a "Lunchbox"](https://www.youtube.com/watch?v=MeMc3WgmFJQ) — 05:09, 23K views, 2026-06-15
|
||
- [Pillitteri: Ryzen AI Max+ 395: Run a 235B Model Locally on a Mini PC](https://pasqualepillitteri.it/en/news/5058/ryzen-ai-max-395-235b-model-local-mini-pc) |