knowledge-base/wiki/concepts/hardware/edge-inference-als-cloud-alternative.md
Hector 0e02fdbd59 feat: people-pages for all TODO institutions markers
- Created 27 new people-pages for all TODO-marked persons
- Replaced all TODO: people-page markers with wiki-links in institutions
- Cross-referenced back to institutions from each people-page
- 0 TODO markers remaining

New people-pages:
  shayne-coplan, jim-zemlin, wang-changhu, yang-bingyang, demis-hassabis,
  clement-delangue, thomas-kurian, fei-fei-li, christopher-manning,
  sam-altman, ilya-sutskever, moritz-kaminski, elon-musk, nicolas-burtey,
  elizabeth-stark, olaoluwa-osuntokun, jan-leike, oren-etzioni,
  ali-farhadi, jaime-sevilla, max-tegmark, daniela-rus, jared-kaplan,
  alex-atallah, andrew-moore, tuomas-sandholm, mitchell-baker
2026-06-25 21:44:25 +02:00

5.6 KiB
Raw Permalink Blame History

created updated sources related_raw tags
2026-06-23 2026-06-23
raw/xpost/2026-06-16_amd-ryzen-ai-edge-inferenz.md
raw/xpost/2026-06-16_amd-ryzen-ai-edge-inferenz.md
concept
hardware
edge-inference
amd
ryzen-ai
strix-halo
unified-memory
local-ai
cloud-exit
qwen3-235b
lisa-su

Edge-Inferenz als Cloud-Alternative — AMDs Lunchbox-PC

"../../people/lisa-su.md betritt die Bühne mit einem lunchbox-format PC — und führt ein 235-Milliarden-Parameter-Modell lokal aus. 128 GB unified memory, 3× schneller als eine RTX 5080. Das ist nicht die Zukunft — das ist heute." — @0xJokker, X-Post, 2026-06-16

Kernthese

Edge-Inferenz hat 2026 ein neues Kapazitätslevel erreicht. AMDs Ryzen AI Max+ 395 (Strix Halo) beweist, dass 235-Milliarden-Parameter-Modelle lokal auf einem lunchbox-format PC laufen — ohne Cloud, ohne Server-Rack, ohne GPU-Karte. Das bedeutet: die Cloud-Exit-These ist nicht mehr nur eine Mac-only-Bewegung (siehe cloud-exit-and-local-superiority.md), sondern erreicht jetzt die x86-Welt.

Der Breakthrough: Unified Memory

Der entscheidende Architektur-Bruch ist Unified Memory: Erstmals in einer mainstream x86-Plattform teilen CPU und GPU denselben Memory-Pool.

Eigenschaft RTX 5090 RTX 5080 AMD Ryzen AI Max+ 395
VRAM / Unified Memory 32 GB GDDR7 16 GB GDDR7 128 GB unified
Architecture Separate GPU Separate GPU CPU+GPU shared pool
Data Movement PCIe bottleneck PCIe bottleneck Zero-copy
Form Factor Desktop GPU card Desktop GPU card Lunchbox APU
Price (System) ~$1,999+ (GPU alone) ~$1,199+ (GPU alone) $1,499 (complete PC)
  • Bis zu 96 GB des 128 GB können als VRAM via Variable Graphics Memory (VGM) zugewiesen werden
  • 256 GB/s Speicherbandbreite — genug für große LLM-Inferenz ohne Swapping
  • Modelle wie Qwen3 235B, DeepSeek V3 laufen vollständig lokal

Performance: 3× RTX 5080 bei 235B Inference

AMDs eigene Benchmarks (verifiziert via AIM Network YouTube + AMD Blog):

Workload AMD Ryzen AI Max+ 395 Competition Faktor
DeepSeek R1 235B Inference 3× faster RTX 5080 3.0×
7B/8B Model TTFT Intel Core Ultra 258V 9.1×
14B Model TTFT Intel Core Ultra 258V 12.2×
16B Token Throughput Intel Arc 140V 2.2×

TTFT = Time to First Token. Höherer Faktor bei größeren Modellen, weil Unified Memory das Model-Loading eliminisiert.

Warum das relevant ist: Drei Anschlüsse ans Wiki

1. Cloud-Exit bekommt eine x86-Option

Bisher war die Cloud-Exit-These (cloud-exit-and-local-superiority.md) eine Mac-only-Bewegung: Apple M-Series mit 64-128 GB unified memory als alleinige Option. AMDs Strix Halo öffnet die x86-Welt: 128 GB unified memory, LM Studio Kompatibilität, $1.499 Einstiegspreis. Die Hardware-Tabelle in cloud-exit-and-local-superiority.md bekommt eine neue Zeile.

2. ../../people/klaus-mainzer.md Energie-Argument: Gehirn 20W vs. LLM-Megawatt

../../people/klaus-mainzer.md (neuromorphic-chips-und-quantencomputer.md) argumentiert, dass das Gehirn mit ~20 W leistet, wofür LLM-Cluster Megawatt brauchen. AMDs Lunchbox-PC ist kein neuromorpher Chip — aber er schließt die Lücke teilweise: 235B-Parameter-Inferenz in einem Watt-Klassen-Gerät, nicht in einem Megawatt-Datacenter. Edge-Inferenz als Zwischenschritt zur neuromorphen Hardware.

3. ../../people/aravind-srinivas.md Token Value per Watt per User

../../people/aravind-srinivas.md (../llm/ai-value-migration-orchestration.md) sagt: "The key metric is token value per watt per user." AMDs unified-memory-Ansatz maximiert genau das: lokale Inferenz ohne Netzwerk-Latenz, ohne Server-Kühlung, ohne Cloud-Overhead. 235B lokal = maximale Token-Density pro Watt. Die Wertschöpfung verschiebt sich von Cloud-Compute zur lokalen Hardware.

Grenzen und offene Fragen

  • Keine Trainings-Hardware: Strix Halo ist Inferenz-only. Training großer Modelle bleibt im Datacenter.
  • AMD-Benchmarks: Die 3× RTX 5080-Behauptung stammt von AMD selbst. Unabhängige Bestätigung steht aus.
  • Modell-Quantisierung: 235B läuft nur mit aggressiver Quantisierung (Q4 K_M oder niedriger) in 128 GB. Genauigkeitseinbußen möglich.
  • Verfügbarkeit: Erste Systeme (ASUS ROG Flow Z13, HP ZBook Ultra G1a, GMKtec Evo-X2) verfügbar, aber Nischen-Markt.

Verbindung zu anderen Wiki-Seiten

Quellen