knowledge-base/wiki/concepts/hardware/china-local-ai-box.md

74 lines
7.8 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-08-26
updated: 2026-08-26
sources: [youtube/2026-08-26_devsplainers-china-local-ai-box.md, other/2026-08-26_herman-butlerbot-china-local-ai-box-zusammenfassung.md]
tags: [concept, hardware, local-ai-box, xiaomi, alibaba, risc-v, xuantie-c950, memory-bandwidth, unified-memory, dgx-spark, strix-halo, mac-studio, ddr5, dram-shortage, cloud-exit, china-vs-us-hardware]
---
# Local-AI-Box & Chinas Vorstoß — Xiaomi O100, Alibaba XuanTie C950
> **Kern:** Devsplainers argumentiert (26.08.2026), Xiaomi und Alibaba griffen mit zwei Ankündigungen im Abstand von sechs Tagen die letzte Schicht der lokalen KI an, die China noch nicht besitze: die Box unterm Schreibtisch. China dominiere bereits die lokalen Modell-Leaderboards (DeepSeek, Qwen, GLM/Kimi) und habe im August das Agent-Harness verschenkt ([[../llm/deepseek-v4-pro-ga-harness-open-source.md|DeepSeek-Agent-Harness]]); es fehle nur noch die Hardware. Entscheidende Kennzahl einer Local-AI-Box sei **Memory-Bandbreite**, nicht der Petaflop-Headline-Wert. ⚠️ Alle Zahlen sind Video-/Hersteller-Claims. Transcript nur teilweise erfasst (Anfang); Details unten durch die Herman-ButlerBot-Zusammenfassung aus der OME-Gruppe ergänzt ([[../../../raw/other/2026-08-26_herman-butlerbot-china-local-ai-box-zusammenfassung.md|Raw]]).
## Was ist eine Local-AI-Box?
Definition aus dem Video: ein kleiner Computer um einen großen Pool **Unified Memory** herum (CPU+GPU teilen sich einen Speicher), verkauft dafür, große LLMs auf eigener Hardware statt in der Cloud zu betreiben.
Drei Regeln des Videos:
1. **Kapazität** entscheidet, welches Modell überhaupt reinpasst
2. **Memory-Bandbreite** entscheidet, wie schnell das Modell schreibt (Tokens/s — die Geschwindigkeit, die man spürt)
3. **Compute** setzt vor allem Prefill (wie schnell der Prompt gelesen wird) — die Komponente, die lokale Inferenz kaum nutzt
Deshalb kann eine Box mit 128 GB und 273 GB/s ein Modell halten, das eine RTX 5090 (24 GB VRAM) nicht fasst — und trotzdem auf Tokens/s klar verlieren.
## Die DGX-Spark-Lektion: 1 Petaflop, <3 tok/s
Die Spark liefert die 1-Petaflop-Headline, aber Reviewer maßen (LMSYS, Llama 3.1 70B FP8 decode) unter **3 Tokens/s** bei einem dichten 70B-Modell. Bandbreiten-Vergleich aus dem Video: **273 GB/s (Spark) vs. ~1.792 GB/s (RTX 5090)** — deshalb verliert die kapazitätsstärkere Box beim Decoding. These: Der Petaflop-Wert misst Compute — beim lokalen Decoding liest das Modell pro Wort seine aktiven Gewichte aus dem Speicher; Bandbreite ist der Flaschenhals, nicht Rechenleistung.
## Wie die Box entstand: VRAM-Wand → Quantisierung → MoE
Vor drei Jahren bedeutete lokale KI Gaming-GPU, und die Wand war VRAM (24 GB = Modellsitz, alles Größere blieb in der Cloud). Zwei Dinge brachen die Wand: **Komprimierung/Quantisierung** (Modelle auf Bruchteil ihrer Größe) und **MoE-Architekturen** (hunderte Milliarden Parameter gespeichert, aber nur wenige pro Wort aktiv). Dadurch wurde Kapazität wichtiger als Rohgeschwindigkeit. Apple hatte „versehentlich" Jahre vorher die richtige Maschine gebaut: ein großer gemeinsamer Speicherpool für CPU und GPU — die Industrie folgte (DGX Spark, Strix-Halo-Mini-PCs, großes Mac Studio).
## RAM-Knappheit: Warum die ganze Box zum Schnäppchen wird
Zweiter Treiber des Formats: die **DRAM-/DDR5-Teuerung**. Konkrete Zahl aus dem Video: ein **128-GB-DDR5-Kit stieg von $329 auf $3.399** — dedicated Boxes verkaufen daher „128 GB und aufwärts an Modell-Speicher für den Preis eines nackten DDR5-Kits"; eine $2.000-Strix-Halo-Box ist aktuell der billigste Sitzplatz für 100+ GB Modell-RAM. Dazu Preisschübe bei den Incumbents: NVIDIA verteuerte den Spark um $700, Apple stampfte die **256-GB- und 512-GB-Konfigurationen des Mac Studio** ein (Quellen im Video: MacRumors, AppleInsider, 9to5Mac). Siehe auch [[cloud-exit-and-local-superiority.md]] (RAM als neue Währung).
## Chinas Zug: Xiaomi O100 und Alibaba XuanTie C950
Zwei Ankündigungen, sechs Tage auseinander (August 2026):
- **Xiaomi AI Cube / Chip „O100“:** Speicher direkt auf dem Prozessor gestapelt (~28.000 Verbindungen), **1,22 TB/s Bandbreite** — laut Video aber nur am Stack selbst messbar, Xiaomi-eigene Zahl ohne unabhängige Verifikation. Status: **Prototyp ohne Preis/Termin**, Chip für 2027 geplant. Bühnen-Demo: 3B-Modell @ 330 tok/s; größere Modelle sollen über einen zweiten Chip mit bis zu 160 GB normalem RAM laufen. (Coverage via Reuters, Gizmochina, VideoCardz, Notebookcheck.)
- **Alibaba XuanTie C950:** RISC-V-Chip, der laut Alibaba-Folie ein **27B-Modell mit 30 tok/s komplett ohne GPU** läuft — genau die Modellklasse, die lokal Referenz ist ([[../../concepts/llm/qwen3.8-27b-alibaba.md]]). ⚠️ Drei Caveats aus dem Video: Die Zahl stammt aus einer Folie für eine **nicht kaufbare 64-Core-Konfiguration**, ohne Angaben zu Quantisierung/Kontextlänge. Und: Der Chip hat **eingebaute Matrix-Einheiten** — „plain CPU ohne GPU" ist als Marketing-Sprech zu lesen.
These des Videos: China owns bereits Modelle (Leaderboards) und Harness (DeepSeek gab das Agent-Harness im August her) — die Box ist die letzte Schicht. Als Glaubwürdigkeitstest für solche Launch-Ankündigungen gilt: **Läuft ein llama.cpp- oder vLLM-Backend am Launch Day?** Wenn nicht, bleibt es eine Folien-Zahl.
## Gegenwehr: NVIDIA, AMD, Apple
Laut Video verteidigen die Incumbents über drei Hebel: **CUDA-Ökosystem** (Software-Lock-in), **Preis**, **Bandbreite** (Apple M5 Ultra mit 512 GB @ 1,2 TB/s, siehe [[apple-m6-m5-ultra-mac-mini-studio-update.md]]; NVIDIA mit DGX Station 748 GB, siehe [[nvidia-dgx-station-748gb.md]]).
## Die BYD-Frage: Überträgt sich das EV-Playbook auf Silicon?
Das Video prüft die explizite Analogie: Autobranche lachte über den Opening-Move chinesischer EVs — und verlor danach den Markt (BYD-Muster: billig starten, belächelt werden, via Vertikalintegration gewinnen). Das Fazit des Videos: Die Analogie greift **erst halb**. Modelle ✅ (China führt), Chipdesign ✅ finanziert — aber die „Batterie" dieser Industrie ist **Memory + Fertigung**, und da sitzen TSMC, Samsung, SK Hynix und Micron im Boot. Xiaomis Memory-Stacking ist genau der Versuch, diese „Batterie" selbst zu bauen. Shipped das 2027 mit echter Kapazität und Preis, ist es keine Analogie mehr.
## Kauf-Fazit-Rahmen (aus dem Video)
- **Box gewinnt**, wenn Kapazität zählt: nur kaufen für große MoE-Modelle, die sonst nirgendwo passen — Beispiel aus dem Video: $2k/128-GB-Box läuft **GPT-OSS-120B @ 30+ tok/s**
- **Passt das Modell in 32 GB → normale Maschine**, die laut Video rund **6× schneller** decodiert
- Kaufentscheidung hängt vom geplanten Modell ab — nicht vom Sticker-Spec
## Signal zum Beobachten
Der eigentliche Knackpunkt ist **Software**: Das Video nennt einen **gemergten llama.cpp-/vLLM-Backend-Support** als das Signal, auf das man achten muss. Ein Chip ohne Runtime-Support ist ein Ziegelstein. Bis dahin sind O100- und C950-Zahlen Hersteller-Claims auf einer Watchlist ohne Preis, Datum oder Benchmark.
## Verwandte Seiten
- [[cloud-exit-and-local-superiority.md]] — Cloud-Exit-Trend, RAM als neue Währung
- [[apple-m6-m5-ultra-mac-mini-studio-update.md]] — Apples Bandbreiten-/Kapazitäts-Antwort (M5 Ultra 1,2 TB/s)
- [[nvidia-dgx-station-748gb.md]] — NVIDIA-Desktop-Pendant (748 GB), DGX Spark als Einstieg
- [[edge-inference-als-cloud-alternative.md]] — AMD Strix Halo als x86-Klasse derselben Box-Idee
- [[../../concepts/llm/qwen3.8-27b-alibaba.md]] — die 27B-Referenzklasse, die Alibabas C950 laut Claim ohne GPU läuft
- [[../llm/deepseek-v4-pro-ga-harness-open-source.md]] — „China owns models + harness“-Baustein
## Quellen
- [Devsplainers: China Is Coming for Your Local AI Box](https://www.youtube.com/watch?v=rwlHx7Faf1E) — 09:15, 26.08.2026; Raw: [raw/youtube/2026-08-26_devsplainers-china-local-ai-box.md](../../../raw/youtube/2026-08-26_devsplainers-china-local-ai-box.md)