knowledge-base/wiki/concepts/hardware/china-local-ai-box.md

6.5 KiB

created updated sources tags
2026-08-26 2026-08-26
youtube/2026-08-26_devsplainers-china-local-ai-box.md
concept
hardware
local-ai-box
xiaomi
alibaba
risc-v
xuantie-c950
memory-bandwidth
unified-memory
dgx-spark
strix-halo
mac-studio
ddr5
dram-shortage
cloud-exit
china-vs-us-hardware

Local-AI-Box & Chinas Vorstoß — Xiaomi O100, Alibaba XuanTie C950

Kern: Devsplainers argumentiert (26.08.2026), Xiaomi und Alibaba griffen mit zwei Ankündigungen im Abstand von sechs Tagen die letzte Schicht der lokalen KI an, die China noch nicht besitze: die Box unterm Schreibtisch. China dominiere bereits die lokalen Modell-Leaderboards (DeepSeek, Qwen, GLM/Kimi) und habe im August das Agent-Harness verschenkt (../llm/deepseek-v4-pro-ga-harness-open-source.md); es fehle nur noch die Hardware. Entscheidende Kennzahl einer Local-AI-Box sei Memory-Bandbreite, nicht der Petaflop-Headline-Wert. ⚠️ Alle Zahlen sind Video-/Hersteller-Claims; Transcript nur teilweise erfasst (Anfang), Rest aus Beschreibung/Bullets.

Was ist eine Local-AI-Box?

Definition aus dem Video: ein kleiner Computer um einen großen Pool Unified Memory herum (CPU+GPU teilen sich einen Speicher), verkauft dafür, große LLMs auf eigener Hardware statt in der Cloud zu betreiben.

Drei Regeln des Videos:

  1. Kapazität entscheidet, welches Modell überhaupt reinpasst
  2. Memory-Bandbreite entscheidet, wie schnell das Modell schreibt (Tokens/s — die Geschwindigkeit, die man spürt)
  3. Compute setzt vor allem Prefill (wie schnell der Prompt gelesen wird) — die Komponente, die lokale Inferenz kaum nutzt

Deshalb kann eine Box mit 128 GB und 273 GB/s ein Modell halten, das eine RTX 5090 (24 GB VRAM) nicht fasst — und trotzdem auf Tokens/s klar verlieren.

Die DGX-Spark-Lektion: 1 Petaflop, <3 tok/s

Die Spark liefert die 1-Petaflop-Headline, aber Reviewer maßen (LMSYS, Llama 3.1 70B FP8 decode) unter 3 Tokens/s bei einem dichten 70B-Modell. These: Der Petaflop-Wert misst Compute — beim lokalen Decoding liest das Modell pro Wort seine aktiven Gewichte aus dem Speicher; Bandbreite ist der Flaschenhals, nicht Rechenleistung.

Wie die Box entstand: VRAM-Wand → Quantisierung → MoE

Vor drei Jahren bedeutete lokale KI Gaming-GPU, und die Wand war VRAM (24 GB = Modellsitz, alles Größere blieb in der Cloud). Zwei Dinge brachen die Wand: Komprimierung/Quantisierung (Modelle auf Bruchteil ihrer Größe) und MoE-Architekturen (hunderte Milliarden Parameter gespeichert, aber nur wenige pro Wort aktiv). Dadurch wurde Kapazität wichtiger als Rohgeschwindigkeit. Apple hatte „versehentlich" Jahre vorher die richtige Maschine gebaut: ein großer gemeinsamer Speicherpool für CPU und GPU — die Industrie folgte (DGX Spark, Strix-Halo-Mini-PCs, großes Mac Studio).

RAM-Knappheit: Warum die ganze Box zum Schnäppchen wird

Zweiter Treiber des Formats: die DRAM-/DDR5-Teuerung. Dedicated Boxes verkaufen „128 GB und aufwärts an Modell-Speicher für den Preis eines nackten DDR5-Kits"; ein $2.000-Mini-PC ist laut Video der „cheap seat". Gleichzeitig berichtet das Video, Apple habe die 512-GB- und 256-GB-Konfigurationen des Mac Studio entfernt (Quellen: MacRumors, AppleInsider, 9to5Mac) — passt zur Knappheitslogik: Speicher ist das knappe Gut, nicht FLOPS. Siehe auch cloud-exit-and-local-superiority.md (RAM als neue Währung).

Chinas Zug: Xiaomi O100 und Alibaba XuanTie C950

Zwei Ankündigungen, sechs Tage auseinander (August 2026):

  • Xiaomi AI Cube / „O100": dedizierte AI-Box mit 1,22 TB/s Near-Memory-Bandwidth — mehr als das Vierfache der 273-GB/s-Klasse; vorgestellt auf Xiaomis Chip-Event (XRing-Umfeld; Coverage via Reuters, Gizmochina, VideoCardz, Notebookcheck).
  • Alibaba XuanTie C950: RISC-V-Chip, der laut Alibaba-Folie ein 27B-Modell mit 30 tok/s komplett ohne GPU läuft — genau die Modellklasse, die lokal Referenz ist (../../concepts/llm/qwen3.8-27b-alibaba.md).

These des Videos: China owns bereits Modelle (Leaderboards) und Harness (DeepSeek gab das Agent-Harness im August her) — die Box ist die letzte Schicht. Als Glaubwürdigkeitstest für solche Launch-Ankündigungen gilt: Läuft ein llama.cpp- oder vLLM-Backend am Launch Day? Wenn nicht, bleibt es eine Folien-Zahl.

Gegenwehr: NVIDIA, AMD, Apple

Laut Video verteidigen die Incumbents über drei Hebel: CUDA-Ökosystem (Software-Lock-in), Preis, Bandbreite (Apple M5 Ultra mit 512 GB @ 1,2 TB/s, siehe apple-m6-m5-ultra-mac-mini-studio-update.md; NVIDIA mit DGX Station 748 GB, siehe nvidia-dgx-station-748gb.md).

Die BYD-Frage: Überträgt sich das EV-Playbook auf Silicon?

Das Video stellt die explizite Frage, ob sich die BYD-Dynamik wiederholt: Autobranche lachte über den Opening-Move chinesischer EVs — und verlor danach den Markt. Ob das Playbook (Preisdruck, Volumen, vertikale Integration) auf AI-Hardware übertragbar ist, lässt das Video offen; es benennt es als das Szenario, gegen das NVIDIA/AMD/Apple jetzt antreten müssen.

Kauf-Fazit-Rahmen (aus dem Video)

  • Box gewinnt, wenn Kapazität zählt: sehr große/MoE-Modelle lokal, Multimodell-Betrieb, RAM-Preis-Argument
  • RTX 5090 gewinnt, wenn Decoding-Geschwindigkeit bei dichten Modellen zählt (Bandbreiten-Vorteil der GPU-Klasse)
  • Kaufentscheidung hängt vom geplanten Modell ab — nicht vom Sticker-Spec

Signal zum Beobachten

Das Video nennt als nächsten Prüfstein: ob die chinesischen Boxen mit funktionierenden llama.cpp/vLLM-Backends launchen und ob unabhängige Benchmarks die Bandbreiten-Ansagen bestätigen. Bis dahin sind O100- und C950-Zahlen Hersteller-Claims.

Verwandte Seiten

Quellen