75 lines
8.1 KiB
Markdown
75 lines
8.1 KiB
Markdown
---
|
||
created: 2026-08-26
|
||
updated: 2026-08-26
|
||
sources: [youtube/2026-08-26_devsplainers-china-local-ai-box.md, other/2026-08-26_herman-butlerbot-china-local-ai-box-zusammenfassung.md]
|
||
tags: [concept, hardware, local-ai-box, xiaomi, alibaba, risc-v, xuantie-c950, memory-bandwidth, unified-memory, dgx-spark, strix-halo, mac-studio, ddr5, dram-shortage, cloud-exit, china-vs-us-hardware]
|
||
---
|
||
|
||
# Local-AI-Box & Chinas Vorstoß — Xiaomi O100, Alibaba XuanTie C950
|
||
|
||
> **Kern:** Devsplainers argumentiert (26.08.2026), Xiaomi und Alibaba griffen mit zwei Ankündigungen im Abstand von sechs Tagen die letzte Schicht der lokalen KI an, die China noch nicht besitze: die Box unterm Schreibtisch. China dominiere bereits die lokalen Modell-Leaderboards (DeepSeek, Qwen, GLM/Kimi) und habe im August das Agent-Harness verschenkt ([[../llm/deepseek-v4-pro-ga-harness-open-source.md|DeepSeek-Agent-Harness]]); es fehle nur noch die Hardware. Entscheidende Kennzahl einer Local-AI-Box sei **Memory-Bandbreite**, nicht der Petaflop-Headline-Wert. ⚠️ Alle Zahlen sind Video-/Hersteller-Claims. Transcript nur teilweise erfasst (Anfang); Details unten durch die Herman-ButlerBot-Zusammenfassung aus der OME-Gruppe ergänzt ([[../../../raw/other/2026-08-26_herman-butlerbot-china-local-ai-box-zusammenfassung.md|Raw]]).
|
||
|
||
## Was ist eine Local-AI-Box?
|
||
|
||
Definition aus dem Video: ein kleiner Computer um einen großen Pool **Unified Memory** herum (CPU+GPU teilen sich einen Speicher), verkauft dafür, große LLMs auf eigener Hardware statt in der Cloud zu betreiben.
|
||
|
||
Drei Regeln des Videos:
|
||
|
||
1. **Kapazität** entscheidet, welches Modell überhaupt reinpasst
|
||
2. **Memory-Bandbreite** entscheidet, wie schnell das Modell schreibt (Tokens/s — die Geschwindigkeit, die man spürt)
|
||
3. **Compute** setzt vor allem Prefill (wie schnell der Prompt gelesen wird) — die Komponente, die lokale Inferenz kaum nutzt
|
||
|
||
Deshalb kann eine Box mit 128 GB und 273 GB/s ein Modell halten, das eine RTX 5090 (24 GB VRAM) nicht fasst — und trotzdem auf Tokens/s klar verlieren.
|
||
|
||
## Die DGX-Spark-Lektion: 1 Petaflop, <3 tok/s
|
||
|
||
Die Spark liefert die 1-Petaflop-Headline, aber Reviewer maßen (LMSYS, Llama 3.1 70B FP8 decode) unter **3 Tokens/s** bei einem dichten 70B-Modell. Bandbreiten-Vergleich aus dem Video: **273 GB/s (Spark) vs. ~1.792 GB/s (RTX 5090)** — deshalb verliert die kapazitätsstärkere Box beim Decoding. These: Der Petaflop-Wert misst Compute — beim lokalen Decoding liest das Modell pro Wort seine aktiven Gewichte aus dem Speicher; Bandbreite ist der Flaschenhals, nicht Rechenleistung.
|
||
|
||
## Wie die Box entstand: VRAM-Wand → Quantisierung → MoE
|
||
|
||
Vor drei Jahren bedeutete lokale KI Gaming-GPU, und die Wand war VRAM (24 GB = Modellsitz, alles Größere blieb in der Cloud). Zwei Dinge brachen die Wand: **Komprimierung/Quantisierung** (Modelle auf Bruchteil ihrer Größe) und **MoE-Architekturen** (hunderte Milliarden Parameter gespeichert, aber nur wenige pro Wort aktiv). Dadurch wurde Kapazität wichtiger als Rohgeschwindigkeit. Apple hatte „versehentlich" Jahre vorher die richtige Maschine gebaut: ein großer gemeinsamer Speicherpool für CPU und GPU — die Industrie folgte (DGX Spark, Strix-Halo-Mini-PCs, großes Mac Studio).
|
||
|
||
## RAM-Knappheit: Warum die ganze Box zum Schnäppchen wird
|
||
|
||
Zweiter Treiber des Formats: die **DRAM-/DDR5-Teuerung**. Konkrete Zahl aus dem Video: ein **128-GB-DDR5-Kit stieg von $329 auf $3.399** — dedicated Boxes verkaufen daher „128 GB und aufwärts an Modell-Speicher für den Preis eines nackten DDR5-Kits"; eine $2.000-Strix-Halo-Box ist aktuell der billigste Sitzplatz für 100+ GB Modell-RAM. Dazu Preisschübe bei den Incumbents: NVIDIA verteuerte den Spark um $700, Apple stampfte die **256-GB- und 512-GB-Konfigurationen des Mac Studio** ein (Quellen im Video: MacRumors, AppleInsider, 9to5Mac). Siehe auch [[cloud-exit-and-local-superiority.md]] (RAM als neue Währung).
|
||
|
||
## Chinas Zug: Xiaomi O100 und Alibaba XuanTie C950
|
||
|
||
Zwei Ankündigungen, sechs Tage auseinander (August 2026):
|
||
|
||
- **Xiaomi AI Cube / Chip „O100“:** Speicher direkt auf dem Prozessor gestapelt (~28.000 Verbindungen), **1,22 TB/s Bandbreite** — laut Video aber nur am Stack selbst messbar, Xiaomi-eigene Zahl ohne unabhängige Verifikation. Status: **Prototyp ohne Preis/Termin**, Chip für 2027 geplant. Bühnen-Demo: 3B-Modell @ 330 tok/s; größere Modelle sollen über einen zweiten Chip mit bis zu 160 GB normalem RAM laufen. (Coverage via Reuters, Gizmochina, VideoCardz, Notebookcheck.)
|
||
- **Alibaba XuanTie C950:** RISC-V-Chip, der laut Alibaba-Folie ein **27B-Modell mit 30 tok/s komplett ohne GPU** läuft — genau die Modellklasse, die lokal Referenz ist ([[../../concepts/llm/qwen3.8-27b-alibaba.md]]). ⚠️ Drei Caveats aus dem Video: Die Zahl stammt aus einer Folie für eine **nicht kaufbare 64-Core-Konfiguration**, ohne Angaben zu Quantisierung/Kontextlänge. Und: Der Chip hat **eingebaute Matrix-Einheiten** — „plain CPU ohne GPU" ist als Marketing-Sprech zu lesen.
|
||
|
||
These des Videos: China owns bereits Modelle (Leaderboards) und Harness (DeepSeek gab das Agent-Harness im August her) — die Box ist die letzte Schicht. Als Glaubwürdigkeitstest für solche Launch-Ankündigungen gilt: **Läuft ein llama.cpp- oder vLLM-Backend am Launch Day?** Wenn nicht, bleibt es eine Folien-Zahl.
|
||
|
||
## Gegenwehr: NVIDIA, AMD, Apple
|
||
|
||
Laut Video verteidigen die Incumbents über drei Hebel: **CUDA-Ökosystem** (Software-Lock-in), **Preis**, **Bandbreite** (Apple M5 Ultra mit 512 GB @ 1,2 TB/s, siehe [[apple-m6-m5-ultra-mac-mini-studio-update.md]]; NVIDIA mit DGX Station 748 GB, siehe [[nvidia-dgx-station-748gb.md]]).
|
||
|
||
## Die BYD-Frage: Überträgt sich das EV-Playbook auf Silicon?
|
||
|
||
Das Video prüft die explizite Analogie: Autobranche lachte über den Opening-Move chinesischer EVs — und verlor danach den Markt (BYD-Muster: billig starten, belächelt werden, via Vertikalintegration gewinnen). Das Fazit des Videos: Die Analogie greift **erst halb**. Modelle ✅ (China führt), Chipdesign ✅ finanziert — aber die „Batterie" dieser Industrie ist **Memory + Fertigung**, und da sitzen TSMC, Samsung, SK Hynix und Micron im Boot. Xiaomis Memory-Stacking ist genau der Versuch, diese „Batterie" selbst zu bauen. Shipped das 2027 mit echter Kapazität und Preis, ist es keine Analogie mehr.
|
||
|
||
## Kauf-Fazit-Rahmen (aus dem Video)
|
||
|
||
- **Box gewinnt**, wenn Kapazität zählt: nur kaufen für große MoE-Modelle, die sonst nirgendwo passen — Beispiel aus dem Video: $2k/128-GB-Box läuft **GPT-OSS-120B @ 30+ tok/s**
|
||
- **Passt das Modell in 32 GB → normale Maschine**, die laut Video rund **6× schneller** decodiert
|
||
- Kaufentscheidung hängt vom geplanten Modell ab — nicht vom Sticker-Spec
|
||
|
||
## Signal zum Beobachten
|
||
|
||
Der eigentliche Knackpunkt ist **Software**: Das Video nennt einen **gemergten llama.cpp-/vLLM-Backend-Support** als das Signal, auf das man achten muss. Ein Chip ohne Runtime-Support ist ein Ziegelstein. Bis dahin sind O100- und C950-Zahlen Hersteller-Claims auf einer Watchlist ohne Preis, Datum oder Benchmark.
|
||
|
||
## Verwandte Seiten
|
||
|
||
- [[cloud-exit-and-local-superiority.md]] — Cloud-Exit-Trend, RAM als neue Währung
|
||
- [[apple-m6-m5-ultra-mac-mini-studio-update.md]] — Apples Bandbreiten-/Kapazitäts-Antwort (M5 Ultra 1,2 TB/s)
|
||
- [[nvidia-dgx-station-748gb.md]] — NVIDIA-Desktop-Pendant (748 GB), DGX Spark als Einstieg
|
||
- [[edge-inference-als-cloud-alternative.md]] — AMD Strix Halo als x86-Klasse derselben Box-Idee
|
||
- [[../../concepts/llm/qwen3.8-27b-alibaba.md]] — die 27B-Referenzklasse, die Alibabas C950 laut Claim ohne GPU läuft
|
||
- [[../llm/deepseek-v4-pro-ga-harness-open-source.md]] — „China owns models + harness“-Baustein
|
||
- [[ai-infrastruktur-custom-silicon.md]] — dieselbe Bandbreiten-/Speicherlogik auf der US-Infrastruktur-Seite (AI Infrastructure Summit Tag 2: Custom Silicon, Edge-Racks, **DDR4 und DDR5 im selben System**) und der RISC-V-Pfad bei SiFive
|
||
|
||
## Quellen
|
||
|
||
- [Devsplainers: China Is Coming for Your Local AI Box](https://www.youtube.com/watch?v=rwlHx7Faf1E) — 09:15, 26.08.2026; Raw: [raw/youtube/2026-08-26_devsplainers-china-local-ai-box.md](../../../raw/youtube/2026-08-26_devsplainers-china-local-ai-box.md)
|