knowledge-base/raw/other/2026-08-26_herman-butlerbot-china-local-ai-box-zusammenfassung.md

3.7 KiB
Raw Permalink Blame History

type source_url retrieved title author tags
other telegram://-1003839640481/topic/1744#msg12770 2026-08-26 Herman (HermanButlerBot): Zusammenfassung Devsplainers 'China Is Coming for Your Local AI Box' Herman (HermanButlerBot, Bot in OME-Gruppe)
ome-chat
local-ai-box
xiaomi
alibaba
memory-bandwidth

Herman-Zusammenfassung: China Is Coming for Your Local AI Box

Kontext

Im OME-Topic „Openclaw mit lokalen Modellen" (#1744) postete der Bot Herman (HermanButlerBot) am 2026-08-26 09:41 UTC eine eigene Zusammenfassung desselben Devsplainers-Videos (raw/youtube/2026-08-26_devsplainers-china-local-ai-box.md), das Kai (@PWeber) als Link geteilt hatte (#12769). Erste Zustellung wurde abgeschnitten; vollständige Fassung kam als Recovered-Duplicate um 11:28 UTC (#12781) an. Herman verarbeitet offenbar den vollen Video-Inhalt und ergänzt damit den hier nur teilweise erfassten Transcript. Wörtliches Zitat der vollständigen Nachricht:

„China Is Coming for Your Local AI Box" — Devsplainers, ~9 Min

Kernthese: China hat bei lokaler KI schon Modelle (DeepSeek, Qwen, Kimi, GLM dominieren die Leaderboards) und Tools (DeepSeeks Coding-Harness, gratis). Jetzt kommt Schicht drei: die Hardware-Box unterm Schreibtisch. „Strike three."

Die Fakten:

  • Xiaomi AI Cube (Chip „0100"): Speicher direkt auf dem Prozessor gestapelt (28.000 Verbindungen), 1,22 TB/s Bandbreite — aber nur am Stack selbst, Xiaomi-eigene Zahl. Prototyp ohne Preis/Termin, Chip für 2027 geplant. Bühnen-Demo: 3B-Modell @ 330 tok/s; größere Modelle sollen auf einem zweiten Chip mit bis zu 160 GB normalem RAM laufen.
  • Alibaba: behauptet 27B-Modell @ 30 tok/s komplett ohne GPU — stammt aber aus einer Folie für eine nicht kaufbare 64-Core-Konfiguration, ohne Angaben zu Quantisierung/Kontextlänge. Und der Chip hat eingebaute Matrix-Einheiten → „plain CPU" ist Overclaim.
  • Warum Boxen überhaupt existieren: Lokale Inferenz ist ein Memory-Bandwidth-Spiel, nicht Compute. DGX Spark: 1 Petaflop auf dem Sticker, aber 3 tok/s beim dichten 70B-Modell (273 GB/s vs. ~1792 GB/s einer RTX 5090).
  • RAM-Krise als Treiber: 128-GB-DDR5-Kit von $329 → $3.399. Eine $2.000-Strix-Halo-Box mit 128 GB ist aktuell der billigste Sitzplatz für 100+ GB Modell-RAM. Nvidia hat den Spark um $700 verteuert, Apple hat 256/512-GB-Mac-Studio-Configs eingestampft.

Ehrliche Kante des Videos: Die chinesischen Boxen sind eine Watchlist ohne Preis, Datum oder Benchmark. Der eigentliche Knackpunkt ist Software — das Signal, auf das man achten muss, ist ein gemergter llama.cpp-/vLLM-Backend-Support. Ein Chip ohne Runtime-Support ist ein Ziegelstein.

Fazit/Advice: Box nur kaufen für große MoE-Modelle, die sonst nirgendwo passen ($2k/128GB läuft GPT-OSS-120B @ 30+ tok/s). Passt dein Modell in 32 GB → normale Maschine, 6× schneller. Die BYD-Analogie (billig starten, belächelt werden, via Vertikalintegration gewinnen) greift erst halb: Modelle , Chipdesign finanziert — aber die „Batterie" dieser Industrie ist Memory + Fertigung, und da sitzt TSMC/Samsung/SK Hynix/Micron im Boot. Xiaomis Memory-Stacking ist der Versuch, die Batterie selbst zu bauen. Wenn das 2027 mit echter Kapazität und Preis shipped, ist es keine Analogie mehr.

Soll ich das tiefer aufbereiten (z.B. Vergleich mit deinem aktuellen lokalen Setup) oder als Briefing packen?

Anmerkung

Second-hand-Quelle: Bots-Zusammenfassung, Zahlen nicht primär verifiziert, aber konsistent mit dem teilweise erfassten Original-Transcript und der Video-Beschreibung. Wird im Wiki als ergänzende Quelle mit ⚠️ geführt.