knowledge-base/raw/other/2026-08-26_herman-butlerbot-china-local-ai-box-zusammenfassung.md

35 lines
3.7 KiB
Markdown
Raw Normal View History

---
type: other
source_url: "telegram://-1003839640481/topic/1744#msg12770"
retrieved: 2026-08-26
title: "Herman (HermanButlerBot): Zusammenfassung Devsplainers 'China Is Coming for Your Local AI Box'"
author: "Herman (HermanButlerBot, Bot in OME-Gruppe)"
tags: [ome-chat, local-ai-box, xiaomi, alibaba, memory-bandwidth]
---
# Herman-Zusammenfassung: China Is Coming for Your Local AI Box
## Kontext
Im OME-Topic „Openclaw mit lokalen Modellen" (#1744) postete der Bot Herman (HermanButlerBot) am 2026-08-26 09:41 UTC eine eigene Zusammenfassung desselben Devsplainers-Videos ([raw/youtube/2026-08-26_devsplainers-china-local-ai-box.md](../youtube/2026-08-26_devsplainers-china-local-ai-box.md)), das Kai (@PWeber) als Link geteilt hatte (#12769). Erste Zustellung wurde abgeschnitten; vollständige Fassung kam als Recovered-Duplicate um 11:28 UTC (#12781) an. Herman verarbeitet offenbar den vollen Video-Inhalt und ergänzt damit den hier nur teilweise erfassten Transcript. Wörtliches Zitat der vollständigen Nachricht:
> **„China Is Coming for Your Local AI Box" — Devsplainers, ~9 Min**
>
> **Kernthese:** China hat bei lokaler KI schon Modelle (DeepSeek, Qwen, Kimi, GLM dominieren die Leaderboards) und Tools (DeepSeeks Coding-Harness, gratis). Jetzt kommt Schicht drei: die Hardware-Box unterm Schreibtisch. „Strike three."
>
> **Die Fakten:**
> - **Xiaomi AI Cube** (Chip „0100"): Speicher direkt auf dem Prozessor gestapelt (28.000 Verbindungen), 1,22 TB/s Bandbreite — aber nur am Stack selbst, Xiaomi-eigene Zahl. Prototyp ohne Preis/Termin, Chip für 2027 geplant. Bühnen-Demo: 3B-Modell @ 330 tok/s; größere Modelle sollen auf einem zweiten Chip mit bis zu 160 GB normalem RAM laufen.
> - **Alibaba**: behauptet 27B-Modell @ 30 tok/s komplett ohne GPU — stammt aber aus einer Folie für eine nicht kaufbare 64-Core-Konfiguration, ohne Angaben zu Quantisierung/Kontextlänge. Und der Chip hat eingebaute Matrix-Einheiten → „plain CPU" ist Overclaim.
> - **Warum Boxen überhaupt existieren:** Lokale Inferenz ist ein Memory-Bandwidth-Spiel, nicht Compute. DGX Spark: 1 Petaflop auf dem Sticker, aber 3 tok/s beim dichten 70B-Modell (273 GB/s vs. ~1792 GB/s einer RTX 5090).
> - **RAM-Krise als Treiber:** 128-GB-DDR5-Kit von $329 → $3.399. Eine $2.000-Strix-Halo-Box mit 128 GB ist aktuell der billigste Sitzplatz für 100+ GB Modell-RAM. Nvidia hat den Spark um $700 verteuert, Apple hat 256/512-GB-Mac-Studio-Configs eingestampft.
>
> **Ehrliche Kante des Videos:** Die chinesischen Boxen sind eine Watchlist ohne Preis, Datum oder Benchmark. Der eigentliche Knackpunkt ist Software — das Signal, auf das man achten muss, ist ein gemergter llama.cpp-/vLLM-Backend-Support. Ein Chip ohne Runtime-Support ist ein Ziegelstein.
>
> **Fazit/Advice:** Box nur kaufen für große MoE-Modelle, die sonst nirgendwo passen ($2k/128GB läuft GPT-OSS-120B @ 30+ tok/s). Passt dein Modell in 32 GB → normale Maschine, 6× schneller. Die BYD-Analogie (billig starten, belächelt werden, via Vertikalintegration gewinnen) greift erst halb: Modelle ✅, Chipdesign ✅ finanziert — aber die „Batterie" dieser Industrie ist Memory + Fertigung, und da sitzt TSMC/Samsung/SK Hynix/Micron im Boot. Xiaomis Memory-Stacking ist der Versuch, die Batterie selbst zu bauen. Wenn das 2027 mit echter Kapazität und Preis shipped, ist es keine Analogie mehr.
>
> Soll ich das tiefer aufbereiten (z.B. Vergleich mit deinem aktuellen lokalen Setup) oder als Briefing packen?
## Anmerkung
Second-hand-Quelle: Bots-Zusammenfassung, Zahlen nicht primär verifiziert, aber konsistent mit dem teilweise erfassten Original-Transcript und der Video-Beschreibung. Wird im Wiki als ergänzende Quelle mit ⚠️ geführt.