knowledge-base/raw/other/2026-08-26_herman-butlerbot-china-local-ai-box-zusammenfassung.md

34 lines
3.7 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
type: other
source_url: "telegram://-1003839640481/topic/1744#msg12770"
retrieved: 2026-08-26
title: "Herman (HermanButlerBot): Zusammenfassung Devsplainers 'China Is Coming for Your Local AI Box'"
author: "Herman (HermanButlerBot, Bot in OME-Gruppe)"
tags: [ome-chat, local-ai-box, xiaomi, alibaba, memory-bandwidth]
---
# Herman-Zusammenfassung: China Is Coming for Your Local AI Box
## Kontext
Im OME-Topic „Openclaw mit lokalen Modellen" (#1744) postete der Bot Herman (HermanButlerBot) am 2026-08-26 09:41 UTC eine eigene Zusammenfassung desselben Devsplainers-Videos ([raw/youtube/2026-08-26_devsplainers-china-local-ai-box.md](../youtube/2026-08-26_devsplainers-china-local-ai-box.md)), das Kai (@PWeber) als Link geteilt hatte (#12769). Erste Zustellung wurde abgeschnitten; vollständige Fassung kam als Recovered-Duplicate um 11:28 UTC (#12781) an. Herman verarbeitet offenbar den vollen Video-Inhalt und ergänzt damit den hier nur teilweise erfassten Transcript. Wörtliches Zitat der vollständigen Nachricht:
> **„China Is Coming for Your Local AI Box" — Devsplainers, ~9 Min**
>
> **Kernthese:** China hat bei lokaler KI schon Modelle (DeepSeek, Qwen, Kimi, GLM dominieren die Leaderboards) und Tools (DeepSeeks Coding-Harness, gratis). Jetzt kommt Schicht drei: die Hardware-Box unterm Schreibtisch. „Strike three."
>
> **Die Fakten:**
> - **Xiaomi AI Cube** (Chip „0100"): Speicher direkt auf dem Prozessor gestapelt (28.000 Verbindungen), 1,22 TB/s Bandbreite — aber nur am Stack selbst, Xiaomi-eigene Zahl. Prototyp ohne Preis/Termin, Chip für 2027 geplant. Bühnen-Demo: 3B-Modell @ 330 tok/s; größere Modelle sollen auf einem zweiten Chip mit bis zu 160 GB normalem RAM laufen.
> - **Alibaba**: behauptet 27B-Modell @ 30 tok/s komplett ohne GPU — stammt aber aus einer Folie für eine nicht kaufbare 64-Core-Konfiguration, ohne Angaben zu Quantisierung/Kontextlänge. Und der Chip hat eingebaute Matrix-Einheiten → „plain CPU" ist Overclaim.
> - **Warum Boxen überhaupt existieren:** Lokale Inferenz ist ein Memory-Bandwidth-Spiel, nicht Compute. DGX Spark: 1 Petaflop auf dem Sticker, aber 3 tok/s beim dichten 70B-Modell (273 GB/s vs. ~1792 GB/s einer RTX 5090).
> - **RAM-Krise als Treiber:** 128-GB-DDR5-Kit von $329 → $3.399. Eine $2.000-Strix-Halo-Box mit 128 GB ist aktuell der billigste Sitzplatz für 100+ GB Modell-RAM. Nvidia hat den Spark um $700 verteuert, Apple hat 256/512-GB-Mac-Studio-Configs eingestampft.
>
> **Ehrliche Kante des Videos:** Die chinesischen Boxen sind eine Watchlist ohne Preis, Datum oder Benchmark. Der eigentliche Knackpunkt ist Software — das Signal, auf das man achten muss, ist ein gemergter llama.cpp-/vLLM-Backend-Support. Ein Chip ohne Runtime-Support ist ein Ziegelstein.
>
> **Fazit/Advice:** Box nur kaufen für große MoE-Modelle, die sonst nirgendwo passen ($2k/128GB läuft GPT-OSS-120B @ 30+ tok/s). Passt dein Modell in 32 GB → normale Maschine, 6× schneller. Die BYD-Analogie (billig starten, belächelt werden, via Vertikalintegration gewinnen) greift erst halb: Modelle ✅, Chipdesign ✅ finanziert — aber die „Batterie" dieser Industrie ist Memory + Fertigung, und da sitzt TSMC/Samsung/SK Hynix/Micron im Boot. Xiaomis Memory-Stacking ist der Versuch, die Batterie selbst zu bauen. Wenn das 2027 mit echter Kapazität und Preis shipped, ist es keine Analogie mehr.
>
> Soll ich das tiefer aufbereiten (z.B. Vergleich mit deinem aktuellen lokalen Setup) oder als Briefing packen?
## Anmerkung
Second-hand-Quelle: Bots-Zusammenfassung, Zahlen nicht primär verifiziert, aber konsistent mit dem teilweise erfassten Original-Transcript und der Video-Beschreibung. Wird im Wiki als ergänzende Quelle mit ⚠️ geführt.