ingest(other): herman summary supplement china local ai box

This commit is contained in:
Hector 2026-08-26 13:41:27 +02:00
parent cb58f5910e
commit ceffe386d2
5 changed files with 49 additions and 12 deletions

View file

@ -0,0 +1,34 @@
---
type: other
source_url: "telegram://-1003839640481/topic/1744#msg12770"
retrieved: 2026-08-26
title: "Herman (HermanButlerBot): Zusammenfassung Devsplainers 'China Is Coming for Your Local AI Box'"
author: "Herman (HermanButlerBot, Bot in OME-Gruppe)"
tags: [ome-chat, local-ai-box, xiaomi, alibaba, memory-bandwidth]
---
# Herman-Zusammenfassung: China Is Coming for Your Local AI Box
## Kontext
Im OME-Topic „Openclaw mit lokalen Modellen" (#1744) postete der Bot Herman (HermanButlerBot) am 2026-08-26 09:41 UTC eine eigene Zusammenfassung desselben Devsplainers-Videos ([raw/youtube/2026-08-26_devsplainers-china-local-ai-box.md](../youtube/2026-08-26_devsplainers-china-local-ai-box.md)), das Kai (@PWeber) als Link geteilt hatte (#12769). Erste Zustellung wurde abgeschnitten; vollständige Fassung kam als Recovered-Duplicate um 11:28 UTC (#12781) an. Herman verarbeitet offenbar den vollen Video-Inhalt und ergänzt damit den hier nur teilweise erfassten Transcript. Wörtliches Zitat der vollständigen Nachricht:
> **„China Is Coming for Your Local AI Box" — Devsplainers, ~9 Min**
>
> **Kernthese:** China hat bei lokaler KI schon Modelle (DeepSeek, Qwen, Kimi, GLM dominieren die Leaderboards) und Tools (DeepSeeks Coding-Harness, gratis). Jetzt kommt Schicht drei: die Hardware-Box unterm Schreibtisch. „Strike three."
>
> **Die Fakten:**
> - **Xiaomi AI Cube** (Chip „0100"): Speicher direkt auf dem Prozessor gestapelt (28.000 Verbindungen), 1,22 TB/s Bandbreite — aber nur am Stack selbst, Xiaomi-eigene Zahl. Prototyp ohne Preis/Termin, Chip für 2027 geplant. Bühnen-Demo: 3B-Modell @ 330 tok/s; größere Modelle sollen auf einem zweiten Chip mit bis zu 160 GB normalem RAM laufen.
> - **Alibaba**: behauptet 27B-Modell @ 30 tok/s komplett ohne GPU — stammt aber aus einer Folie für eine nicht kaufbare 64-Core-Konfiguration, ohne Angaben zu Quantisierung/Kontextlänge. Und der Chip hat eingebaute Matrix-Einheiten → „plain CPU" ist Overclaim.
> - **Warum Boxen überhaupt existieren:** Lokale Inferenz ist ein Memory-Bandwidth-Spiel, nicht Compute. DGX Spark: 1 Petaflop auf dem Sticker, aber 3 tok/s beim dichten 70B-Modell (273 GB/s vs. ~1792 GB/s einer RTX 5090).
> - **RAM-Krise als Treiber:** 128-GB-DDR5-Kit von $329 → $3.399. Eine $2.000-Strix-Halo-Box mit 128 GB ist aktuell der billigste Sitzplatz für 100+ GB Modell-RAM. Nvidia hat den Spark um $700 verteuert, Apple hat 256/512-GB-Mac-Studio-Configs eingestampft.
>
> **Ehrliche Kante des Videos:** Die chinesischen Boxen sind eine Watchlist ohne Preis, Datum oder Benchmark. Der eigentliche Knackpunkt ist Software — das Signal, auf das man achten muss, ist ein gemergter llama.cpp-/vLLM-Backend-Support. Ein Chip ohne Runtime-Support ist ein Ziegelstein.
>
> **Fazit/Advice:** Box nur kaufen für große MoE-Modelle, die sonst nirgendwo passen ($2k/128GB läuft GPT-OSS-120B @ 30+ tok/s). Passt dein Modell in 32 GB → normale Maschine, 6× schneller. Die BYD-Analogie (billig starten, belächelt werden, via Vertikalintegration gewinnen) greift erst halb: Modelle ✅, Chipdesign ✅ finanziert — aber die „Batterie" dieser Industrie ist Memory + Fertigung, und da sitzt TSMC/Samsung/SK Hynix/Micron im Boot. Xiaomis Memory-Stacking ist der Versuch, die Batterie selbst zu bauen. Wenn das 2027 mit echter Kapazität und Preis shipped, ist es keine Analogie mehr.
>
> Soll ich das tiefer aufbereiten (z.B. Vergleich mit deinem aktuellen lokalen Setup) oder als Briefing packen?
## Anmerkung
Second-hand-Quelle: Bots-Zusammenfassung, Zahlen nicht primär verifiziert, aber konsistent mit dem teilweise erfassten Original-Transcript und der Video-Beschreibung. Wird im Wiki als ergänzende Quelle mit ⚠️ geführt.

View file

@ -1,13 +1,13 @@
--- ---
created: 2026-08-26 created: 2026-08-26
updated: 2026-08-26 updated: 2026-08-26
sources: [youtube/2026-08-26_devsplainers-china-local-ai-box.md] sources: [youtube/2026-08-26_devsplainers-china-local-ai-box.md, other/2026-08-26_herman-butlerbot-china-local-ai-box-zusammenfassung.md]
tags: [concept, hardware, local-ai-box, xiaomi, alibaba, risc-v, xuantie-c950, memory-bandwidth, unified-memory, dgx-spark, strix-halo, mac-studio, ddr5, dram-shortage, cloud-exit, china-vs-us-hardware] tags: [concept, hardware, local-ai-box, xiaomi, alibaba, risc-v, xuantie-c950, memory-bandwidth, unified-memory, dgx-spark, strix-halo, mac-studio, ddr5, dram-shortage, cloud-exit, china-vs-us-hardware]
--- ---
# Local-AI-Box & Chinas Vorstoß — Xiaomi O100, Alibaba XuanTie C950 # Local-AI-Box & Chinas Vorstoß — Xiaomi O100, Alibaba XuanTie C950
> **Kern:** Devsplainers argumentiert (26.08.2026), Xiaomi und Alibaba griffen mit zwei Ankündigungen im Abstand von sechs Tagen die letzte Schicht der lokalen KI an, die China noch nicht besitze: die Box unterm Schreibtisch. China dominiere bereits die lokalen Modell-Leaderboards (DeepSeek, Qwen, GLM/Kimi) und habe im August das Agent-Harness verschenkt ([[../llm/deepseek-v4-pro-ga-harness-open-source.md|DeepSeek-Agent-Harness]]); es fehle nur noch die Hardware. Entscheidende Kennzahl einer Local-AI-Box sei **Memory-Bandbreite**, nicht der Petaflop-Headline-Wert. ⚠️ Alle Zahlen sind Video-/Hersteller-Claims; Transcript nur teilweise erfasst (Anfang), Rest aus Beschreibung/Bullets. > **Kern:** Devsplainers argumentiert (26.08.2026), Xiaomi und Alibaba griffen mit zwei Ankündigungen im Abstand von sechs Tagen die letzte Schicht der lokalen KI an, die China noch nicht besitze: die Box unterm Schreibtisch. China dominiere bereits die lokalen Modell-Leaderboards (DeepSeek, Qwen, GLM/Kimi) und habe im August das Agent-Harness verschenkt ([[../llm/deepseek-v4-pro-ga-harness-open-source.md|DeepSeek-Agent-Harness]]); es fehle nur noch die Hardware. Entscheidende Kennzahl einer Local-AI-Box sei **Memory-Bandbreite**, nicht der Petaflop-Headline-Wert. ⚠️ Alle Zahlen sind Video-/Hersteller-Claims. Transcript nur teilweise erfasst (Anfang); Details unten durch die Herman-ButlerBot-Zusammenfassung aus der OME-Gruppe ergänzt ([[../../../raw/other/2026-08-26_herman-butlerbot-china-local-ai-box-zusammenfassung.md|Raw]]).
## Was ist eine Local-AI-Box? ## Was ist eine Local-AI-Box?
@ -23,7 +23,7 @@ Deshalb kann eine Box mit 128 GB und 273 GB/s ein Modell halten, das eine RTX 50
## Die DGX-Spark-Lektion: 1 Petaflop, <3 tok/s ## Die DGX-Spark-Lektion: 1 Petaflop, <3 tok/s
Die Spark liefert die 1-Petaflop-Headline, aber Reviewer maßen (LMSYS, Llama 3.1 70B FP8 decode) unter **3 Tokens/s** bei einem dichten 70B-Modell. These: Der Petaflop-Wert misst Compute — beim lokalen Decoding liest das Modell pro Wort seine aktiven Gewichte aus dem Speicher; Bandbreite ist der Flaschenhals, nicht Rechenleistung. Die Spark liefert die 1-Petaflop-Headline, aber Reviewer maßen (LMSYS, Llama 3.1 70B FP8 decode) unter **3 Tokens/s** bei einem dichten 70B-Modell. Bandbreiten-Vergleich aus dem Video: **273 GB/s (Spark) vs. ~1.792 GB/s (RTX 5090)** — deshalb verliert die kapazitätsstärkere Box beim Decoding. These: Der Petaflop-Wert misst Compute — beim lokalen Decoding liest das Modell pro Wort seine aktiven Gewichte aus dem Speicher; Bandbreite ist der Flaschenhals, nicht Rechenleistung.
## Wie die Box entstand: VRAM-Wand → Quantisierung → MoE ## Wie die Box entstand: VRAM-Wand → Quantisierung → MoE
@ -31,14 +31,14 @@ Vor drei Jahren bedeutete lokale KI Gaming-GPU, und die Wand war VRAM (24 GB = M
## RAM-Knappheit: Warum die ganze Box zum Schnäppchen wird ## RAM-Knappheit: Warum die ganze Box zum Schnäppchen wird
Zweiter Treiber des Formats: die **DRAM-/DDR5-Teuerung**. Dedicated Boxes verkaufen „128 GB und aufwärts an Modell-Speicher für den Preis eines nackten DDR5-Kits"; ein $2.000-Mini-PC ist laut Video der „cheap seat". Gleichzeitig berichtet das Video, Apple habe die **512-GB- und 256-GB-Konfigurationen des Mac Studio** entfernt (Quellen: MacRumors, AppleInsider, 9to5Mac) — passt zur Knappheitslogik: Speicher ist das knappe Gut, nicht FLOPS. Siehe auch [[cloud-exit-and-local-superiority.md]] (RAM als neue Währung). Zweiter Treiber des Formats: die **DRAM-/DDR5-Teuerung**. Konkrete Zahl aus dem Video: ein **128-GB-DDR5-Kit stieg von $329 auf $3.399** — dedicated Boxes verkaufen daher „128 GB und aufwärts an Modell-Speicher für den Preis eines nackten DDR5-Kits"; eine $2.000-Strix-Halo-Box ist aktuell der billigste Sitzplatz für 100+ GB Modell-RAM. Dazu Preisschübe bei den Incumbents: NVIDIA verteuerte den Spark um $700, Apple stampfte die **256-GB- und 512-GB-Konfigurationen des Mac Studio** ein (Quellen im Video: MacRumors, AppleInsider, 9to5Mac). Siehe auch [[cloud-exit-and-local-superiority.md]] (RAM als neue Währung).
## Chinas Zug: Xiaomi O100 und Alibaba XuanTie C950 ## Chinas Zug: Xiaomi O100 und Alibaba XuanTie C950
Zwei Ankündigungen, sechs Tage auseinander (August 2026): Zwei Ankündigungen, sechs Tage auseinander (August 2026):
- **Xiaomi AI Cube / „O100":** dedizierte AI-Box mit **1,22 TB/s Near-Memory-Bandwidth** — mehr als das Vierfache der 273-GB/s-Klasse; vorgestellt auf Xiaomis Chip-Event (XRing-Umfeld; Coverage via Reuters, Gizmochina, VideoCardz, Notebookcheck). - **Xiaomi AI Cube / Chip „O100“:** Speicher direkt auf dem Prozessor gestapelt (~28.000 Verbindungen), **1,22 TB/s Bandbreite** — laut Video aber nur am Stack selbst messbar, Xiaomi-eigene Zahl ohne unabhängige Verifikation. Status: **Prototyp ohne Preis/Termin**, Chip für 2027 geplant. Bühnen-Demo: 3B-Modell @ 330 tok/s; größere Modelle sollen über einen zweiten Chip mit bis zu 160 GB normalem RAM laufen. (Coverage via Reuters, Gizmochina, VideoCardz, Notebookcheck.)
- **Alibaba XuanTie C950:** RISC-V-Chip, der laut Alibaba-Folie ein **27B-Modell mit 30 tok/s komplett ohne GPU** läuft — genau die Modellklasse, die lokal Referenz ist ([[../../concepts/llm/qwen3.8-27b-alibaba.md]]). - **Alibaba XuanTie C950:** RISC-V-Chip, der laut Alibaba-Folie ein **27B-Modell mit 30 tok/s komplett ohne GPU** läuft — genau die Modellklasse, die lokal Referenz ist ([[../../concepts/llm/qwen3.8-27b-alibaba.md]]). ⚠️ Drei Caveats aus dem Video: Die Zahl stammt aus einer Folie für eine **nicht kaufbare 64-Core-Konfiguration**, ohne Angaben zu Quantisierung/Kontextlänge. Und: Der Chip hat **eingebaute Matrix-Einheiten** — „plain CPU ohne GPU" ist als Marketing-Sprech zu lesen.
These des Videos: China owns bereits Modelle (Leaderboards) und Harness (DeepSeek gab das Agent-Harness im August her) — die Box ist die letzte Schicht. Als Glaubwürdigkeitstest für solche Launch-Ankündigungen gilt: **Läuft ein llama.cpp- oder vLLM-Backend am Launch Day?** Wenn nicht, bleibt es eine Folien-Zahl. These des Videos: China owns bereits Modelle (Leaderboards) und Harness (DeepSeek gab das Agent-Harness im August her) — die Box ist die letzte Schicht. Als Glaubwürdigkeitstest für solche Launch-Ankündigungen gilt: **Läuft ein llama.cpp- oder vLLM-Backend am Launch Day?** Wenn nicht, bleibt es eine Folien-Zahl.
@ -48,17 +48,17 @@ Laut Video verteidigen die Incumbents über drei Hebel: **CUDA-Ökosystem** (Sof
## Die BYD-Frage: Überträgt sich das EV-Playbook auf Silicon? ## Die BYD-Frage: Überträgt sich das EV-Playbook auf Silicon?
Das Video stellt die explizite Frage, ob sich die BYD-Dynamik wiederholt: Autobranche lachte über den Opening-Move chinesischer EVs — und verlor danach den Markt. Ob das Playbook (Preisdruck, Volumen, vertikale Integration) auf AI-Hardware übertragbar ist, lässt das Video offen; es benennt es als das Szenario, gegen das NVIDIA/AMD/Apple jetzt antreten müssen. Das Video prüft die explizite Analogie: Autobranche lachte über den Opening-Move chinesischer EVs — und verlor danach den Markt (BYD-Muster: billig starten, belächelt werden, via Vertikalintegration gewinnen). Das Fazit des Videos: Die Analogie greift **erst halb**. Modelle ✅ (China führt), Chipdesign ✅ finanziert — aber die „Batterie" dieser Industrie ist **Memory + Fertigung**, und da sitzen TSMC, Samsung, SK Hynix und Micron im Boot. Xiaomis Memory-Stacking ist genau der Versuch, diese „Batterie" selbst zu bauen. Shipped das 2027 mit echter Kapazität und Preis, ist es keine Analogie mehr.
## Kauf-Fazit-Rahmen (aus dem Video) ## Kauf-Fazit-Rahmen (aus dem Video)
- **Box gewinnt**, wenn Kapazität zählt: sehr große/MoE-Modelle lokal, Multimodell-Betrieb, RAM-Preis-Argument - **Box gewinnt**, wenn Kapazität zählt: nur kaufen für große MoE-Modelle, die sonst nirgendwo passen — Beispiel aus dem Video: $2k/128-GB-Box läuft **GPT-OSS-120B @ 30+ tok/s**
- **RTX 5090 gewinnt**, wenn Decoding-Geschwindigkeit bei dichten Modellen zählt (Bandbreiten-Vorteil der GPU-Klasse) - **Passt das Modell in 32 GB → normale Maschine**, die laut Video rund **6× schneller** decodiert
- Kaufentscheidung hängt vom geplanten Modell ab — nicht vom Sticker-Spec - Kaufentscheidung hängt vom geplanten Modell ab — nicht vom Sticker-Spec
## Signal zum Beobachten ## Signal zum Beobachten
Das Video nennt als nächsten Prüfstein: ob die chinesischen Boxen mit funktionierenden llama.cpp/vLLM-Backends launchen und ob unabhängige Benchmarks die Bandbreiten-Ansagen bestätigen. Bis dahin sind O100- und C950-Zahlen Hersteller-Claims. Der eigentliche Knackpunkt ist **Software**: Das Video nennt einen **gemergten llama.cpp-/vLLM-Backend-Support** als das Signal, auf das man achten muss. Ein Chip ohne Runtime-Support ist ein Ziegelstein. Bis dahin sind O100- und C950-Zahlen Hersteller-Claims auf einer Watchlist ohne Preis, Datum oder Benchmark.
## Verwandte Seiten ## Verwandte Seiten

View file

@ -114,7 +114,7 @@ Passt zur Lokal-relevant-Einordnung dieser Seite: ein multimodales 27B-Apache-2.
## Alibabas XuanTie C950: 27B ohne GPU laut Hersteller-Folie (Update 2026-08-26) ## Alibabas XuanTie C950: 27B ohne GPU laut Hersteller-Folie (Update 2026-08-26)
Das Devsplainers-Video "China Is Coming for Your Local AI Box" ([[../../concepts/hardware/china-local-ai-box.md]], 26.08.2026) zitiert eine Alibaba-Ankündigungs-Folie: Der neue **RISC-V-Chip XuanTie C950** laufe ein **27B-Modell mit 30 tok/s komplett ohne GPU** in der Box. Falls belastbar, wäre das eine Hardware-Natürlichkeit genau dieser Modellklasse: kein Unified-Memory-GPU-Setup nötig, sondern ein spezialisierte RISC-V-Inferenz-Chip. ⚠️ Hersteller-Claim aus zweiter Hand (Video zitiert Folie); Glaubwürdigkeitstest laut Video: llama.cpp-/vLLM-Backend am Launch Day. Das Devsplainers-Video "China Is Coming for Your Local AI Box" ([[../../concepts/hardware/china-local-ai-box.md]], 26.08.2026) zitiert eine Alibaba-Ankündigungs-Folie: Der neue **RISC-V-Chip XuanTie C950** laufe ein **27B-Modell mit 30 tok/s komplett ohne GPU** in der Box. Falls belastbar, wäre das eine Hardware-Natürlichkeit genau dieser Modellklasse: kein Unified-Memory-GPU-Setup nötig, sondern ein spezialisierter RISC-V-Inferenz-Chip. ⚠️ Mehrere Caveats (per Herman-ButlerBot-Zusammenfassung des Videos): Die Zahl stammt aus einer Folie für eine **nicht kaufbare 64-Core-Konfiguration**, ohne Angaben zu Quantisierung/Kontextlänge; der Chip hat zudem eingebaute Matrix-Einheiten — „plain CPU“ ist Overclaim. Glaubwürdigkeitstest laut Video: gemergter llama.cpp-/vLLM-Backend-Support.
## Verwandt: Qwen 3.8-Flash-Next als Qwen-4-Vorschau (Update 2026-08-26) ## Verwandt: Qwen 3.8-Flash-Next als Qwen-4-Vorschau (Update 2026-08-26)

View file

@ -2,7 +2,8 @@
*Auto-generated: 2026-07-07* *Auto-generated: 2026-07-07*
*Letzte Aktualisierung: 2026-08-26 (149. Update — Devsplainers "China Is Coming for Your Local AI Box" (26.08.2026, 09:15; geteilt von Kai @PWeber in OME Topic "Openclaw mit lokalen Modellen", #12769). Raw: `raw/youtube/2026-08-26_devsplainers-china-local-ai-box.md` (neu — Firecrawl-Scrape, Auto-Transcript nur teilweise erfasst, Beschreibung/Kapitel vollständig). Wiki: `concepts/hardware/china-local-ai-box.md` (neu), Updates/Cross-Refs in `concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md` (Apple soll 512/256-GB-Mac-Studio-Konfigurationen entfernt haben — MacRumors/AppleInsider/9to5Mac zitiert), `concepts/hardware/nvidia-dgx-station-748gb.md` (Xiaomi-O100-Zeile im Vergleich + DGX-Spark-Lektion), `concepts/hardware/edge-inference-als-cloud-alternative.md`, `concepts/hardware/cloud-exit-and-local-superiority.md`, `concepts/llm/qwen3.8-27b-alibaba.md`. Kernthese: Memory-Bandbreite statt Petaflops entscheidet Box-Tauglichkeit (DGX Spark: 1 PFLOP Headline, <3 tok/s dichter 70B laut LMSYS); Xiaomi AI Cube/O100 mit 1,22 TB/s Near-Memory-Bandwidth, Alibabas XuanTie C950 (RISC-V) laut Folie 27B @ 30 tok/s ohne GPU; DRAM-Teuerung macht ganze Boxen zur günstigen RAM-Quelle. Zahlen = Hersteller-/Video-Claims. **Nachschub:** Qwen 3.8-Flash-Next als Qwen-4-Vorschau (Perplexity-Page, geteilt von Pit @PWeber in "News & Infos", #12773): Raw `raw/other/2026-08-26_qwen38-flash-next-qwen4-preview.md` (via Firecrawl) + Wiki `concepts/llm/qwen3.8-flash-next-qwen4-preview.md` multimodales 125B-MoE mit ~6B aktiven Parametern (+51B N-Gramm-Embeddings), vom Qwen-Team explizit als Architektur-Vorschau auf Qwen 4 gerahmt, kein fertiges Produkt; Claim laut NVIDIA-Developer-Forum: Qwen-3.7-Plus-Niveau bei ~1/9 Trainingskosten, Stärke Coding; keine Benchmarks, Zahlen unverifiziert; Kontext: Alibabas 10,2 Mrd USD Aktienplatzierung (~3× überzeichnet) für full-stack-AI-Infrastruktur. Cross-Ref-Abschnitt in der 27B-Seite.)* *Letzte Aktualisierung: 2026-08-26 (150. Update — Herman-Supplement zur China-Local-AI-Box: Die Herman-ButlerBot-Zusammenfassung desselben Devsplainers-Videos aus der Gruppe (#12770/#12781, Recovered-Duplicate) wurde als Zweitquelle ingestiert. Raw: `raw/other/2026-08-26_herman-butlerbot-china-local-ai-box-zusammenfassung.md` (neu). Wiki: `concepts/hardware/china-local-ai-box.md` nachgeschärft (Xiaomi AI Cube = Prototyp ohne Preis/Termin, Chip für 2027, 1,22 TB/s nur am Stack selbst, Bühnen-Demo 3B @ 330 tok/s, Zweitchip bis 160 GB normalem RAM; Alibaba C950-Folie = nicht kaufbare 64-Core-Konfiguration ohne Quantisierungs-/Kontextangaben, eingebaute Matrix-Einheiten machen „plain CPU“ zum Overclaim; DDR5-128-GB-Kit $329→$3.399, Spark +$700; Kauf-Fazit konkretisiert: $2k/128 GB läuft GPT-OSS-120B @ 30+ tok/s, ≤32-GB-Modelle ~6× schneller auf normaler Maschine; BYD-Analogie greift erst halb — „Batterie“ Memory+Fertigung sitzt bei TSMC/Samsung/SK Hynix/Micron), `concepts/llm/qwen3.8-27b-alibaba.md` (C950-Caveats ergänzt). ⚠️ Second-hand-Bot-Zusammenfassung, Zahlen nicht primär verifiziert, konsistent mit Video-Beschreibung.)*
*Vorherige Aktualisierung: 2026-08-26 (149. Update — Devsplainers "China Is Coming for Your Local AI Box" (26.08.2026, 09:15; geteilt von Kai @PWeber in OME Topic "Openclaw mit lokalen Modellen", #12769). Raw: `raw/youtube/2026-08-26_devsplainers-china-local-ai-box.md` (neu — Firecrawl-Scrape, Auto-Transcript nur teilweise erfasst, Beschreibung/Kapitel vollständig). Wiki: `concepts/hardware/china-local-ai-box.md` (neu), Updates/Cross-Refs in `concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md` (Apple soll 512/256-GB-Mac-Studio-Konfigurationen entfernt haben — MacRumors/AppleInsider/9to5Mac zitiert), `concepts/hardware/nvidia-dgx-station-748gb.md` (Xiaomi-O100-Zeile im Vergleich + DGX-Spark-Lektion), `concepts/hardware/edge-inference-als-cloud-alternative.md`, `concepts/hardware/cloud-exit-and-local-superiority.md`, `concepts/llm/qwen3.8-27b-alibaba.md`. Kernthese: Memory-Bandbreite statt Petaflops entscheidet Box-Tauglichkeit (DGX Spark: 1 PFLOP Headline, <3 tok/s dichter 70B laut LMSYS); Xiaomi AI Cube/O100 mit 1,22 TB/s Near-Memory-Bandwidth, Alibabas XuanTie C950 (RISC-V) laut Folie 27B @ 30 tok/s ohne GPU; DRAM-Teuerung macht ganze Boxen zur günstigen RAM-Quelle. Zahlen = Hersteller-/Video-Claims. **Nachschub:** Qwen 3.8-Flash-Next als Qwen-4-Vorschau (Perplexity-Page, geteilt von Pit @PWeber in "News & Infos", #12773): Raw `raw/other/2026-08-26_qwen38-flash-next-qwen4-preview.md` (via Firecrawl) + Wiki `concepts/llm/qwen3.8-flash-next-qwen4-preview.md` multimodales 125B-MoE mit ~6B aktiven Parametern (+51B N-Gramm-Embeddings), vom Qwen-Team explizit als Architektur-Vorschau auf Qwen 4 gerahmt, kein fertiges Produkt; Claim laut NVIDIA-Developer-Forum: Qwen-3.7-Plus-Niveau bei ~1/9 Trainingskosten, Stärke Coding; keine Benchmarks, Zahlen unverifiziert; Kontext: Alibabas 10,2 Mrd USD Aktienplatzierung (~3× überzeichnet) für full-stack-AI-Infrastruktur. Cross-Ref-Abschnitt in der 27B-Seite.)*
*Vorherige Aktualisierung: 2026-08-26 (148. Update — OpenClaw Cast (AI World): zweites gepostetes Audio des Tages ingestiert. Raw: `raw/podcast/2026-08-26_openclaw-cast-runaway-agent-budget.md` (neu — Metadata-only: neueste Folge "One Runaway AI Agent Can Spend Past Your Budget", 25.08., 20 Min, kein Transcript verfügbar). Wiki: `institutions/openclaw-cast.md` (neu — KI-generierter Weekly-Podcast mit TTS-Hosts Cleo/Dev, 23 Episoden Rückreihe bis Februar 2026; jede Episode übersetzt eine Community-Warnung in ein lokales Guardrail-Rezept: Budget Breaker/Kill Switch, Task Lease Guard, Release-Sentinel-Canary, Cadence Guard). ⚠️ Episodeninhalt nicht transkribiert/verifiziert, nur Feed-Metadaten.)* *Vorherige Aktualisierung: 2026-08-26 (148. Update — OpenClaw Cast (AI World): zweites gepostetes Audio des Tages ingestiert. Raw: `raw/podcast/2026-08-26_openclaw-cast-runaway-agent-budget.md` (neu — Metadata-only: neueste Folge "One Runaway AI Agent Can Spend Past Your Budget", 25.08., 20 Min, kein Transcript verfügbar). Wiki: `institutions/openclaw-cast.md` (neu — KI-generierter Weekly-Podcast mit TTS-Hosts Cleo/Dev, 23 Episoden Rückreihe bis Februar 2026; jede Episode übersetzt eine Community-Warnung in ein lokales Guardrail-Rezept: Budget Breaker/Kill Switch, Task Lease Guard, Release-Sentinel-Canary, Cadence Guard). ⚠️ Episodeninhalt nicht transkribiert/verifiziert, nur Feed-Metadaten.)*
*Vorherige Aktualisierung: 2026-08-26 (147. Update — AgentStack Daily EP106-Ingest: erster Podcast-Raw der Reihe (`raw/podcast/` etabliert für den Typ). Raw: `raw/podcast/2026-08-26_agentstack-daily-ep106.md` (neu; alle 15 Stories faktenbasiert, Release Coverage Check + Primary Links). Wiki: `institutions/agentstack-daily.md` (neu — KI-generierter Daily-Podcast NOVA/ALLOY mit 15-Story-Coverage und Primärquellen-Verlinkung), `tools/openai-codex.md` (neu — Codex rust-v0.149.0: agents-Dashboard, queue, doctor, SDK reasoning max|ultra), `concepts/policy/cryptographic-context-injection.md` (neu — verschlüsselter Jailbreak, Representation Gap, Grok-Exfiltrations-Demo), Updates: `concepts/llm/ox-alpha-anonymous-model.md` (exakte EP106-Listing-Zahlen 1.048.576 Kontext / 4.096 Max-Output, read-heavy-Agent-Pipeline-Einordnung, offener Widerspruch zum 131k-Gegencheck dokumentiert) + `concepts/llm/qwen3.8-27b-alibaba.md` (HF-Trending: 11.836 Likes, >1,7 Mio Downloads, Apache 2.0).)* *Vorherige Aktualisierung: 2026-08-26 (147. Update — AgentStack Daily EP106-Ingest: erster Podcast-Raw der Reihe (`raw/podcast/` etabliert für den Typ). Raw: `raw/podcast/2026-08-26_agentstack-daily-ep106.md` (neu; alle 15 Stories faktenbasiert, Release Coverage Check + Primary Links). Wiki: `institutions/agentstack-daily.md` (neu — KI-generierter Daily-Podcast NOVA/ALLOY mit 15-Story-Coverage und Primärquellen-Verlinkung), `tools/openai-codex.md` (neu — Codex rust-v0.149.0: agents-Dashboard, queue, doctor, SDK reasoning max|ultra), `concepts/policy/cryptographic-context-injection.md` (neu — verschlüsselter Jailbreak, Representation Gap, Grok-Exfiltrations-Demo), Updates: `concepts/llm/ox-alpha-anonymous-model.md` (exakte EP106-Listing-Zahlen 1.048.576 Kontext / 4.096 Max-Output, read-heavy-Agent-Pipeline-Einordnung, offener Widerspruch zum 131k-Gegencheck dokumentiert) + `concepts/llm/qwen3.8-27b-alibaba.md` (HF-Trending: 11.836 Likes, >1,7 Mio Downloads, Apache 2.0).)*
*Vorherige Aktualisierung: 2026-08-26 (146. Update — Perplexity „Portable Computer“: vollständig lokaler Agent-Stack in Partnerschaft mit NVIDIA (Launch 2026-08-25). Raw: `raw/other/2026-08-26_perplexity-portable-computer-local-agent.md` (neu; Perplexity-Page via Firecrawl abgerufen, web_fetch blockiert mit 403). Wiki: `tools/perplexity-portable-computer.md` (neu), Cross-Refs in `concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md`, `concepts/hardware/nvidia-dgx-station-748gb.md`, `concepts/agents/meta-hatch-ai-agent-platform.md`, `concepts/llm/qwen3.8-27b-alibaba.md`. Kern: Orchestrator + Subagent-Modelle + Agent-Harness komplett on-device; post-trainiertes 27B-Modell + Qwen 3.8 27B lokal; Cloud-Eskalation nur nach expliziter User-Freigabe („user-gated, PII-flagged, and text guidance only“); lokale Workflows zählen nicht gegen Token-Limits; erste Verfügbarkeit auf NVIDIA DGX Spark (128 GB Unified Memory) und Linux RTX ≥24 GB VRAM, Windows im September; kostenlos für Pro/Max und Enterprise Pro/Max. Einordnung: vollständige lokale Agent-Stacks als Big-Tech-Produkt — Gegenmodell zu Meta Hatch. ⚠️ Benchmark 82,6 % = Herstellerangabe. **Nachschub (gleicher Tag):** Tech-Blog-Fakten nachgetragen (`raw/blog/2026-08-26_perplexity-local-first-agent-blog.md`) — Co-Design-These, deterministischer Orchestrator, 4 Harness-Prinzipien, Advisor-Mechanik, volle Benchmark-Tabelle; neue Sektionen in der Wiki-Seite.)* *Vorherige Aktualisierung: 2026-08-26 (146. Update — Perplexity „Portable Computer“: vollständig lokaler Agent-Stack in Partnerschaft mit NVIDIA (Launch 2026-08-25). Raw: `raw/other/2026-08-26_perplexity-portable-computer-local-agent.md` (neu; Perplexity-Page via Firecrawl abgerufen, web_fetch blockiert mit 403). Wiki: `tools/perplexity-portable-computer.md` (neu), Cross-Refs in `concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md`, `concepts/hardware/nvidia-dgx-station-748gb.md`, `concepts/agents/meta-hatch-ai-agent-platform.md`, `concepts/llm/qwen3.8-27b-alibaba.md`. Kern: Orchestrator + Subagent-Modelle + Agent-Harness komplett on-device; post-trainiertes 27B-Modell + Qwen 3.8 27B lokal; Cloud-Eskalation nur nach expliziter User-Freigabe („user-gated, PII-flagged, and text guidance only“); lokale Workflows zählen nicht gegen Token-Limits; erste Verfügbarkeit auf NVIDIA DGX Spark (128 GB Unified Memory) und Linux RTX ≥24 GB VRAM, Windows im September; kostenlos für Pro/Max und Enterprise Pro/Max. Einordnung: vollständige lokale Agent-Stacks als Big-Tech-Produkt — Gegenmodell zu Meta Hatch. ⚠️ Benchmark 82,6 % = Herstellerangabe. **Nachschub (gleicher Tag):** Tech-Blog-Fakten nachgetragen (`raw/blog/2026-08-26_perplexity-local-first-agent-blog.md`) — Co-Design-These, deterministischer Orchestrator, 4 Harness-Prinzipien, Advisor-Mechanik, volle Benchmark-Tabelle; neue Sektionen in der Wiki-Seite.)*

View file

@ -13,6 +13,8 @@
- Raw (NEU): `raw/youtube/2026-08-26_devsplainers-china-local-ai-box.md` - Raw (NEU): `raw/youtube/2026-08-26_devsplainers-china-local-ai-box.md`
- index.md: 149. Update | log.md: dieser Eintrag - index.md: 149. Update | log.md: dieser Eintrag
**Nachschub (11:28 UTC):** Herman-ButlerBot-Zusammenfassung (#12770/#12781, Recovered-Duplicate) als Zweitquelle ingestiert → Raw `raw/other/2026-08-26_herman-butlerbot-china-local-ai-box-zusammenfassung.md` (NEU); Seite `china-local-ai-box.md` + Qwen-C950-Abschnitt mit konkreten Zahlen/Caveats nachgeschärft: Xiaomi = Prototyp ohne Preis/Termin, Chip 2027, Bandbreite nur am Stack, Demo 3B @ 330 tok/s, Zweitchip bis 160 GB RAM; C950 = nicht kaufbare 64-Core-Folie ohne Quantisierungs-/Kontextangaben, Matrix-Einheiten → „plain CPU“ Overclaim; DDR5-Kit $329→$3.399; Spark +$700; GPT-OSS-120B @ 30+ tok/s auf $2k/128 GB; ≤32 GB → normale Maschine ~6× schneller; BYD nur Halb-Analogie (Memory+Fertigung bei TSMC/Samsung/SK Hynix/Micron). index.md: 150. Update.
## 2026-08-25 — PLUR1BUS-Repo-Review und Schema-Migrations-Einordnung ## 2026-08-25 — PLUR1BUS-Repo-Review und Schema-Migrations-Einordnung
**Type:** ingest | **Scope:** raw/other, wiki/tools, wiki/index, wiki/log **Type:** ingest | **Scope:** raw/other, wiki/tools, wiki/index, wiki/log