ingest(youtube): devsplainers china local ai box

This commit is contained in:
Hector 2026-08-26 12:09:56 +02:00
parent 897859c2e7
commit a420d3020c
11 changed files with 267 additions and 3 deletions

View file

@ -0,0 +1,44 @@
---
type: other
source_url: https://www.perplexity.ai/page/75dfdb0f-3b9c-4158-874a-84587a567c76
retrieved: 2026-08-26
title: "Alibaba to release Qwen 3.8-Flash-Next as a preview of Qwen 4"
posted_date: 2026-08-25
tags: [qwen, alibaba, flash-next, moe, open-weights, qwen4, local-ai]
---
# Alibaba to release Qwen 3.8-Flash-Next as a preview of Qwen 4 (Perplexity-Page)
Perplexity-Page (KI-generierte News-Aggregation), laut Page ~12 Stunden vor Abruf publiziert. Gepostet von Kai (@PWeber) in OME Topic "News & Infos" (#12773). Abgerufen am 2026-08-26 via Firecrawl.
## Kerninhalt (Fakten aus der Page)
**Release-Ankündigung:**
- Das Qwen-Team von Alibaba plant die Veröffentlichung von **Qwen 3.8-Flash-Next** noch in derselben Woche (Abruf: 26.08.)
- Multimodales **Mixture-of-Experts**-Modell: **125 Milliarden Parameter gesamt, davon nur 6 Milliarden pro Token aktiviert**
- Zusätzlich **51 Milliarden N-Gramm-Embedding-Parameter**
- Vom Team explizit als **Vorschau auf die Qwen-4-Architektur** gerahmt — Chance für die Developer-Community, sich auf die volle Qwen-4-Familie vorzubereiten, kein fertiges Produkt
- Anspruch laut Page: near-frontier Performance zu einem Bruchteil der Compute-Kosten vergleichbarer Systeme
**Technische Details (laut Technical-Details-Post in NVIDIAs Entwickler-Foren):**
- Capability vergleichbar mit **Qwen 3.7-Plus** bei rund **1/9 der Trainingskosten**
- Besondere Stärke laut Forums-Post: **Coding-Tasks**
- ⚠️ **Keine Benchmark-Scores publiziert**; die 125B/6B-Parameterzahlen sind durch unabhängige Tests nicht verifiziert
**Finanzierungs-Kontext (Reuters/CNBC/FT auf der Page):**
- Tage zuvor: **10,2 Mrd USD Aktienplatzierung** Alibabas — laut Reuters die größte primäre Folgeemission eines Hongkong-gelisteten Unternehmens überhaupt
- 710 Mio neue Aktien à HK$112,70 (8,4 % Abschlag auf den Vortagesschluss); fast dreifach überzeichnet, Nachfrage 28 Mrd USD
- Alibaba: 100 % der Nettomittel fließen in „full-stack AI capabilities, including to expand and enhance its AI infrastructure"
- Aktie fiel nach der Ankündigung deutlich (Verwässerungssorgen)
**Open-Weight-Rennen (Kontextabschnitt der Page):**
- Alibaba shippte **Qwen 3.8-Max** (2,4T-Parameter-Flaggschiff) am 03.08.; davor das Qwen-3.8-27B-Dense-Modell unter Apache 2.0
- DeepSeek und andere chinesische Labs hielten ein ähnliches Open-Weight-Tempo
- Laut weiteren verlinkten Perplexity-Pages: Qwen-Familie mit >460 Open-Source-Modellen, 119 Sprachen, >3 Mrd Downloads; angeblich geplante Revenue-Sharing-Pflicht für große kommerzielle Nutzer der Qwen3.8-Max-Open-Weights
## Auf der Page zitierte Primärquellen
- Yahoo Tech: https://tech.yahoo.com/ai/gemini/articles/alibaba-release-qwen-3-8-211604965.html
- NVIDIA Developer Forums (Technical Details): https://forums.developer.nvidia.com/t/qwen3-8-flash-next/381228
- Zeli: https://zeli.app/story/49432317
- Reuters (Share Placement): https://www.reuters.com/business/retail-consumer/alibaba-set-open-down-8-hong-kong-after-102-billion-share-placement-plan-2026-08-24/

View file

@ -0,0 +1,86 @@
---
type: youtube
source_url: https://www.youtube.com/watch?v=rwlHx7Faf1E
retrieved: 2026-08-26
channel: "Devsplainers"
duration_sec: 555
has_transcript: true
---
# China Is Coming for Your Local AI Box
## Metadaten
- Kanal: Devsplainers (https://www.youtube.com/@devsplainers, ~15.3K Abonnenten)
- Video: https://www.youtube.com/watch?v=rwlHx7Faf1E
- Veröffentlicht: 2026-08-26 (zum Abrufzeitpunkt ~2h alt)
- Länge: 09:15
- Aufrufe/Likes zum Abrufzeitpunkt: 1.204 Aufrufe, 83 Likes
- Kategorie: Science & Technology
- Tags/Hashtags: #LocalLLM #LocalAI #DGXSpark #AIHardware #Xiaomi
- Auto-dubbed (deutsche Tonspur automatisch generiert)
- Newsletter des Kanals: https://devsplainers.com/takeouts/
- Abrufweg: Firecrawl-Scrape der Watch-Page (YouTube blockt yt-dlp mit LOGIN_REQUIRED-Bot-Sperre); Auto-Transcript teilweise erfasst, Beschreibung + Kapitel vollständig.
## Beschreibung (Original)
Xiaomi and Alibaba just went after the last layer of local AI they don't own: the box on your desk. This is what a local AI box actually does, why the spec on the sticker is the wrong one, and whether you should buy one.
Dedicated AI boxes (NVIDIA DGX Spark, AMD Strix Halo mini PCs, the big-memory Mac Studio) sell you 128GB and up of model memory for the price of a bare DDR5 kit. The number that decides how fast a local LLM talks is memory bandwidth, not the petaflop headline. Two Chinese announcements landed six days apart, and the buying advice changes depending on which model you plan to run.
## Kapitelmarken
- 00:00 Xiaomi, Alibaba, and the last layer China doesn't own
- 00:47 Where the local AI box came from: VRAM, quantization, MoE
- 01:41 The DGX Spark lesson: one petaflop, three tokens per second
- 02:35 The RAM shortage, and why a whole box beats a memory kit
- 03:53 China wants the box: Xiaomi's O100 and Alibaba's RISC-V slide
- 05:37 How NVIDIA, AMD and Apple fight back (CUDA, price, bandwidth)
- 06:40 The BYD question: does the EV playbook map onto silicon?
- 07:48 Should you buy a local AI box?
- 08:42 The signal to watch next
## COVERED IN THIS VIDEO (Original-Bullets aus der Beschreibung)
- Why 24GB of VRAM stopped being the ceiling for local LLMs
- Quantization and mixture-of-experts models, explained without jargon
- DGX Spark benchmarks: 1 petaflop on the box, under 3 tok/s on dense 70B
- Memory bandwidth versus compute, and which one you actually feel
- DDR5 and HBM: how the DRAM shortage made a $2,000 mini PC the cheap seat
- Apple dropping its 512GB and 256GB Mac Studio configs
- Xiaomi's AI Cube, the O100, and 1.22 TB/s of near-memory bandwidth
- Alibaba's XuanTie C950 running a 27B model at 30 tok/s with no GPU
- Why a llama.cpp or vLLM backend on launch day is the credibility test
- The buying verdict: when a box wins, and when a 5090 wins
## Transcript (Auto-Caption, Auszug — Anfang)
> Xiaomi just showed a dedicated AI box with 1.22 terabytes per second of memory bandwidth, the one spec that decides how fast a local model talks. Six days earlier, Alibaba claimed its new RISC-V chip [music] runs a 27 billion parameter model at 30 tokens a second with no GPU in the box. China already dominates the local AI model leaderboards. This month, DeepSeek gave away the harness that runs them. The box under your desk is the last layer they don't own. And now they're coming for it. Carmakers watched Chinese EVs make this exact opening move and laughed. Will these AI boxes compete with regular machines, and does it make sense to buy one?
>
> Three years ago, a local AI machine meant a gaming GPU, and the wall you hit was VRAM. 24 gigs bought your model a seat, and everything bigger stayed in the cloud. Two things broke that wall. Compression squeezed [music] models down to a fraction of their size, and the new mixture-of-experts models store hundreds [music] of billions of parameters, but only wake a few per word. So, capacity became more important than raw speed. Apple had accidentally built the right machine years earlier when it gave Macs one big memory pool shared between CPU [music] and GPU. The industry followed, and the dedicated AI box was born. Nvidia's [music] DGX Spark, AMD's Strix Halo machines, the big memory Mac Studio, 128 gigs and up, sold on AI performance. Then, the Spark taught everyone what a box really is. It ships with a one petaflop headline, and reviewers measured a dense 70 billion parameter model writing under three tokens per second on it. The petaflop measures compute, and compute is the part local inference barely uses. It sets how fast a box reads your prompt, but the speed you feel is the talking speed. To write each word, a model reads all of its [music] active weights out of [...]
(Transcript bricht hier ab; Rest der Argumentation über Beschreibung/Bullets abgedeckt.)
## WHAT IS A LOCAL AI BOX? (Definition aus der Beschreibung)
A local AI box is a small computer built around one big pool of unified memory shared between CPU and GPU, sold for running large language models on your own hardware instead of in the cloud. Capacity decides which model fits. Memory bandwidth decides how fast it writes each word. Compute mostly sets prefill, the speed it reads your prompt. That is why a 273 GB/s box with 128GB can hold a model an RTX 5090 cannot, and still lose badly on tokens per second.
## Von der Quelle genannte SOURCES
- LMSYS, DGX Spark In-Depth Review (Llama 3.1 70B FP8 decode)
- NVIDIA DGX Spark product page and February 2026 pricing announcement
- AMD Ryzen AI Max product pages
- Reuters, Xiaomi chip event coverage, August 2026
- Xiaomi Xring presentation coverage (gizmochina, VideoCardz, Notebookcheck)
- Alibaba XuanTie C950 announcement and slide, August 2026
- Counterpoint Research, DRAM market share Q2 2026
- TrendForce, foundry revenue share Q1 2026 and DRAM price forecast
- Tom's Hardware, DDR5 kit pricing, August 2026
- MacRumors, AppleInsider and 9to5Mac on Mac Studio memory config removals
- Alex Ziskind, "Your local LLM is 10x slower than it should be"
- Level1Techs forum and MindStudio gpt-oss-120B runs on Strix Halo
- r/LocalLLaMA community threads on Xiaomi, Alibaba and Strix Halo
## Kontext im OME-Chat
Geteilt von Kai (@PWeber) am 2026-08-26 im OME-Topic „Openclaw mit lokalen Modellen" (#12769) als nackter Link ohne Kommentar.

View file

@ -1,6 +1,6 @@
---
created: 2026-08-25
updated: 2026-08-25
updated: 2026-08-26
sources: [youtube/2026-08-25_apfelfunk-neue-macs-m6-m5-ultra.md, blog/2026-08-25_heise-apple-m6-m5-ultra-mac-update.md]
tags: [concept, hardware, apple, m6, m5-pro, m5-max, m5-ultra, mac-mini, mac-studio, unified-memory, local-ai, thunderbolt-5]
---
@ -53,6 +53,7 @@ Heise benennt den Unternehmens-Winkel explizit: Der Leistungszuwachs der „KI-K
- **Cluster statt Einzelmaschine:** TB5/RDMA-Clusterung verschiebt die Grenze, was „Desktop-Hardware“ in der Summe kann (>1T-Parameter-Modelle als erklärtes Ziel). Damit konkurriert Consumer-/Prosumer-Hardware erstmals strukturell mit Datacenter-Setups.
- **OpenClaw als Nachfrage-Treiber:** Dass ausgerechnet agentengetriebene lokale KI als Verkaufsargument und Ursache des ungewöhnlichen Release-Timings genannt wird, ist ein Validierungs-Signal für den Agenten-Alltag — mit der Einschränkung, dass dies eine Apple/heise-Zuschreibung ist.
- **Preis-Schiene:** Speicherknappheit treibt die Preise — RAM bleibt die knappe Währung ([[lokale-ki-coding.md]] nennt dieselbe Dynamik von der Kosten-Seite).
- **Chinas Gegenangriff auf dieselbe Schicht:** Laut Devsplainers (26.08.) hat Apple zusätzlich die **512-GB-/256-GB-Mac-Studio-Konfigurationen** entfernt (MacRumors/AppleInsider/9to5Mac zitiert dort) und Xiaomi greift mit dem O100 (1,22 TB/s) die Bandbreiten-Führung an — siehe [[china-local-ai-box.md]].
⚠️ **Quellenlage:** Sämtliche Performance-Zahlen sind Apple-Angaben aus dem heise-Bericht; unabhängige Benchmarks gab es zum Ingest-Zeitpunkt noch nicht. Das Apfelfunk-Video (16:49, deutsch) war ohne Transcript — erfasst sind Metadaten, Beschreibung und Kapitelmarken; die inhaltliche Substanz stammt aus dem verlinkten heise-Artikel.

View file

@ -0,0 +1,74 @@
---
created: 2026-08-26
updated: 2026-08-26
sources: [youtube/2026-08-26_devsplainers-china-local-ai-box.md]
tags: [concept, hardware, local-ai-box, xiaomi, alibaba, risc-v, xuantie-c950, memory-bandwidth, unified-memory, dgx-spark, strix-halo, mac-studio, ddr5, dram-shortage, cloud-exit, china-vs-us-hardware]
---
# Local-AI-Box & Chinas Vorstoß — Xiaomi O100, Alibaba XuanTie C950
> **Kern:** Devsplainers argumentiert (26.08.2026), Xiaomi und Alibaba griffen mit zwei Ankündigungen im Abstand von sechs Tagen die letzte Schicht der lokalen KI an, die China noch nicht besitze: die Box unterm Schreibtisch. China dominiere bereits die lokalen Modell-Leaderboards (DeepSeek, Qwen, GLM/Kimi) und habe im August das Agent-Harness verschenkt ([[../llm/deepseek-v4-pro-ga-harness-open-source.md|DeepSeek-Agent-Harness]]); es fehle nur noch die Hardware. Entscheidende Kennzahl einer Local-AI-Box sei **Memory-Bandbreite**, nicht der Petaflop-Headline-Wert. ⚠️ Alle Zahlen sind Video-/Hersteller-Claims; Transcript nur teilweise erfasst (Anfang), Rest aus Beschreibung/Bullets.
## Was ist eine Local-AI-Box?
Definition aus dem Video: ein kleiner Computer um einen großen Pool **Unified Memory** herum (CPU+GPU teilen sich einen Speicher), verkauft dafür, große LLMs auf eigener Hardware statt in der Cloud zu betreiben.
Drei Regeln des Videos:
1. **Kapazität** entscheidet, welches Modell überhaupt reinpasst
2. **Memory-Bandbreite** entscheidet, wie schnell das Modell schreibt (Tokens/s — die Geschwindigkeit, die man spürt)
3. **Compute** setzt vor allem Prefill (wie schnell der Prompt gelesen wird) — die Komponente, die lokale Inferenz kaum nutzt
Deshalb kann eine Box mit 128 GB und 273 GB/s ein Modell halten, das eine RTX 5090 (24 GB VRAM) nicht fasst — und trotzdem auf Tokens/s klar verlieren.
## Die DGX-Spark-Lektion: 1 Petaflop, <3 tok/s
Die Spark liefert die 1-Petaflop-Headline, aber Reviewer maßen (LMSYS, Llama 3.1 70B FP8 decode) unter **3 Tokens/s** bei einem dichten 70B-Modell. These: Der Petaflop-Wert misst Compute — beim lokalen Decoding liest das Modell pro Wort seine aktiven Gewichte aus dem Speicher; Bandbreite ist der Flaschenhals, nicht Rechenleistung.
## Wie die Box entstand: VRAM-Wand → Quantisierung → MoE
Vor drei Jahren bedeutete lokale KI Gaming-GPU, und die Wand war VRAM (24 GB = Modellsitz, alles Größere blieb in der Cloud). Zwei Dinge brachen die Wand: **Komprimierung/Quantisierung** (Modelle auf Bruchteil ihrer Größe) und **MoE-Architekturen** (hunderte Milliarden Parameter gespeichert, aber nur wenige pro Wort aktiv). Dadurch wurde Kapazität wichtiger als Rohgeschwindigkeit. Apple hatte „versehentlich" Jahre vorher die richtige Maschine gebaut: ein großer gemeinsamer Speicherpool für CPU und GPU — die Industrie folgte (DGX Spark, Strix-Halo-Mini-PCs, großes Mac Studio).
## RAM-Knappheit: Warum die ganze Box zum Schnäppchen wird
Zweiter Treiber des Formats: die **DRAM-/DDR5-Teuerung**. Dedicated Boxes verkaufen „128 GB und aufwärts an Modell-Speicher für den Preis eines nackten DDR5-Kits"; ein $2.000-Mini-PC ist laut Video der „cheap seat". Gleichzeitig berichtet das Video, Apple habe die **512-GB- und 256-GB-Konfigurationen des Mac Studio** entfernt (Quellen: MacRumors, AppleInsider, 9to5Mac) — passt zur Knappheitslogik: Speicher ist das knappe Gut, nicht FLOPS. Siehe auch [[cloud-exit-and-local-superiority.md]] (RAM als neue Währung).
## Chinas Zug: Xiaomi O100 und Alibaba XuanTie C950
Zwei Ankündigungen, sechs Tage auseinander (August 2026):
- **Xiaomi AI Cube / „O100":** dedizierte AI-Box mit **1,22 TB/s Near-Memory-Bandwidth** — mehr als das Vierfache der 273-GB/s-Klasse; vorgestellt auf Xiaomis Chip-Event (XRing-Umfeld; Coverage via Reuters, Gizmochina, VideoCardz, Notebookcheck).
- **Alibaba XuanTie C950:** RISC-V-Chip, der laut Alibaba-Folie ein **27B-Modell mit 30 tok/s komplett ohne GPU** läuft — genau die Modellklasse, die lokal Referenz ist ([[../../concepts/llm/qwen3.8-27b-alibaba.md]]).
These des Videos: China owns bereits Modelle (Leaderboards) und Harness (DeepSeek gab das Agent-Harness im August her) — die Box ist die letzte Schicht. Als Glaubwürdigkeitstest für solche Launch-Ankündigungen gilt: **Läuft ein llama.cpp- oder vLLM-Backend am Launch Day?** Wenn nicht, bleibt es eine Folien-Zahl.
## Gegenwehr: NVIDIA, AMD, Apple
Laut Video verteidigen die Incumbents über drei Hebel: **CUDA-Ökosystem** (Software-Lock-in), **Preis**, **Bandbreite** (Apple M5 Ultra mit 512 GB @ 1,2 TB/s, siehe [[apple-m6-m5-ultra-mac-mini-studio-update.md]]; NVIDIA mit DGX Station 748 GB, siehe [[nvidia-dgx-station-748gb.md]]).
## Die BYD-Frage: Überträgt sich das EV-Playbook auf Silicon?
Das Video stellt die explizite Frage, ob sich die BYD-Dynamik wiederholt: Autobranche lachte über den Opening-Move chinesischer EVs — und verlor danach den Markt. Ob das Playbook (Preisdruck, Volumen, vertikale Integration) auf AI-Hardware übertragbar ist, lässt das Video offen; es benennt es als das Szenario, gegen das NVIDIA/AMD/Apple jetzt antreten müssen.
## Kauf-Fazit-Rahmen (aus dem Video)
- **Box gewinnt**, wenn Kapazität zählt: sehr große/MoE-Modelle lokal, Multimodell-Betrieb, RAM-Preis-Argument
- **RTX 5090 gewinnt**, wenn Decoding-Geschwindigkeit bei dichten Modellen zählt (Bandbreiten-Vorteil der GPU-Klasse)
- Kaufentscheidung hängt vom geplanten Modell ab — nicht vom Sticker-Spec
## Signal zum Beobachten
Das Video nennt als nächsten Prüfstein: ob die chinesischen Boxen mit funktionierenden llama.cpp/vLLM-Backends launchen und ob unabhängige Benchmarks die Bandbreiten-Ansagen bestätigen. Bis dahin sind O100- und C950-Zahlen Hersteller-Claims.
## Verwandte Seiten
- [[cloud-exit-and-local-superiority.md]] — Cloud-Exit-Trend, RAM als neue Währung
- [[apple-m6-m5-ultra-mac-mini-studio-update.md]] — Apples Bandbreiten-/Kapazitäts-Antwort (M5 Ultra 1,2 TB/s)
- [[nvidia-dgx-station-748gb.md]] — NVIDIA-Desktop-Pendant (748 GB), DGX Spark als Einstieg
- [[edge-inference-als-cloud-alternative.md]] — AMD Strix Halo als x86-Klasse derselben Box-Idee
- [[../../concepts/llm/qwen3.8-27b-alibaba.md]] — die 27B-Referenzklasse, die Alibabas C950 laut Claim ohne GPU läuft
- [[../llm/deepseek-v4-pro-ga-harness-open-source.md]] — „China owns models + harness“-Baustein
## Quellen
- [Devsplainers: China Is Coming for Your Local AI Box](https://www.youtube.com/watch?v=rwlHx7Faf1E) — 09:15, 26.08.2026; Raw: [raw/youtube/2026-08-26_devsplainers-china-local-ai-box.md](../../../raw/youtube/2026-08-26_devsplainers-china-local-ai-box.md)

View file

@ -55,6 +55,7 @@ Vergleichsmaßstab: Gemini 3.5 Flash Niveau — aber lokal und offline.
- **[Hardware-Frontier: Neuromorphe Chips](../hardware/neuromorphic-chips-und-quantencomputer.md)** — Langfristige Hardware-Entwicklung jenseits klassischer Chips
- **[Model Routing](../../architecture/model-routing.md)** — OpenClaw-Pipeline mit GLM-5.2 auf Ollama Cloud
- **[Edge-Inferenz als Cloud-Alternative](edge-inference-als-cloud-alternative.md)** — AMDs Ryzen AI Max+ 395 (Strix Halo): 235B lokal, 128 GB unified memory, $1.499 — die x86-Antwort auf die Mac-only-Bewegung
- **[Local-AI-Box & Chinas Vorstoß](china-local-ai-box.md)** — Xiaomi O100 (1,22 TB/s) und Alibaba XuanTie C950 (27B ohne GPU): China greift die Box-Schicht an; DRAM-Knappheit macht ganze Boxes zur günstigen RAM-Quelle
- **[Intelligence Commoditization Thesis](../llm/ai-intelligence-commoditization-thesis.md)** — RAM als Währung = physische Manifestation der Kommoditisierung
## Community-Krallen im Einsatz (Beispiele aus OME21)

View file

@ -70,6 +70,7 @@ Bisher war die Cloud-Exit-These ([[cloud-exit-and-local-superiority.md]]) eine M
- **[Neuromorphe Chips & Quantencomputer](neuromorphic-chips-und-quantencomputer.md)** — Mainzers Energie-Argument: Edge-Inferenz als Zwischenschritt
- **[AI Value Migration — Orchestration](../llm/ai-value-migration-orchestration.md)** — Aravinds Token/Watt/User-Metrik: AMD maximiert lokale Token-Density
- **[Aschenbrenner — Situational Awareness](../agi/aschenbrenner-situational-awareness.md)** — Compute-Skalierung ergänzt durch Edge-Inferenz
- **[Local-AI-Box & Chinas Vorstoß](china-local-ai-box.md)** — Box-Klasse als eigenes Produktformat: Memory-Bandbreite statt Petaflop, Xiaomi O100/Alibaba C950 greifen Strix-Halo-Mini-PCs direkt an
## Quellen

View file

@ -95,6 +95,7 @@ DGX Spark (128 GB, $4.7K) → DGX Station (748 GB, ~$98K) → DGX Datacenter
| Plattform | Unified Memory | Preis | Vorteil | Quelle |
|-----------|---------------|-------|---------|--------|
| AMD Ryzen AI Max+ 395 (Strix Halo) | 128 GB | $1.499 | x86 Edge, lunchbox-Format | [[edge-inference-als-cloud-alternative.md]] |
| Xiaomi AI Cube / O100 ⚠️ Claim | 128 GB (Klasse), 1,22 TB/s Bandbreite | — | Chinas Box-Angriff, 4× Bandbreite der 273-GB/s-Klasse | [[china-local-ai-box.md]] |
| Mac Studio M5 Ultra | (variiert) | — | Value Crown für Solo-Dev | Video-Comparison |
| **NVIDIA DGX Station (GB300)** | **748 GB** | **~$85K$115K** | **Full-precision 70B, sustained ROI** | Diese Seite |
| NVIDIA DGX Spark | 128 GB | ~$4.700 | Prosumer-Einstieg | Diese Seite |

View file

@ -1,7 +1,7 @@
---
created: 2026-08-14
updated: 2026-08-26
sources: [other/2026-08-14_qwen3.8-27b-huggingface-release.md, youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md, xpost/2026-08-19_junsong-dflash2-speculative-decoding.md, xpost/2026-08-19_gregpr07-qwen38-uncensored.md, xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38.md, youtube/2026-08-26_qwen-38-27b-uncensored-mac-cloud-fabian.md, podcast/2026-08-26_agentstack-daily-ep106.md]
sources: [other/2026-08-14_qwen3.8-27b-huggingface-release.md, youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md, xpost/2026-08-19_junsong-dflash2-speculative-decoding.md, xpost/2026-08-19_gregpr07-qwen38-uncensored.md, xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38.md, youtube/2026-08-26_qwen-38-27b-uncensored-mac-cloud-fabian.md, podcast/2026-08-26_agentstack-daily-ep106.md, youtube/2026-08-26_devsplainers-china-local-ai-box.md]
tags: [concept, qwen, qwen3.8, alibaba, 27b, open-weights, chinese-ai, moe, intelligence-density, huggingface, ollama, mtp, local-llm, speculative-decoding, dflash, uncensored, agent-safety]
---
@ -112,6 +112,10 @@ Perplexity bietet in "Portable Computer" ([[../../tools/perplexity-portable-comp
Passt zur Lokal-relevant-Einordnung dieser Seite: ein multimodales 27B-Apache-2.0-Modell mit >1,7M Downloads ist die Referenzgröße der kompakte-Frontier-Klasse.
## Alibabas XuanTie C950: 27B ohne GPU laut Hersteller-Folie (Update 2026-08-26)
Das Devsplainers-Video "China Is Coming for Your Local AI Box" ([[../../concepts/hardware/china-local-ai-box.md]], 26.08.2026) zitiert eine Alibaba-Ankündigungs-Folie: Der neue **RISC-V-Chip XuanTie C950** laufe ein **27B-Modell mit 30 tok/s komplett ohne GPU** in der Box. Falls belastbar, wäre das eine Hardware-Natürlichkeit genau dieser Modellklasse: kein Unified-Memory-GPU-Setup nötig, sondern ein spezialisierte RISC-V-Inferenz-Chip. ⚠️ Hersteller-Claim aus zweiter Hand (Video zitiert Folie); Glaubwürdigkeitstest laut Video: llama.cpp-/vLLM-Backend am Launch Day.
## Offene Punkte
- ⚠️ Detaillierte Benchmarks und Lizenz im Release-Zustand weiter prüfen; die Ollama-Seite bestätigt Architektur + Quantisierung, aber Referenz-Benchmarks (agentic, coding) sind noch nicht im Wiki verankert.

View file

@ -0,0 +1,39 @@
---
created: 2026-08-26
updated: 2026-08-26
sources:
- other/2026-08-26_qwen38-flash-next-qwen4-preview.md
tags: [qwen, alibaba, moe, open-weights, qwen4, local-ai, preview]
---
# Qwen 3.8-Flash-Next — Vorschau auf Qwen 4
## Faktenstand (Ankündigung, Stand 26.08.2026)
| Feld | Wert |
|------|------|
| Modell | Qwen 3.8-Flash-Next |
| Status | Ankündigung — Release „noch in dieser Woche" (laut Page vom 25./26.08.), noch nicht veröffentlicht bei Abruf |
| Architektur | Multimodales **Mixture-of-Experts** |
| Parameter | **125B gesamt, ~6B aktiv pro Token** (+51B N-Gramm-Embedding-Parameter) ⚠️ unverifiziert |
| Einordnung durch Qwen-Team | **Vorschau auf die Qwen-4-Architektur**, ausdrücklich kein fertiges Produkt — Community soll sich auf die volle Qwen-4-Familie vorbereiten |
| Claim | Near-Frontier-Performance zu einem Bruchteil der Compute-Kosten; laut NVIDIA-Forums-Post vergleichbar mit **Qwen 3.7-Plus bei ~1/9 der Trainingskosten**, Stärke **Coding** |
| Benchmarks | ⚠️ Keine publiziert; Parameterzahlen nicht unabhängig verifiziert |
## Finanzierungs-Kontext
Die Ankündigung fällt in Alibabas größte Kapitalbeschaffung für KI: eine **10,2 Mrd USD Aktienplatzierung** (710 Mio neue Aktien à HK$112,70, 8,4 %-Abschlag, ~3× überzeichnet mit 28 Mrd USD Nachfrage) — die größte primäre Folgeemission eines Hongkong-gelisteten Unternehmens überhaupt. 100 % der Mittel sollen in „full-stack AI capabilities" inkl. Infrastruktur fließen. Aktie fiel auf Verwässerungssorgen deutlich.
## Einordnung
- **Sparse-MoE in Consumer-Nähe:** 125B/6B-aktiv wäre lokal relevant, sofern GGUFs/Quants folgen — aktivierungsseitig in der Klasse der lokal diskutierten MoE-Laufzeitziele (vgl. [[../../concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md|M5 Ultra Unified Memory]] und DGX-Spark-Klasse). Die N-Gramm-Embedding-Parameter deuten auf ein MTP-/Speculative-Decoding-freundliches Design (vgl. [[speculative-decoding.md]], DFlash 2).
- **Reihe in der Qwen3.8-Familie:** Flaggschiff Qwen 3.8-Max (2,4T MoE, 03.08.) → Dense [[qwen3.8-27b-alibaba.md]] (Apache 2.0) → jetzt Flash-Next als Qwen-4-Vorschau. Chinesische Labs (Alibaba, DeepSeek) halten das Open-Weight-Tempo; Perplexity-Pages berichten zudem >3 Mrd Qwen-Downloads und eine geplante Revenue-Sharing-Pflicht für große kommerzielle Nutzer der Max-Open-Weights.
- **Vorsicht:** Alle Kernzahlen stammen aus zweiter Hand (NVIDIA-Developer-Forum + Presse); das Qwen-Team selbst hat keine Benchmarks freigegeben. Glaubwürdigkeitstest wie immer am Release Day: HF-Model-Karte, Config.json, erste unabhängige Quants/Benchmarks.
- Geteilt von Kai (@PWeber) in OME Topic "News & Infos" (#12773).
## Quellen
- Perplexity-Page (Aggregation): https://www.perplexity.ai/page/75dfdb0f-3b9c-4158-874a-84587a567c76
- Yahoo Tech: https://tech.yahoo.com/ai/gemini/articles/alibaba-release-qwen-3-8-211604965.html
- NVIDIA Developer Forums: https://forums.developer.nvidia.com/t/qwen3-8-flash-next/381228
- Reuters: https://www.reuters.com/business/retail-consumer/alibaba-set-open-down-8-hong-kong-after-102-billion-share-placement-plan-2026-08-24/

View file

@ -2,7 +2,8 @@
*Auto-generated: 2026-07-07*
*Letzte Aktualisierung: 2026-08-26 (148. Update — OpenClaw Cast (AI World): zweites gepostetes Audio des Tages ingestiert. Raw: `raw/podcast/2026-08-26_openclaw-cast-runaway-agent-budget.md` (neu — Metadata-only: neueste Folge "One Runaway AI Agent Can Spend Past Your Budget", 25.08., 20 Min, kein Transcript verfügbar). Wiki: `institutions/openclaw-cast.md` (neu — KI-generierter Weekly-Podcast mit TTS-Hosts Cleo/Dev, 23 Episoden Rückreihe bis Februar 2026; jede Episode übersetzt eine Community-Warnung in ein lokales Guardrail-Rezept: Budget Breaker/Kill Switch, Task Lease Guard, Release-Sentinel-Canary, Cadence Guard). ⚠️ Episodeninhalt nicht transkribiert/verifiziert, nur Feed-Metadaten.)*
*Letzte Aktualisierung: 2026-08-26 (149. Update — Devsplainers "China Is Coming for Your Local AI Box" (26.08.2026, 09:15; geteilt von Kai @PWeber in OME Topic "Openclaw mit lokalen Modellen", #12769). Raw: `raw/youtube/2026-08-26_devsplainers-china-local-ai-box.md` (neu — Firecrawl-Scrape, Auto-Transcript nur teilweise erfasst, Beschreibung/Kapitel vollständig). Wiki: `concepts/hardware/china-local-ai-box.md` (neu), Updates/Cross-Refs in `concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md` (Apple soll 512/256-GB-Mac-Studio-Konfigurationen entfernt haben — MacRumors/AppleInsider/9to5Mac zitiert), `concepts/hardware/nvidia-dgx-station-748gb.md` (Xiaomi-O100-Zeile im Vergleich + DGX-Spark-Lektion), `concepts/hardware/edge-inference-als-cloud-alternative.md`, `concepts/hardware/cloud-exit-and-local-superiority.md`, `concepts/llm/qwen3.8-27b-alibaba.md`. Kernthese: Memory-Bandbreite statt Petaflops entscheidet Box-Tauglichkeit (DGX Spark: 1 PFLOP Headline, <3 tok/s dichter 70B laut LMSYS); Xiaomi AI Cube/O100 mit 1,22 TB/s Near-Memory-Bandwidth, Alibabas XuanTie C950 (RISC-V) laut Folie 27B @ 30 tok/s ohne GPU; DRAM-Teuerung macht ganze Boxen zur günstigen RAM-Quelle. Zahlen = Hersteller-/Video-Claims.)*
*Vorherige Aktualisierung: 2026-08-26 (148. Update — OpenClaw Cast (AI World): zweites gepostetes Audio des Tages ingestiert. Raw: `raw/podcast/2026-08-26_openclaw-cast-runaway-agent-budget.md` (neu — Metadata-only: neueste Folge "One Runaway AI Agent Can Spend Past Your Budget", 25.08., 20 Min, kein Transcript verfügbar). Wiki: `institutions/openclaw-cast.md` (neu — KI-generierter Weekly-Podcast mit TTS-Hosts Cleo/Dev, 23 Episoden Rückreihe bis Februar 2026; jede Episode übersetzt eine Community-Warnung in ein lokales Guardrail-Rezept: Budget Breaker/Kill Switch, Task Lease Guard, Release-Sentinel-Canary, Cadence Guard). ⚠️ Episodeninhalt nicht transkribiert/verifiziert, nur Feed-Metadaten.)*
*Vorherige Aktualisierung: 2026-08-26 (147. Update — AgentStack Daily EP106-Ingest: erster Podcast-Raw der Reihe (`raw/podcast/` etabliert für den Typ). Raw: `raw/podcast/2026-08-26_agentstack-daily-ep106.md` (neu; alle 15 Stories faktenbasiert, Release Coverage Check + Primary Links). Wiki: `institutions/agentstack-daily.md` (neu — KI-generierter Daily-Podcast NOVA/ALLOY mit 15-Story-Coverage und Primärquellen-Verlinkung), `tools/openai-codex.md` (neu — Codex rust-v0.149.0: agents-Dashboard, queue, doctor, SDK reasoning max|ultra), `concepts/policy/cryptographic-context-injection.md` (neu — verschlüsselter Jailbreak, Representation Gap, Grok-Exfiltrations-Demo), Updates: `concepts/llm/ox-alpha-anonymous-model.md` (exakte EP106-Listing-Zahlen 1.048.576 Kontext / 4.096 Max-Output, read-heavy-Agent-Pipeline-Einordnung, offener Widerspruch zum 131k-Gegencheck dokumentiert) + `concepts/llm/qwen3.8-27b-alibaba.md` (HF-Trending: 11.836 Likes, >1,7 Mio Downloads, Apache 2.0).)*
*Vorherige Aktualisierung: 2026-08-26 (146. Update — Perplexity „Portable Computer“: vollständig lokaler Agent-Stack in Partnerschaft mit NVIDIA (Launch 2026-08-25). Raw: `raw/other/2026-08-26_perplexity-portable-computer-local-agent.md` (neu; Perplexity-Page via Firecrawl abgerufen, web_fetch blockiert mit 403). Wiki: `tools/perplexity-portable-computer.md` (neu), Cross-Refs in `concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md`, `concepts/hardware/nvidia-dgx-station-748gb.md`, `concepts/agents/meta-hatch-ai-agent-platform.md`, `concepts/llm/qwen3.8-27b-alibaba.md`. Kern: Orchestrator + Subagent-Modelle + Agent-Harness komplett on-device; post-trainiertes 27B-Modell + Qwen 3.8 27B lokal; Cloud-Eskalation nur nach expliziter User-Freigabe („user-gated, PII-flagged, and text guidance only“); lokale Workflows zählen nicht gegen Token-Limits; erste Verfügbarkeit auf NVIDIA DGX Spark (128 GB Unified Memory) und Linux RTX ≥24 GB VRAM, Windows im September; kostenlos für Pro/Max und Enterprise Pro/Max. Einordnung: vollständige lokale Agent-Stacks als Big-Tech-Produkt — Gegenmodell zu Meta Hatch. ⚠️ Benchmark 82,6 % = Herstellerangabe. **Nachschub (gleicher Tag):** Tech-Blog-Fakten nachgetragen (`raw/blog/2026-08-26_perplexity-local-first-agent-blog.md`) — Co-Design-These, deterministischer Orchestrator, 4 Harness-Prinzipien, Advisor-Mechanik, volle Benchmark-Tabelle; neue Sektionen in der Wiki-Seite.)*
*Vorherige Aktualisierung: 2026-08-26 (145. Update — Deutschsprachiges Qwen-3.8-27B-Review-Video „Unzensierte KI auf dem Mac und in der Cloud“ (IchBinFabian, 23.08.2026; geteilt von Pit @PWeber in OME Topic „Tips & Tricks“, #12747). Raw: `raw/youtube/2026-08-26_qwen-38-27b-uncensored-mac-cloud-fabian.md` (neu). Wiki-Update: `concepts/llm/qwen3.8-27b-alibaba.md` (neuer Abschnitt). ⚠️ Metadata-only: kein Transcript abrufbar — YouTube blockt alle Player-Clients mit LOGIN_REQUIRED (Bot-Sperre), Invidious/Piped ebenso. Inhalt aus Titel/Metadaten: unzensierter Betrieb, Mac-lokal und Cloud als Optionen — deckt sich mit den dokumentierten Bausteinen Uncensored-Debatte, DFlash 2/MTP-Mac-Speedup und Unsloth-Dynamic-3.0-GGUFs.)*
@ -206,6 +207,7 @@
| [UBTECH U1 — Chinas hyperrealistische Humanoide Roboter](concepts/hardware/ubtech-u1-humanoid-roboter.md) | UBTECH (erstes börsennotiertes Humanoid-Unternehmen): U1 mit Silikonhaut, 88 DOF, Cloud-KI, 13K+ Vorbestellungen ($17.6K$45K), demografischer Treiber (HK 0,77). **Update 19.08.:** China 97 % aller humanoiden Roboter weltweit, US-Importverbot für vernetzte Roboter >2 kg | youtube/2026-07-05_everlast-ki-news-china-roboter-sonnet5-fable5.md + youtube/2026-08-19_ki-experten-alles-zum-kippen.md |
| [$8-Chip mit LLM ohne RAM — TinyML-Inferenz im Ultra-Kleinformat](concepts/hardware/8-dollar-chip-llm-tinyml.md) | Better Stack: ~$8-Mikrocontroller, der ein LLM mit fast keinem RAM ausführt (ESP32-/Pico-Klasse, extreme Quantisierung/Flash-Streaming). Untere Kante der Edge-Inferenz-Skala (wenige KB bis MB) — Gegenpol zu DGX 748 GB / Strix Halo 128 GB. Verbindendes Prinzip: Quantisierung. ⚠️ Metadata-only (kein Transcript) | youtube/2026-08-21_8-dollar-chip-llm-no-ram.md |
| [Apple M6 & M5 Ultra — Mac mini/Mac Studio Sommer-Update](concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md) | Apple überrascht im August mit neuem Mac mini (M6, M5 Pro) und Mac Studio (M5 Max, M5 Ultra). M6 = erster 2-nm-Chip; M5 Ultra = 512 GB Unified Memory @ 1,2 TB/s, UltraFusion 4,4 TB/s (erste Interconnect-Steigerung seit 2022), TB5/RDMA-Cluster für >1T-Parameter-Modelle. OpenClaw als Nachfrage-Treiber genannt (heise). Preise: mini M6 1049€, Studio M5 Ultra ab 6599€. ⚠️ Alle Leistungsangaben = Hersteller-Claims | youtube/2026-08-25_apfelfunk-neue-macs-m6-m5-ultra.md + blog/2026-08-25_heise-apple-m6-m5-ultra-mac-update.md |
| [Local-AI-Box & Chinas Vorstoß — Xiaomi O100, Alibaba XuanTie C950](concepts/hardware/china-local-ai-box.md) | Devsplainers-Analyse (26.08.): Memory-Bandbreite statt Petaflops entscheidet Box-Tauglichkeit; DGX-Spark-Lektion (1 PFLOP Headline, <3 tok/s dichter 70B laut LMSYS); DRAM-Teuerung macht $2000-Mini-PC zum Cheap Seat, Apple entfernt angeblich 512-/256-GB-Studio-Configs; Xiaomi AI Cube/O100 mit 1,22 TB/s Near-Memory-Bandwidth, Alibabas XuanTie C950 (RISC-V) laut Folie 27B @ 30 tok/s ohne GPU; Credibility-Test = llama.cpp/vLLM-Backend am Launch Day; BYD-Frage offen | youtube/2026-08-26_devsplainers-china-local-ai-box.md |
### Agents
| Seite | Beschreibung | Quellen |

View file

@ -2,6 +2,17 @@
*Append-only changelog. Start: 2026-06-05*
## 2026-08-26 — Devsplainers "China Is Coming for Your Local AI Box"
**Type:** ingest | **Scope:** raw/youtube, wiki/concepts/hardware, wiki/concepts/llm, wiki/index, wiki/log
**Source:** Kai (@PWeber), OME Topic „Openclaw mit lokalen Modellen“, #12769: https://www.youtube.com/watch?v=rwlHx7Faf1E
**Inhalt:** Devsplainers-Analyse (09:15, englisch): Xiaomi (AI Cube/O100, 1,22 TB/s Near-Memory-Bandwidth) und Alibaba (XuanTie C950, RISC-V, laut Folie 27B @ 30 tok/s ohne GPU) greifen sechs Tage auseinander die letzte chinesisch-unbesetzte Layer der lokalen KI an — die Hardware-Box. Kernthese: Memory-Bandbreite, nicht Petaflops, entscheidet Decoding-Speed (DGX Spark: 1 PFLOP Headline, <3 tok/s auf dichtem 70B laut LMSYS). DRAM-Teuerung macht ganze Boxen zum Preis eines DDR5-Kits zum Schnäppchen; Video berichtet zudem von entfernten 512-/256-GB-Mac-Studio-Konfigurationen. Credibility-Test für chinesische Launches: llama.cpp/vLLM-Backend am Launch Day. Alle Zahlen Video-/Hersteller-Claims; Auto-Transcript nur teilweise erfasst (Firecrawl), Rest aus Beschreibung/Kapiteln.
**Wiki-Update:**
- `wiki/concepts/hardware/china-local-ai-box.md` (NEU) — Konzeptseite mit Box-Definition, Bandbreiten-These, China-Zügen, Gegenwehr, BYD-Frage, Kauf-Fazit-Rahmen
- Cross-Refs/Updates: `concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md` (Studio-Config-Streichungen + O100-Bandbreiten-Angiff), `concepts/hardware/nvidia-dgx-station-748gb.md` (O100-Zeile in Vergleichstabelle), `concepts/hardware/edge-inference-als-cloud-alternative.md`, `concepts/hardware/cloud-exit-and-local-superiority.md`, `concepts/llm/qwen3.8-27b-alibaba.md` (C950 läuft laut Claim genau die 27B-Referenzklasse)
- Raw (NEU): `raw/youtube/2026-08-26_devsplainers-china-local-ai-box.md`
- index.md: 149. Update | log.md: dieser Eintrag
## 2026-08-25 — PLUR1BUS-Repo-Review und Schema-Migrations-Einordnung
**Type:** ingest | **Scope:** raw/other, wiki/tools, wiki/index, wiki/log