ingest(blog): macstories m5 ultra studio review - independent benchmarks

This commit is contained in:
Hector 2026-09-22 11:24:01 +02:00
parent a12ef1a312
commit bc275bbfb0
8 changed files with 227 additions and 8 deletions

View file

@ -0,0 +1,84 @@
---
type: blog
source_url: https://www.macstories.net/stories/m5-ultra-mac-studio-review-the-dream-mac-for-local-ai-agents/
retrieved: 2026-09-22
title: "M5 Ultra Mac Studio Review: The Dream Mac for Local AI Agents"
author: "Federico Viticci"
published: 2026-09-21
publisher: "MacStories"
tags: [apple, m5-ultra, mac-studio, local-ai, mlx, unified-memory, memory-bandwidth, rtx-5090, qwen3.8-flash-next, glm-5.3-flash, agenten, omx, quantisierung]
---
# M5 Ultra Mac Studio Review: The Dream Mac for Local AI Agents
## Metadaten
- Publikation: MacStories (https://www.macstories.net/), Autor Federico Viticci
- Veröffentlicht: 2026-09-21, 13:00 UTC (`datePublished` der Seite), zuletzt geändert 13:17 UTC
- Abruf: 2026-09-22 via web_fetch (readability-Extraktion, vollständig; 21.401 Zeichen)
- Geteilt von Kai (@PWeber) in OME-Topic „Openclaw mit lokalen Modellen" (#1744), 2026-09-22 09:19 UTC
- Testgerät: M5 Ultra Mac Studio mit **256 GB** RAM (die 512-GB-Variante erscheint laut Artikel erst Ende Oktober)
## Kurzfassung (Fakten aus dem Artikel)
Viticci testete über mehrere Tage das M5 Ultra Mac Studio (256 GB) gegen seinen Vorgänger M3 Ultra (512 GB) und einen Desktop-Gaming-PC mit RTX 5090. Seine These: Der M5 Ultra ist eine „Traummaschine" für lokale KI-Agenten — schnell genug, dass er Qwen3.8-Flash-Next zu seinem Standardmodell in beiden von ihm genutzten Assistenten gemacht hat (Open Minis für iOS und Hermes Agent), und dass diese Assistenten nun vollständig lokal laufen. Er nennt ausdrücklich, dass er OpenClaw und Hermes Agent zuvor skeptisch gegenüber lokalen Modellen war.
## Architektur und Specs (im Artikel bestätigt)
- **Quad-Die-Aufbau:** UltraFusion verbindet zwei Dual-Die-M5-Max-Chips zu einer Quad-Die-Architektur — laut Artikel ein Novum im Apple-Ökosystem.
- **GPU:** 80 Cores, jeder mit einem Neural Accelerator; bis zu **4,5× Peak-GPU-Compute für KI** gegenüber M3 Ultra.
- **Unified Memory:** weiterhin bis **512 GB** (Modell kommt Ende Oktober).
- **Bandbreite:** **819 GB/s → 1,2 TB/s**, also **+50 %** gegenüber M3 Ultra.
- **Referenzpunkt RTX 5090:** 1,79 TB/s Bandbreite, 32 GB VRAM.
## Messwerte (unabhängiger Test, nicht Herstellerangabe)
### Gegen M3 Ultra
- **Token-Generierung: im Schnitt ~70 % schneller** als M3 Ultra (Side-by-Side-Vergleich mit Open Minis auf iOS).
- **Prompt-Processing (Prefill): im Schnitt +150 %** gegenüber M3 Ultra — laut Autor eine ~2,5-fache Verbesserung.
- Qwen3.8-Flash-Next auf dem M5 Ultra: **über 100 tok/s bei kurzen Prompts**, **6085 tok/s bei 64K bis 256K Kontext**.
- Bei Multi-Turn-Agentenschleifen mit Subagenten: 6085 tok/s, auch während das Thread-Kontextfenster wächst.
### Gegen RTX 5090
- **Prefill (compute-gebunden):** Bei einem 6.000-Token-Prompt liest der M5 Ultra mit **~1.700 tok/s**, die RTX 5090 mit **~3.000 tok/s** (Qwen-Modell in LM Studio). Apples Neural Accelerators verkleinern die Lücke, schließen sie aber nicht.
- **Generierung (bandbreitengebunden):** 5090 (1,79 TB/s) gegen M5 Ultra (1,2 TB/s) ergibt einen **konstanten Vorsprung von ~25 %** bei jeder Prompt-Größe.
- **Grenze der 5090:** Nur 32 GB VRAM; bei 256K Kontext reicht es nur noch für einen 8-Bit-Attention-Cache. Modelle über 32 GB müssen per PCIe in den (langsameren) System-RAM ausgelagert werden.
- **Thermik/Lärm:** Der 5090-PC heizte das Büro spürbar auf; das Mac Studio war warm, aber deutlich leiser, Lüfter nicht hörbar (bei Flash-Next-oQ4e im Dauerbetrieb nur mit dem Ohr direkt am Gehäuse wahrnehmbar).
## Praktische Nutzung (Workflow-Beschreibung des Autors)
- **Lokaler Standard:** Qwen3.8-Flash-Next läuft lokal als Default in Open Minis (iOS) und Hermes Agent.
- **Codex-Integration:** Flash-Next in der Codex-App als lokales Modell eingerichtet; GPT-Modelle orchestrieren lokale Subagenten, Flash-Next koordiniert eigene Subagenten; Nutzung per Codex Remote von iOS möglich.
- **Quantisierung:** 5-Bit läuft auf dem 256-GB-Modell vollständig im RAM (laut Autor der Sweet Spot aus Intelligenz, Performance und Speicherverbrauch); 6- und 8-Bit können die N-Gramm-Tabellen per Architektur-Feature auf SSD auslagern.
- **Parallelität:** Mit **oMLX** (0.7.0.dev2) lassen sich auf 256 GB bis zu **drei gleichzeitige Flash-Next-Sessions mit Subagenten** betreiben.
- Größere Modelle wie **GLM-5.3-Flash** laufen dank Unified Memory mit brauchbarer Performance lokal.
### Referenzprojekt: 99 Tage Agenten für 0 $
- Für die Recherche zum iOS-/iPadOS-27-Review baute Viticci die interne App **Desk**: am Ende **310 Dokumente** (Notizen, Sessions, PDFs, geclippte Webseiten).
- Ein Agententeam auf Basis von **DeepSeek V4 Flash** plus **olmOCR** (PDF-Verarbeitung) lief **24/7 über 99 Tage**.
- Aufgaben: WWDC-Sessions transkribieren (mit `summarize` plus LLM-Verarbeitung), Features aus Quellen extrahieren, Features quervalidieren und Kapiteln zuordnen, Features/Bugs aus Screenshots extrahieren, Organisation über die Notion-API.
- Begründung für lokal: Derart dauerhafte Hintergrundlast wäre über OpenAI-/Anthropic-APIs „cost-prohibitive" gewesen.
- Ergebnis laut Artikel: Der gesamte Recherche-Stack lief lokal auf dem Mac Studio zu **Gesamtkosten von 0 $**.
### Cloud-Vergleich (vom Autor ebenfalls getestet)
- Boutique-Anbieter mit Open Minis: **Inco** (Kimi K3, >300 TPS), **Cerebras** (Qwen3.8-27B, 1.800 TPS), **Fireworks** und **Baseten** (>150 TPS).
- Bewertung: sehr gute Nutzererfahrung, aber teuer — der Autor verbrauchte **20 $ Inco-Credits in rund 10 Minuten**.
## Testaufbau (Methodik)
- Automatisierte Tests über ein selbstgebautes Harness, erstellt mit **GPT-6 Astra**; koordinierte mehrere Codex-Instanzen über M3 Ultra, M5 Ultra und einen Windows-PC (Codex-App/Computer Use).
- macOS-Backend: **oMLX 0.7.0.dev2** als MLX-Server. Getestete Modelle: `Qwen3.8-Flash-Next-oQ4e-mtp`, `GLM-5.3-Flash-MLX-mixed-4_8bit`, `Qwen3.8-27B-oQ4e-mtp`; OS: macOS Golden Gate 27.0.
- Windows: LM Studio mit `Qwen3.8-27B-GGUF` (Q4_K_M), CUDA 12, alle 66 Layer auf der GPU; zusätzlich Splits zwischen GPU und System-RAM.
- Messdaten über vier Tage gesammelt; Visualisierungen erstellt mit Claude Fable 5.1 und Opus 5 (Anthropic-Projects-Feature).
## Offen / nicht getestet (vom Autor genannt)
- **DwarfStar** (`antirez/ds4`) — Projekt, das Frontier-Modelle mit noch weniger Speicher auf verschiedenen Mac-Konfigurationen lauffähig macht.
- **Inco Splash** — neue Inference-Engine für Apple Silicon.
- **Exo** — RDMA-Implementierung, die Inferenz theoretisch über Thunderbolt 5 zwischen M3 Ultra und M5 Ultra aufteilen könnte (OpenAI-kompatibler Server davor).
- **512-GB-M5-Ultra** — der Autor möchte dort den 8-Bit-Quant ohne SSD-Offloading messen.
- Erwartung: Ein künftiger **M7 Ultra** könnte die Speicherbandbreite einer 5090 übertreffen.
## Einordnung des Autors
Laut Viticci outperformt Open-Weight-Software auf Consumer-Hardware inzwischen, was vor rund zehn Monaten als „Frontier" galt; mit der M5-Ultra-Performance werde agentisches Coding lokal machbar, und er erwartet entsprechende Experimente aus der MLX-Community. Er beschreibt sich selbst als Tinkerer, nicht als KI-Entwickler (kein Training/Fine-Tuning), und empfiehlt solche Setups ausdrücklich nicht für Nutzer, die einfach nur ein Abo abschließen wollen.

View file

@ -1,8 +1,8 @@
--- ---
created: 2026-08-25 created: 2026-08-25
updated: 2026-08-26 updated: 2026-09-22
sources: [youtube/2026-08-25_apfelfunk-neue-macs-m6-m5-ultra.md, blog/2026-08-25_heise-apple-m6-m5-ultra-mac-update.md] sources: [youtube/2026-08-25_apfelfunk-neue-macs-m6-m5-ultra.md, blog/2026-08-25_heise-apple-m6-m5-ultra-mac-update.md, blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md]
tags: [concept, hardware, apple, m6, m5-pro, m5-max, m5-ultra, mac-mini, mac-studio, unified-memory, local-ai, thunderbolt-5] tags: [concept, hardware, apple, m6, m5-pro, m5-max, m5-ultra, mac-mini, mac-studio, unified-memory, local-ai, thunderbolt-5, mlx, rtx-5090, benchmarks, memory-bandwidth]
--- ---
# Apple M6 & M5 Ultra — Mac mini/Mac Studio Sommer-Update für lokale KI # Apple M6 & M5 Ultra — Mac mini/Mac Studio Sommer-Update für lokale KI
@ -55,7 +55,23 @@ Heise benennt den Unternehmens-Winkel explizit: Der Leistungszuwachs der „KI-K
- **Preis-Schiene:** Speicherknappheit treibt die Preise — RAM bleibt die knappe Währung ([[lokale-ki-coding.md]] nennt dieselbe Dynamik von der Kosten-Seite). - **Preis-Schiene:** Speicherknappheit treibt die Preise — RAM bleibt die knappe Währung ([[lokale-ki-coding.md]] nennt dieselbe Dynamik von der Kosten-Seite).
- **Chinas Gegenangriff auf dieselbe Schicht:** Laut Devsplainers (26.08.) hat Apple zusätzlich die **512-GB-/256-GB-Mac-Studio-Konfigurationen** entfernt (MacRumors/AppleInsider/9to5Mac zitiert dort) und Xiaomi greift mit dem O100 (1,22 TB/s) die Bandbreiten-Führung an — siehe [[china-local-ai-box.md]]. - **Chinas Gegenangriff auf dieselbe Schicht:** Laut Devsplainers (26.08.) hat Apple zusätzlich die **512-GB-/256-GB-Mac-Studio-Konfigurationen** entfernt (MacRumors/AppleInsider/9to5Mac zitiert dort) und Xiaomi greift mit dem O100 (1,22 TB/s) die Bandbreiten-Führung an — siehe [[china-local-ai-box.md]].
⚠️ **Quellenlage:** Sämtliche Performance-Zahlen sind Apple-Angaben aus dem heise-Bericht; unabhängige Benchmarks gab es zum Ingest-Zeitpunkt noch nicht. Das Apfelfunk-Video (16:49, deutsch) war ohne Transcript — erfasst sind Metadaten, Beschreibung und Kapitelmarken; die inhaltliche Substanz stammt aus dem verlinkten heise-Artikel. ## Verifikation: unabhängige Benchmarks (MacStories, 2026-09-21)
Die zuvor offene Lücke — „nur Herstellerangaben" — ist geschlossen. [[../../people/federico-viticci.md|Federico Viticci]] ([[../../institutions/macstories.md|MacStories]]) testete das **M5 Ultra Mac Studio mit 256 GB** über mehrere Tage gegen einen M3 Ultra (512 GB) und einen Desktop-PC mit RTX 5090. Geteilt von Kai (@PWeber) im OME-Topic „Openclaw mit lokalen Modellen". Die Specs wurden bestätigt: Quad-Die-Aufbau via UltraFusion, 80 GPU-Cores mit je einem Neural Accelerator, **Bandbreite 819 GB/s → 1,2 TB/s (+50 %)**.
| Metrik | Messwert | Vergleich |
|--------|----------|-----------|
| Token-Generierung | ~**+70 %** | vs. M3 Ultra (Side-by-Side, Open Minis) |
| Prompt-Processing (Prefill) | ~**+150 %** (≈2,5×) | vs. M3 Ultra |
| Generierung, Qwen3.8-Flash-Next | **>100 tok/s** kurz / **6085 tok/s** | bei 64K256K Kontext |
| Prefill, 6.000-Token-Prompt | **~1.700 tok/s** | RTX 5090: **~3.000 tok/s** |
| Generierung (bandbreitengebunden) | — | RTX 5090 konstant **~25 %** voraus (1,79 TB/s vs. 1,2 TB/s) |
Die Messwerte bestätigen zugleich die Bandbreiten-These aus [[china-local-ai-box.md]]: Prefill ist compute-gebunden (Tensor/Neural Cores), Generierung ist bandbreitengebunden — und die 5090 verliert trotz ihres Vorsprungs bei Modellen über 32 GB VRAM, weil sie per PCIe in den System-RAM auslagern muss.
**Praxistauglichkeit (Agenten-Last, nicht Chat-Benchmark):** Viticci hat Qwen3.8-Flash-Next ([[../llm/qwen3.8-flash-next-qwen4-preview.md]]) als lokales Default-Modell in Open Minis und Hermes Agent gesetzt; 5-Bit läuft vollständig im RAM, mit oMLX sind bis zu drei parallele Flash-Next-Sessions mit Subagenten möglich, größere Modelle wie GLM-5.3-Flash ([[../llm/glm-5.3-z-ai.md]]) laufen lokal mit brauchbarer Performance. Sein Referenzprojekt: 99 Tage durchgehender Agentenbetrieb (DeepSeek V4 Flash + olmOCR, 310 Dokumente) zu Gesamtkosten von **0 $** — siehe [[lokale-ki-coding.md]].
⚠️ **Quellenlage (aktualisiert):** Die Apple-Angaben aus dem heise-Bericht sind für Bandbreite und Architektur durch unabhängige Messungen bestätigt; die konkreten Tokens/s-Werte stammen aus einem Einzeltest (MacStories, n=1 Setup) und sind nicht breit repliziert. Das Apfelfunk-Video (16:49, deutsch) war ohne Transcript — erfasst sind Metadaten, Beschreibung und Kapitelmarken.
## Verwandte Seiten ## Verwandte Seiten
@ -65,3 +81,7 @@ Heise benennt den Unternehmens-Winkel explizit: Der Leistungszuwachs der „KI-K
- [[lokale-ki-coding.md]] — Kostenfrage lokaler KI: Hardware statt Tokens - [[lokale-ki-coding.md]] — Kostenfrage lokaler KI: Hardware statt Tokens
- [[../../tools/openclaw.md]] — OpenClaw als genannter Nachfrage-Treiber - [[../../tools/openclaw.md]] — OpenClaw als genannter Nachfrage-Treiber
- [[../../tools/perplexity-portable-computer.md]] — lokaler Big-Tech-Agent-Stack, erste Verfügbarkeit auf DGX Spark - [[../../tools/perplexity-portable-computer.md]] — lokaler Big-Tech-Agent-Stack, erste Verfügbarkeit auf DGX Spark
- [[../../people/federico-viticci.md]] — unabhängiger Tester (M5-Ultra-Review, Messwerte oben)
- [[../../institutions/macstories.md]] — Publikation des Reviews, unabhängige Verifikationsquelle
- [[../llm/qwen3.8-flash-next-qwen4-preview.md]] — lokal als Default-Modell eingesetzt (>100 tok/s kurz)
- [[china-local-ai-box.md]] — Bandbreiten-These, durch die Messwerte praktisch bestätigt

View file

@ -57,6 +57,8 @@ Vergleichsmaßstab: Gemini 3.5 Flash Niveau — aber lokal und offline.
- **[Edge-Inferenz als Cloud-Alternative](edge-inference-als-cloud-alternative.md)** — AMDs Ryzen AI Max+ 395 (Strix Halo): 235B lokal, 128 GB unified memory, $1.499 — die x86-Antwort auf die Mac-only-Bewegung - **[Edge-Inferenz als Cloud-Alternative](edge-inference-als-cloud-alternative.md)** — AMDs Ryzen AI Max+ 395 (Strix Halo): 235B lokal, 128 GB unified memory, $1.499 — die x86-Antwort auf die Mac-only-Bewegung
- **[Local-AI-Box & Chinas Vorstoß](china-local-ai-box.md)** — Xiaomi O100 (1,22 TB/s) und Alibaba XuanTie C950 (27B ohne GPU): China greift die Box-Schicht an; DRAM-Knappheit macht ganze Boxes zur günstigen RAM-Quelle - **[Local-AI-Box & Chinas Vorstoß](china-local-ai-box.md)** — Xiaomi O100 (1,22 TB/s) und Alibaba XuanTie C950 (27B ohne GPU): China greift die Box-Schicht an; DRAM-Knappheit macht ganze Boxes zur günstigen RAM-Quelle
- **[Intelligence Commoditization Thesis](../llm/ai-intelligence-commoditization-thesis.md)** — RAM als Währung = physische Manifestation der Kommoditisierung - **[Intelligence Commoditization Thesis](../llm/ai-intelligence-commoditization-thesis.md)** — RAM als Währung = physische Manifestation der Kommoditisierung
- **[Apple M6 & M5 Ultra](apple-m6-m5-ultra-mac-mini-studio-update.md)** — Unabhängig verifizierte Bandbreiten-/Prefill-Werte der M5 Ultra (1,2 TB/s) gegen RTX 5090; MacStories belegt die These praktisch: 99 Tage Agentenbetrieb, 0 $ Cloud-Kosten
- **[Lokale KI zum Coding](lokale-ki-coding.md)** — dieselbe Kostenlogik (Hardware statt Tokens) aus der Coding-Perspektive
## Community-Krallen im Einsatz (Beispiele aus OME21) ## Community-Krallen im Einsatz (Beispiele aus OME21)

View file

@ -1,9 +1,10 @@
--- ---
created: 2026-08-26 created: 2026-08-26
updated: 2026-08-26 updated: 2026-09-22
sources: sources:
- other/2026-08-26_qwen38-flash-next-qwen4-preview.md - other/2026-08-26_qwen38-flash-next-qwen4-preview.md
tags: [qwen, alibaba, moe, open-weights, qwen4, local-ai, preview] - blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md
tags: [qwen, alibaba, moe, open-weights, qwen4, local-ai, preview, mlx, m5-ultra]
--- ---
# Qwen 3.8-Flash-Next — Vorschau auf Qwen 4 # Qwen 3.8-Flash-Next — Vorschau auf Qwen 4
@ -31,6 +32,19 @@ Die Ankündigung fällt in Alibabas größte Kapitalbeschaffung für KI: eine **
- **Vorsicht:** Alle Kernzahlen stammen aus zweiter Hand (NVIDIA-Developer-Forum + Presse); das Qwen-Team selbst hat keine Benchmarks freigegeben. Glaubwürdigkeitstest wie immer am Release Day: HF-Model-Karte, Config.json, erste unabhängige Quants/Benchmarks. - **Vorsicht:** Alle Kernzahlen stammen aus zweiter Hand (NVIDIA-Developer-Forum + Presse); das Qwen-Team selbst hat keine Benchmarks freigegeben. Glaubwürdigkeitstest wie immer am Release Day: HF-Model-Karte, Config.json, erste unabhängige Quants/Benchmarks.
- Geteilt von Kai (@PWeber) in OME Topic "News & Infos" (#12773). - Geteilt von Kai (@PWeber) in OME Topic "News & Infos" (#12773).
## Unabhängiger Praxistest (MacStories, 2026-09-21)
Erster dokumentierter **Praxis-Einsatz** des Modells: [[../../people/federico-viticci.md|Federico Viticci]] ([[../../institutions/macstories.md|MacStories]]) betreibt Flash-Next auf einem **M5 Ultra Mac Studio (256 GB)** und hat es zum **Standardmodell** in beiden von ihm primär genutzten Assistenten gemacht — Open Minis (iOS) und Hermes Agent. Gemessene Werte auf dieser Hardware:
| Metrik | Wert |
|--------|------|
| Kurze Prompts | **>100 tok/s** |
| 64K256K Kontext | **6085 tok/s** |
| Quantisierung | 5-Bit vollständig im RAM („Sweet Spot"); 6-/8-Bit mit SSD-Offloading der N-Gramm-Tabellen |
| Parallelität | bis zu **3 gleichzeitige Flash-Next-Sessions** mit Subagenten (oMLX, 256 GB) |
Wichtig für die Einordnung: Der Test belastet genau die Punkte, die hier unter „Vorsicht" offen waren — **agentische Last** (Harness-Kontext, Tool-Calls, Subagenten, wachsende Threads) statt Chat-Benchmarks. Viticci nutzt das Modell auch in der Codex-App als lokales Modell unter einem GPT-Orchestrator. Details und vollständige Messreihe: [[../hardware/apple-m6-m5-ultra-mac-mini-studio-update.md|M5 Ultra Benchmarks]]. ⚠️ Einzelsetup (n=1), kein unabhängiges Benchmark-Suite-Ergebnis.
## Quellen ## Quellen
- Perplexity-Page (Aggregation): https://www.perplexity.ai/page/75dfdb0f-3b9c-4158-874a-84587a567c76 - Perplexity-Page (Aggregation): https://www.perplexity.ai/page/75dfdb0f-3b9c-4158-874a-84587a567c76

View file

@ -2,7 +2,8 @@
*Auto-generated: 2026-07-07* *Auto-generated: 2026-07-07*
*Letzte Aktualisierung: 2026-09-22 (238. Update — Unabhängiger Jev-vs.-GPT-5.6-Terra-Benchmark von N8 Programs, geteilt als r/ProAI-Repost. **Quelle vollständig aufgelöst:** Reddit-RSS (17.09., normale Seite/JSON blockiert) → [X-Thread](https://x.com/N8Programs/status/2100088523403432357) (16.09.; 179.846 Views beim Abruf) → vier Originalgrafiken lokal gelesen. **Methode:** neun Multiple-Choice-Bedingungen; Terra `reasoning=none`, Letter-only. **Resultate:** Jev gewinnt MMLU 90,91:87,89, GPQA 68,18:56,06, ARC-Easy/Challenge knapp und WinoGrande 91,63:78,69; Terra gewinnt HellaSwag 95,32:94,86, GSM8K deutlich (87,72:79,68 bzw. 69,83:54,59) und Schach knapp 50,25:49,45. Ungewichteter Makromittelwert **Jev 80,69 % · Terra 80,15 %** → „Terra-tier“ trägt eng für diesen Test, nicht als allgemeine Intelligenzbehauptung. **Korrektur des Threadtexts:** Er behauptet einen Jev-Sieg auf HellaSwag; die eigene Tabelle zeigt Terra +0,46 Pp. **Kalibrierung:** N=33.735, ECE **1,74 Pp**, 10 Bins, Wilson-95-%-Intervalle, Einzelbenches 0,266,96 Pp — stärkste öffentliche Fremdevidenz für RLCD bisher. **Kosten:** Jev $0,6999 (estimated: Input-Token × $0,042/MTok) vs. Terra $12,9865 (API-reported) = **18,55×**; die ~18×-Rundung hält, die Hersteller-Obergrenze 400444,6× nicht. **Nicht geprüft:** Geschwindigkeit; kein Repo, keine Prompts/Seeds/Logs, keine Reproduktion, Kontaminationsrisiko öffentlicher Benches. Wiki: `people/n8-programs.md` (neu), `concepts/llm/system-one-models-jev.md` (neuer unabhängiger Benchmark-Abschnitt). Raw: `raw/other/2026-09-17_reddit-n8-jev-terra-benchmark.md` (neu).)* *Letzte Aktualisierung: 2026-09-22 (239. Update — MacStories-Review „M5 Ultra Mac Studio Review: The Dream Mac for Local AI Agents" (Federico Viticci, 21.09.2026; geteilt von Kai @PWeber in OME Topic „Openclaw mit lokalen Modellen", #1744). **Erste unabhängige Verifikation der M5-Ultra-Versprechen** — schließt die Lücke „⚠️ nur Herstellerangaben" auf der Apple-Seite. Raw: `raw/blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md` (neu; web_fetch vollständig, 21.401 Zeichen). Wiki: `people/federico-viticci.md` (neu), `institutions/macstories.md` (neu), Updates in `concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md` (neuer Messwert-Abschnitt: 256-GB-Gerät gegen M3 Ultra 512 GB und RTX 5090 — Generierung ~+70 %, Prefill ~+150 % (≈2,5×), Flash-Next >100 tok/s bei kurzem Prompt und 6085 tok/s bei 64K256K Kontext; Prefill bei 6.000-Token-Prompt ~1.700 tok/s vs. 5090 ~3.000 tok/s; Generierung 5090 konstant ~25 % voraus (1,79 vs. 1,2 TB/s), verliert aber oberhalb 32 GB VRAM), `concepts/llm/qwen3.8-flash-next-qwen4-preview.md` (erster dokumentierter Praxiseinsatz: Flash-Next als lokales Default-Modell in Open Minis und Hermes Agent, 5-Bit vollständig im RAM, bis zu 3 parallele Sessions mit Subagenten via oMLX), `concepts/hardware/cloud-exit-and-local-superiority.md` (Cross-Ref). **Produktivnachweis:** 99 Tage Dauerbetrieb mit DeepSeek-V4-Flash-Agenten + olmOCR über 310 Dokumente fürs iOS-/iPadOS-27-Review — Gesamtkosten 0 $, weil dieselbe Dauerlast per Cloud-API als untragbar eingeschätzt wurde. ⚠️ Einzelsetup (n=1), keine reproduzierte Benchmark-Suite.)*
*Vorherige Aktualisierung: 2026-09-22 (238. Update — Unabhängiger Jev-vs.-GPT-5.6-Terra-Benchmark von N8 Programs, geteilt als r/ProAI-Repost. **Quelle vollständig aufgelöst:** Reddit-RSS (17.09., normale Seite/JSON blockiert) → [X-Thread](https://x.com/N8Programs/status/2100088523403432357) (16.09.; 179.846 Views beim Abruf) → vier Originalgrafiken lokal gelesen. **Methode:** neun Multiple-Choice-Bedingungen; Terra `reasoning=none`, Letter-only. **Resultate:** Jev gewinnt MMLU 90,91:87,89, GPQA 68,18:56,06, ARC-Easy/Challenge knapp und WinoGrande 91,63:78,69; Terra gewinnt HellaSwag 95,32:94,86, GSM8K deutlich (87,72:79,68 bzw. 69,83:54,59) und Schach knapp 50,25:49,45. Ungewichteter Makromittelwert **Jev 80,69 % · Terra 80,15 %** → „Terra-tier“ trägt eng für diesen Test, nicht als allgemeine Intelligenzbehauptung. **Korrektur des Threadtexts:** Er behauptet einen Jev-Sieg auf HellaSwag; die eigene Tabelle zeigt Terra +0,46 Pp. **Kalibrierung:** N=33.735, ECE **1,74 Pp**, 10 Bins, Wilson-95-%-Intervalle, Einzelbenches 0,266,96 Pp — stärkste öffentliche Fremdevidenz für RLCD bisher. **Kosten:** Jev $0,6999 (estimated: Input-Token × $0,042/MTok) vs. Terra $12,9865 (API-reported) = **18,55×**; die ~18×-Rundung hält, die Hersteller-Obergrenze 400444,6× nicht. **Nicht geprüft:** Geschwindigkeit; kein Repo, keine Prompts/Seeds/Logs, keine Reproduktion, Kontaminationsrisiko öffentlicher Benches. Wiki: `people/n8-programs.md` (neu), `concepts/llm/system-one-models-jev.md` (neuer unabhängiger Benchmark-Abschnitt). Raw: `raw/other/2026-09-17_reddit-n8-jev-terra-benchmark.md` (neu).)*
*Vorherige Aktualisierung: 2026-09-22 (237. Update — Grok 4.7 + Grok-Bot-Praxis + ART19-Podcast. **Primärquellen:** [xAI Release](https://x.ai/news/grok-4-7), [API-Modellkarte](https://docs.x.ai/developers/models/grok-4.7), [Cursor-Modellseite](https://cursor.com/docs/models/grok-4-7). Grok 4.7: größerer Basismodell-Kern, längeres RL auf schwierigen mehrstündigen Aufgaben, stärkere Selbstprüfung, natives Grok-Bot-Harness-Verständnis; Modell-ID `grok-4.7`, 500k API-Kontext, Reasoning `low|medium|high|xhigh`; API <200k Prompt $2/M Input · $0,50/M Cached · $6/M Output, ab 200k $4/$1/$12. Herstellerbenchmarks u. a. CursorBench 46,3 %, DeepSWE 71,0 %, Terminal-Bench 38,0 % **nicht unabhängig reproduziert**. @cb_doge-Post primär gegengeprüft; twice as fast and half the price bleibt dessen Verdichtung. Alex Finns Video (14:06, geteilt von Pit): kein Transcript abrufbar; Workflow nur attribuiert aus YouTube-AI-Zusammenfassung + Herman-Auswertung (PM/Developer/Designer, Exec-Team, Linear/Notion-Issues, Cursor Cloud Agents). Zusätzlich Netbits ART19-MP3 als Voll-Ingest: Grok AI Daily“, 21.09., 29:30, lokales Maschinen-ASR; allgemeiner Newsrecap zu Meta Muse, Cyber-/Safety-Claims, USChina, Trump und Newsom **kein Grok 4.7**, Grok Bot nur beiläufig. Wiki: `institutions/grok-ai-daily.md` (neu); Updates `institutions/xai.md`, `tools/grok-bot-spacexai.md`, `concepts/llm/llm-model-catalog.md`, `concepts/policy/ai-regulation-2026.md`. Raw: 4 neue Einträge in blog/xpost/youtube/podcast.)* *Vorherige Aktualisierung: 2026-09-22 (237. Update — Grok 4.7 + Grok-Bot-Praxis + ART19-Podcast. **Primärquellen:** [xAI Release](https://x.ai/news/grok-4-7), [API-Modellkarte](https://docs.x.ai/developers/models/grok-4.7), [Cursor-Modellseite](https://cursor.com/docs/models/grok-4-7). Grok 4.7: größerer Basismodell-Kern, längeres RL auf schwierigen mehrstündigen Aufgaben, stärkere Selbstprüfung, natives Grok-Bot-Harness-Verständnis; Modell-ID `grok-4.7`, 500k API-Kontext, Reasoning `low|medium|high|xhigh`; API <200k Prompt $2/M Input · $0,50/M Cached · $6/M Output, ab 200k $4/$1/$12. Herstellerbenchmarks u. a. CursorBench 46,3 %, DeepSWE 71,0 %, Terminal-Bench 38,0 % **nicht unabhängig reproduziert**. @cb_doge-Post primär gegengeprüft; twice as fast and half the price bleibt dessen Verdichtung. Alex Finns Video (14:06, geteilt von Pit): kein Transcript abrufbar; Workflow nur attribuiert aus YouTube-AI-Zusammenfassung + Herman-Auswertung (PM/Developer/Designer, Exec-Team, Linear/Notion-Issues, Cursor Cloud Agents). Zusätzlich Netbits ART19-MP3 als Voll-Ingest: Grok AI Daily“, 21.09., 29:30, lokales Maschinen-ASR; allgemeiner Newsrecap zu Meta Muse, Cyber-/Safety-Claims, USChina, Trump und Newsom **kein Grok 4.7**, Grok Bot nur beiläufig. Wiki: `institutions/grok-ai-daily.md` (neu); Updates `institutions/xai.md`, `tools/grok-bot-spacexai.md`, `concepts/llm/llm-model-catalog.md`, `concepts/policy/ai-regulation-2026.md`. Raw: 4 neue Einträge in blog/xpost/youtube/podcast.)*
*Vorherige Aktualisierung: 2026-09-20 (236. Update — Gebrauchtmarkt DDR4: der Zweitmarkt-Anker schließt die Rechnung. Anlass: Nachtrag zur Leo-2-These (235. Update) — die entscheidende Zahl für „altes DDR4 weiterverwenden“ war der **Zweitmarkt**, und der fehlte. **Quelle:** [DIMMsum](https://dimmsum.com/ddr4/64gb-2666-rdimm) (Tracker laufender eBay-Listings), abgerufen 20.09.2026; Zweitquelle [ITLD Server-RAM/SSD-Marktupdate 2026](https://itldc.com/en/blog/server-ram-ssd-market-update-2026). **Werte:** 64 GB DDR4 RDIMM (2666, PC4-21300) gebraucht **~$325550/Modul ≈ $58,50/GB**; günstigste Listings ab ~$326, **Median ~$545**; Lots (4×64 GB) bis **~$5/GB**; 3200 MHz/Marken/Neuzustand oft $400600+, Refurbished/NOS $295550. Preistreiber: Speed, Rank, Marke (Samsung/Micron/SK Hynix), Zustand, Verkäufer. ITLD: Server-Speicher-**Kontraktpreise +9398 % QoQ (Q1 2026)**, **+5863 % (Q2)**; 64-GB-DDR4-RDIMM im August auf dem **2,53,5-Fachen** des Januar-Niveaus; Gebrauchtpreise ebenfalls steigend (+430 % MoM bei Consumer-Kits), aber weiterhin „a relative bargain“; DDR4 punktuell **mit Aufpreis pro Bit gegenüber DDR5**; Angebot knapp bis 2027. **Befund (Kern, Einordnung):** **~$58,50/GB gebraucht gegen ~$29/GB neu** (abgeleiteter DDR5-RDIMM) = **rund 35× pro Gigabyte** — bei etwa **halber Bandbreite** (DDR4-2666 ≈ 21,3 GB/s pro Kanal gegen DDR5-4800/5600 ≈ 3845 GB/s). Der Controller monetarisiert damit nicht billigen DRAM, sondern **Zugang zum Zweitmarkt** — und der Neukauf-Pfad ist sogar der teurere (neues DDR4 $84,43 vs. neues DDR5 $56,11 pro Die). ⚠️ **Angebotspreise, keine Transaktionspreise**; keine öffentlichen Volumendaten. Ein früherer Stand (kein öffentlicher Gebraucht-Tracker für DDR4) ist überholt — DIMMsum existiert. Wiki: `concepts/hardware/gaming-hardwarekrise-ai-speicher.md` (neuer Abschnitt „Der Zweitmarkt schließt die Rechnung“), `institutions/astera-labs.md` (TCO-Zahl), `concepts/hardware/ai-infrastruktur-custom-silicon.md` (Preisachse ergänzt). Raw: `raw/other/2026-09-20_ddr4-gebrauchtmarkt-dimmsum.md` (neu — eigener Raw-Eintrag, bestehender Spot-Snapshot bleibt unangetastet).* *Vorherige Aktualisierung: 2026-09-20 (236. Update — Gebrauchtmarkt DDR4: der Zweitmarkt-Anker schließt die Rechnung. Anlass: Nachtrag zur Leo-2-These (235. Update) — die entscheidende Zahl für „altes DDR4 weiterverwenden“ war der **Zweitmarkt**, und der fehlte. **Quelle:** [DIMMsum](https://dimmsum.com/ddr4/64gb-2666-rdimm) (Tracker laufender eBay-Listings), abgerufen 20.09.2026; Zweitquelle [ITLD Server-RAM/SSD-Marktupdate 2026](https://itldc.com/en/blog/server-ram-ssd-market-update-2026). **Werte:** 64 GB DDR4 RDIMM (2666, PC4-21300) gebraucht **~$325550/Modul ≈ $58,50/GB**; günstigste Listings ab ~$326, **Median ~$545**; Lots (4×64 GB) bis **~$5/GB**; 3200 MHz/Marken/Neuzustand oft $400600+, Refurbished/NOS $295550. Preistreiber: Speed, Rank, Marke (Samsung/Micron/SK Hynix), Zustand, Verkäufer. ITLD: Server-Speicher-**Kontraktpreise +9398 % QoQ (Q1 2026)**, **+5863 % (Q2)**; 64-GB-DDR4-RDIMM im August auf dem **2,53,5-Fachen** des Januar-Niveaus; Gebrauchtpreise ebenfalls steigend (+430 % MoM bei Consumer-Kits), aber weiterhin „a relative bargain“; DDR4 punktuell **mit Aufpreis pro Bit gegenüber DDR5**; Angebot knapp bis 2027. **Befund (Kern, Einordnung):** **~$58,50/GB gebraucht gegen ~$29/GB neu** (abgeleiteter DDR5-RDIMM) = **rund 35× pro Gigabyte** — bei etwa **halber Bandbreite** (DDR4-2666 ≈ 21,3 GB/s pro Kanal gegen DDR5-4800/5600 ≈ 3845 GB/s). Der Controller monetarisiert damit nicht billigen DRAM, sondern **Zugang zum Zweitmarkt** — und der Neukauf-Pfad ist sogar der teurere (neues DDR4 $84,43 vs. neues DDR5 $56,11 pro Die). ⚠️ **Angebotspreise, keine Transaktionspreise**; keine öffentlichen Volumendaten. Ein früherer Stand (kein öffentlicher Gebraucht-Tracker für DDR4) ist überholt — DIMMsum existiert. Wiki: `concepts/hardware/gaming-hardwarekrise-ai-speicher.md` (neuer Abschnitt „Der Zweitmarkt schließt die Rechnung“), `institutions/astera-labs.md` (TCO-Zahl), `concepts/hardware/ai-infrastruktur-custom-silicon.md` (Preisachse ergänzt). Raw: `raw/other/2026-09-20_ddr4-gebrauchtmarkt-dimmsum.md` (neu — eigener Raw-Eintrag, bestehender Spot-Snapshot bleibt unangetastet).*
*Vorherige Aktualisierung: 2026-09-20 (235. Update — DRAM-Spotpreise: DDR4 ist pro Die teurer als DDR5 — Beleg für die Leo-2-These. Anlass: Eine Rückfrage im OME Topic „Theorie-Bildung" zu den ungefähren Kosten der „altes DDR4 weiterverwenden"-Idee (Astera Labs Leo 2, aus dem TechTechPotato-Ingest vom selben Tag). **Vorgehen:** beide Tracker-Seiten direkt abgerufen (nicht über Suchzusammenfassungen) — [MemoryIndex DDR5](https://memoryindex.io/ddr5-price), [DDR4](https://memoryindex.io/ddr4-price), [Methodik](https://memoryindex.io/methodology); Seitenkopf „Live · 2026-09-20 00:00Z", Spot-Basis **DRAMeXchange / TrendForce, gemeldet 17.09.2026**. **Werte (USD/Die):** DDR5 16Gb 4800/5600 **$56.11** (+6,38 % 30T, **+480 % YoY**); DDR5 16Gb eTT **$24.55** (+0,36 %, +330 %); DDR4 16Gb 3200 **$84.43** (+4,85 %, **+690 %**); DDR4 8Gb 3200 **$45.59** (+6,41 %, **+860 %**); DDR5 RDIMM 64GB **$1.857/Modul** (+4,47 %, +455 %, **derived** aus Die-Spot +~6 % Modulaufschlag, kein öffentlicher Modulausdruck). Balances: DDR5-Basket 30T +14,23 % / YoY +331,67 %, DDR4-Basket 30T +4,49 % / YoY +563,00 %. **Befund (Kern):** Die DDR4/DDR5-Inversion — der abgekündigte Knoten ist **pro Die teurer** als die neue Generation, und seine Jahresveränderung ist steiler. **Konsequenz (Einordnung, nicht Quelle):** Die „altes DDR4 weiterverwenden"-These trägt **nicht über den Neukauf**, sondern ausschließlich über den **Zweitmarkt** aus stillgelegten Servern — genau das monetarisiert ein CXL-Controller. **Zweite Quelle:** [ServeTheHome zu Leo 2 / Leo X](https://www.servethehome.com/astera-labs-releases-leo-2-cxl-memory-controllers-and-leo-x-controller-for-rackscale-fabric-attached-memory/) (abgerufen 20.09.2026) liefert die Technik nach: PCIe Gen6/CXL 3.2, 2→4 Kanäle, bis **768 GB DDR4** bzw. **4 TB DDR5** pro Expander, 4-Kanal-**3DPC**-Board mit **12 DDR4-DIMMs**, Leo X fabric-attached über Scorpio (KV-Caching, Anbieterangabe 62 % TTFT / 22 % Durchsatz), **keine Preise genannt**, Vorgänger **Marvell Structera**. RAS (Hardware-Testmuster je DIMM, Soft-ECC über Hardware-ECC) als Voraussetzung der Wiederverwendung. ⚠️ Spot-/derived-Niveaus, keine Vertragspreise; Momentaufnahme; Intraday-Reihen laut Anbieter-Methodik rückwärts gerechnet. Wiki: `wiki/institutions/astera-labs.md` (neu); Updates `concepts/hardware/gaming-hardwarekrise-ai-speicher.md` (Preis-Anker + Inversions-Analyse), `concepts/hardware/ai-infrastruktur-custom-silicon.md` (Nachtrag Leo 2 + Preisachse). Raw: `raw/other/2026-09-20_dram-spotpreise-memoryindex.md` (neu).* *Vorherige Aktualisierung: 2026-09-20 (235. Update — DRAM-Spotpreise: DDR4 ist pro Die teurer als DDR5 — Beleg für die Leo-2-These. Anlass: Eine Rückfrage im OME Topic „Theorie-Bildung" zu den ungefähren Kosten der „altes DDR4 weiterverwenden"-Idee (Astera Labs Leo 2, aus dem TechTechPotato-Ingest vom selben Tag). **Vorgehen:** beide Tracker-Seiten direkt abgerufen (nicht über Suchzusammenfassungen) — [MemoryIndex DDR5](https://memoryindex.io/ddr5-price), [DDR4](https://memoryindex.io/ddr4-price), [Methodik](https://memoryindex.io/methodology); Seitenkopf „Live · 2026-09-20 00:00Z", Spot-Basis **DRAMeXchange / TrendForce, gemeldet 17.09.2026**. **Werte (USD/Die):** DDR5 16Gb 4800/5600 **$56.11** (+6,38 % 30T, **+480 % YoY**); DDR5 16Gb eTT **$24.55** (+0,36 %, +330 %); DDR4 16Gb 3200 **$84.43** (+4,85 %, **+690 %**); DDR4 8Gb 3200 **$45.59** (+6,41 %, **+860 %**); DDR5 RDIMM 64GB **$1.857/Modul** (+4,47 %, +455 %, **derived** aus Die-Spot +~6 % Modulaufschlag, kein öffentlicher Modulausdruck). Balances: DDR5-Basket 30T +14,23 % / YoY +331,67 %, DDR4-Basket 30T +4,49 % / YoY +563,00 %. **Befund (Kern):** Die DDR4/DDR5-Inversion — der abgekündigte Knoten ist **pro Die teurer** als die neue Generation, und seine Jahresveränderung ist steiler. **Konsequenz (Einordnung, nicht Quelle):** Die „altes DDR4 weiterverwenden"-These trägt **nicht über den Neukauf**, sondern ausschließlich über den **Zweitmarkt** aus stillgelegten Servern — genau das monetarisiert ein CXL-Controller. **Zweite Quelle:** [ServeTheHome zu Leo 2 / Leo X](https://www.servethehome.com/astera-labs-releases-leo-2-cxl-memory-controllers-and-leo-x-controller-for-rackscale-fabric-attached-memory/) (abgerufen 20.09.2026) liefert die Technik nach: PCIe Gen6/CXL 3.2, 2→4 Kanäle, bis **768 GB DDR4** bzw. **4 TB DDR5** pro Expander, 4-Kanal-**3DPC**-Board mit **12 DDR4-DIMMs**, Leo X fabric-attached über Scorpio (KV-Caching, Anbieterangabe 62 % TTFT / 22 % Durchsatz), **keine Preise genannt**, Vorgänger **Marvell Structera**. RAS (Hardware-Testmuster je DIMM, Soft-ECC über Hardware-ECC) als Voraussetzung der Wiederverwendung. ⚠️ Spot-/derived-Niveaus, keine Vertragspreise; Momentaufnahme; Intraday-Reihen laut Anbieter-Methodik rückwärts gerechnet. Wiki: `wiki/institutions/astera-labs.md` (neu); Updates `concepts/hardware/gaming-hardwarekrise-ai-speicher.md` (Preis-Anker + Inversions-Analyse), `concepts/hardware/ai-infrastruktur-custom-silicon.md` (Nachtrag Leo 2 + Preisachse). Raw: `raw/other/2026-09-20_dram-spotpreise-memoryindex.md` (neu).*
@ -320,7 +321,7 @@
| [Lokale KI zum Coding — Kostenfrage & Hardware-Vorteile](concepts/hardware/lokale-ki-coding.md) | David Tielke: „Lokale KI: Coding zum Nulltarif?" — Modellnutzung gratis, aber Hardware (RAM/GPU) ist der eigentliche Kostenfaktor. Vorteile schnellerer Hardware (höhere tok/s, größere Modelle, offline/DSGVO). Bezug zu lokalen Agents. ⚠️ Metadata-only (kein Transcript) | youtube/2026-08-10_lokale-ki-coding-nulltarif.md | | [Lokale KI zum Coding — Kostenfrage & Hardware-Vorteile](concepts/hardware/lokale-ki-coding.md) | David Tielke: „Lokale KI: Coding zum Nulltarif?" — Modellnutzung gratis, aber Hardware (RAM/GPU) ist der eigentliche Kostenfaktor. Vorteile schnellerer Hardware (höhere tok/s, größere Modelle, offline/DSGVO). Bezug zu lokalen Agents. ⚠️ Metadata-only (kein Transcript) | youtube/2026-08-10_lokale-ki-coding-nulltarif.md |
| [UBTECH U1 — Chinas hyperrealistische Humanoide Roboter](concepts/hardware/ubtech-u1-humanoid-roboter.md) | UBTECH (erstes börsennotiertes Humanoid-Unternehmen): U1 mit Silikonhaut, 88 DOF, Cloud-KI, 13K+ Vorbestellungen ($17.6K$45K), demografischer Treiber (HK 0,77). **Update 19.08.:** China 97 % aller humanoiden Roboter weltweit, US-Importverbot für vernetzte Roboter >2 kg | youtube/2026-07-05_everlast-ki-news-china-roboter-sonnet5-fable5.md + youtube/2026-08-19_ki-experten-alles-zum-kippen.md | | [UBTECH U1 — Chinas hyperrealistische Humanoide Roboter](concepts/hardware/ubtech-u1-humanoid-roboter.md) | UBTECH (erstes börsennotiertes Humanoid-Unternehmen): U1 mit Silikonhaut, 88 DOF, Cloud-KI, 13K+ Vorbestellungen ($17.6K$45K), demografischer Treiber (HK 0,77). **Update 19.08.:** China 97 % aller humanoiden Roboter weltweit, US-Importverbot für vernetzte Roboter >2 kg | youtube/2026-07-05_everlast-ki-news-china-roboter-sonnet5-fable5.md + youtube/2026-08-19_ki-experten-alles-zum-kippen.md |
| [$8-Chip mit LLM ohne RAM — TinyML-Inferenz im Ultra-Kleinformat](concepts/hardware/8-dollar-chip-llm-tinyml.md) | Better Stack: ~$8-Mikrocontroller, der ein LLM mit fast keinem RAM ausführt (ESP32-/Pico-Klasse, extreme Quantisierung/Flash-Streaming). Untere Kante der Edge-Inferenz-Skala (wenige KB bis MB) — Gegenpol zu DGX 748 GB / Strix Halo 128 GB. Verbindendes Prinzip: Quantisierung. ⚠️ Metadata-only (kein Transcript) | youtube/2026-08-21_8-dollar-chip-llm-no-ram.md | | [$8-Chip mit LLM ohne RAM — TinyML-Inferenz im Ultra-Kleinformat](concepts/hardware/8-dollar-chip-llm-tinyml.md) | Better Stack: ~$8-Mikrocontroller, der ein LLM mit fast keinem RAM ausführt (ESP32-/Pico-Klasse, extreme Quantisierung/Flash-Streaming). Untere Kante der Edge-Inferenz-Skala (wenige KB bis MB) — Gegenpol zu DGX 748 GB / Strix Halo 128 GB. Verbindendes Prinzip: Quantisierung. ⚠️ Metadata-only (kein Transcript) | youtube/2026-08-21_8-dollar-chip-llm-no-ram.md |
| [Apple M6 & M5 Ultra — Mac mini/Mac Studio Sommer-Update](concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md) | Apple überrascht im August mit neuem Mac mini (M6, M5 Pro) und Mac Studio (M5 Max, M5 Ultra). M6 = erster 2-nm-Chip; M5 Ultra = 512 GB Unified Memory @ 1,2 TB/s, UltraFusion 4,4 TB/s (erste Interconnect-Steigerung seit 2022), TB5/RDMA-Cluster für >1T-Parameter-Modelle. OpenClaw als Nachfrage-Treiber genannt (heise). Preise: mini M6 1049€, Studio M5 Ultra ab 6599€. ⚠️ Alle Leistungsangaben = Hersteller-Claims | youtube/2026-08-25_apfelfunk-neue-macs-m6-m5-ultra.md + blog/2026-08-25_heise-apple-m6-m5-ultra-mac-update.md | | [Apple M6 & M5 Ultra — Mac mini/Mac Studio Sommer-Update](concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md) | Apple überrascht im August mit neuem Mac mini (M6, M5 Pro) und Mac Studio (M5 Max, M5 Ultra). M6 = erster 2-nm-Chip; M5 Ultra = 512 GB Unified Memory @ 1,2 TB/s, UltraFusion 4,4 TB/s (erste Interconnect-Steigerung seit 2022), TB5/RDMA-Cluster für >1T-Parameter-Modelle. OpenClaw als Nachfrage-Treiber genannt (heise). Preise: mini M6 1049€, Studio M5 Ultra ab 6599€. **Verifiziert (21.09., MacStories/Viticci, 256-GB-Gerät):** Generierung ~+70 % und Prefill ~+150 % vs. M3 Ultra; Flash-Next >100 tok/s kurz, 6085 tok/s bei 64K256K; vs. RTX 5090 Prefill ~1.700 gegen ~3.000 tok/s, Generierung ~25 % Rückstand (1,2 vs. 1,79 TB/s), aber 5090 verliert oberhalb 32 GB VRAM | youtube/2026-08-25_apfelfunk-neue-macs-m6-m5-ultra.md + blog/2026-08-25_heise-apple-m6-m5-ultra-mac-update.md + blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md |
| [Local-AI-Box & Chinas Vorstoß — Xiaomi O100, Alibaba XuanTie C950](concepts/hardware/china-local-ai-box.md) | Devsplainers-Analyse (26.08.): Memory-Bandbreite statt Petaflops entscheidet Box-Tauglichkeit; DGX-Spark-Lektion (1 PFLOP Headline, <3 tok/s dichter 70B laut LMSYS); DRAM-Teuerung macht $2000-Mini-PC zum Cheap Seat, Apple entfernt angeblich 512-/256-GB-Studio-Configs; Xiaomi AI Cube/O100 mit 1,22 TB/s Near-Memory-Bandwidth, Alibabas XuanTie C950 (RISC-V) laut Folie 27B @ 30 tok/s ohne GPU; Credibility-Test = llama.cpp/vLLM-Backend am Launch Day; BYD-Frage offen | youtube/2026-08-26_devsplainers-china-local-ai-box.md | | [Local-AI-Box & Chinas Vorstoß — Xiaomi O100, Alibaba XuanTie C950](concepts/hardware/china-local-ai-box.md) | Devsplainers-Analyse (26.08.): Memory-Bandbreite statt Petaflops entscheidet Box-Tauglichkeit; DGX-Spark-Lektion (1 PFLOP Headline, <3 tok/s dichter 70B laut LMSYS); DRAM-Teuerung macht $2000-Mini-PC zum Cheap Seat, Apple entfernt angeblich 512-/256-GB-Studio-Configs; Xiaomi AI Cube/O100 mit 1,22 TB/s Near-Memory-Bandwidth, Alibabas XuanTie C950 (RISC-V) laut Folie 27B @ 30 tok/s ohne GPU; Credibility-Test = llama.cpp/vLLM-Backend am Launch Day; BYD-Frage offen | youtube/2026-08-26_devsplainers-china-local-ai-box.md |
| [KI-gestützte Hypnose — Gesten- & Abstandserkennung mit IR-Kamera](concepts/hardware/ki-gestuetzte-hypnose-gestenerkennung.md) | plebcoach Andreas (OME Topic 22, 10.09.2026): Projekte zur Kombination von Technik und Hypnose — KI-gestützte Gesten- & Abstandserkennung, IR-Kamera zur Erkennung unbewusster Fingersignale; zwei Bilder eines kamerabestückten, seil-/schienengeführt wirkenden Prototyps (mechanische Einordnung unsicher). ⚠️ Reine Selbstbeschreibung, keine validierte Funktion/Wirksamkeit | other/2026-09-10_ki-gestuetzte-hypnose-gestenerkennung.md | | [KI-gestützte Hypnose — Gesten- & Abstandserkennung mit IR-Kamera](concepts/hardware/ki-gestuetzte-hypnose-gestenerkennung.md) | plebcoach Andreas (OME Topic 22, 10.09.2026): Projekte zur Kombination von Technik und Hypnose — KI-gestützte Gesten- & Abstandserkennung, IR-Kamera zur Erkennung unbewusster Fingersignale; zwei Bilder eines kamerabestückten, seil-/schienengeführt wirkenden Prototyps (mechanische Einordnung unsicher). ⚠️ Reine Selbstbeschreibung, keine validierte Funktion/Wirksamkeit | other/2026-09-10_ki-gestuetzte-hypnose-gestenerkennung.md |
| [AI-Infrastruktur-Silizium — Custom-Chips, Edge-Racks und das Gedächtnis](concepts/hardware/ai-infrastruktur-custom-silicon.md) | TechTechPotato ([Ian Cutress](people/ian-cutress.md), [More Than Moore](institutions/more-than-moore.md)), AI Infrastructure Summit Tag 2: Leitmotiv „everyone building their own silicon“ — Qualcomm AlphaWave, Broadcom Tomahawk 6 (17.000 Pins), portables Sechs-Slot-Rack + „wer kauft Edge-Racks“, d-Matrix (NVLink, 20-B-Parameter-Racks), **Astera Labs Leo 2: DDR4 + DDR5 in einem System auf einer Next-Gen-Intel-CPU**, SiFive/RISC-V, Ayar Labs Co-Packaged Optics. **Update 20.09.:** Nachtrag aus [ServeTheHome](https://www.servethehome.com/astera-labs-releases-leo-2-cxl-memory-controllers-and-leo-x-controller-for-rackscale-fabric-attached-memory/) — PCIe Gen6/CXL 3.2, 2→4 Kanäle, bis **768 GB DDR4** bzw. **4 TB DDR5** pro Expander, 4-Kanal-**3DPC**-Board mit **12 DDR4-DIMMs**, Leo X fabric-attached über Scorpio, RAS (Testmuster + Soft-ECC) als Wiederverwendungs-Voraussetzung, **keine Preise**, Vorgänger [Marvell](https://www.marvell.com/) Structera; dazu die Preisachse (DDR4 teurer als DDR5 pro Die) und der **Gebrauchtmarkt-Anker** (64 GB DDR4 RDIMM 2666 ≈ $58,50/GB gegen ~$29/GB neu = 35× pro GB, bei halber Bandbreite) | youtube/2026-09-20_techtechpotato-silicon-notebook-e2.md + other/2026-09-20_dram-spotpreise-memoryindex.md + other/2026-09-20_ddr4-gebrauchtmarkt-dimmsum.md | | [AI-Infrastruktur-Silizium — Custom-Chips, Edge-Racks und das Gedächtnis](concepts/hardware/ai-infrastruktur-custom-silicon.md) | TechTechPotato ([Ian Cutress](people/ian-cutress.md), [More Than Moore](institutions/more-than-moore.md)), AI Infrastructure Summit Tag 2: Leitmotiv „everyone building their own silicon“ — Qualcomm AlphaWave, Broadcom Tomahawk 6 (17.000 Pins), portables Sechs-Slot-Rack + „wer kauft Edge-Racks“, d-Matrix (NVLink, 20-B-Parameter-Racks), **Astera Labs Leo 2: DDR4 + DDR5 in einem System auf einer Next-Gen-Intel-CPU**, SiFive/RISC-V, Ayar Labs Co-Packaged Optics. **Update 20.09.:** Nachtrag aus [ServeTheHome](https://www.servethehome.com/astera-labs-releases-leo-2-cxl-memory-controllers-and-leo-x-controller-for-rackscale-fabric-attached-memory/) — PCIe Gen6/CXL 3.2, 2→4 Kanäle, bis **768 GB DDR4** bzw. **4 TB DDR5** pro Expander, 4-Kanal-**3DPC**-Board mit **12 DDR4-DIMMs**, Leo X fabric-attached über Scorpio, RAS (Testmuster + Soft-ECC) als Wiederverwendungs-Voraussetzung, **keine Preise**, Vorgänger [Marvell](https://www.marvell.com/) Structera; dazu die Preisachse (DDR4 teurer als DDR5 pro Die) und der **Gebrauchtmarkt-Anker** (64 GB DDR4 RDIMM 2666 ≈ $58,50/GB gegen ~$29/GB neu = 35× pro GB, bei halber Bandbreite) | youtube/2026-09-20_techtechpotato-silicon-notebook-e2.md + other/2026-09-20_dram-spotpreise-memoryindex.md + other/2026-09-20_ddr4-gebrauchtmarkt-dimmsum.md |
@ -467,6 +468,7 @@
| [Tom Griffiths](people/tom-griffiths.md) | **Thomas L. Griffiths**, Henry-R.-Luce-Professor für Information Technology, Consciousness and Culture an [Princeton](institutions/princeton.md) (Psychologie + Informatik), Leiter des Computational Cognitive Science Lab; laut Klappentext Leiter des Princeton AI Lab. Australischer Kognitionswissenschaftler, bekannt für **Bayes'sche Modelle der Kognition** und *Algorithms to Live By* (mit Brian Christian, 2016). 2026: **„The Laws of Thought"** (Henry Holt, 10.02.2026, 400 S.; dt. „Die Gesetze des Denkens") — die drei Wege, Denken zu formalisieren: Regeln/Symbole, neuronale Netze, Wahrscheinlichkeit/Statistik. ⚠️ Video-Thesen („AI Researchers Are Wrong") stammen aus der Videobeschreibung, kein Transkript | youtube/2026-09-19_princeton-griffiths-ai-researchers-wrong.md | | [Tom Griffiths](people/tom-griffiths.md) | **Thomas L. Griffiths**, Henry-R.-Luce-Professor für Information Technology, Consciousness and Culture an [Princeton](institutions/princeton.md) (Psychologie + Informatik), Leiter des Computational Cognitive Science Lab; laut Klappentext Leiter des Princeton AI Lab. Australischer Kognitionswissenschaftler, bekannt für **Bayes'sche Modelle der Kognition** und *Algorithms to Live By* (mit Brian Christian, 2016). 2026: **„The Laws of Thought"** (Henry Holt, 10.02.2026, 400 S.; dt. „Die Gesetze des Denkens") — die drei Wege, Denken zu formalisieren: Regeln/Symbole, neuronale Netze, Wahrscheinlichkeit/Statistik. ⚠️ Video-Thesen („AI Researchers Are Wrong") stammen aus der Videobeschreibung, kein Transkript | youtube/2026-09-19_princeton-griffiths-ai-researchers-wrong.md |
| [Brian Keating](people/brian-keating.md) | Kosmologe, Chancellor's Distinguished Professor of Physics an der UC San Diego (CMB, Simons Observatory, BICEP/POLARBEAR); Autor von *Losing the Nobel Prize* (2018) und *Into the Impossible*. Betreibt den Podcast/Kanal **„Into the Impossible"** ([@DrBrianKeating](https://www.youtube.com/@DrBrianKeating)) — im Wiki als **Interviewer/Distributionskanal**, nicht als KI-Forscher. Kanal mit eigenem Monetarisierungs-Setup (Patreon, Kanalmitgliedschaft, `.edu`-Aktion, Amazon-Kurzlinks); die Rahmung „AI Researchers Are Wrong" kommt vom Kanal | youtube/2026-09-19_princeton-griffiths-ai-researchers-wrong.md | | [Brian Keating](people/brian-keating.md) | Kosmologe, Chancellor's Distinguished Professor of Physics an der UC San Diego (CMB, Simons Observatory, BICEP/POLARBEAR); Autor von *Losing the Nobel Prize* (2018) und *Into the Impossible*. Betreibt den Podcast/Kanal **„Into the Impossible"** ([@DrBrianKeating](https://www.youtube.com/@DrBrianKeating)) — im Wiki als **Interviewer/Distributionskanal**, nicht als KI-Forscher. Kanal mit eigenem Monetarisierungs-Setup (Patreon, Kanalmitgliedschaft, `.edu`-Aktion, Amazon-Kurzlinks); die Rahmung „AI Researchers Are Wrong" kommt vom Kanal | youtube/2026-09-19_princeton-griffiths-ai-researchers-wrong.md |
| [Federico Viticci](people/federico-viticci.md) | Gründer/Chefredakteur von [MacStories](institutions/macstories.md), selbsternannter „Tinkerer" (kein Modelltraining). Liefert **unabhängige Messwerte** für Apple Silicon für lokale Inferenz — M5-Ultra-Review (21.09.): Generierung +70 % und Prefill +150 % vs. M3 Ultra, Flash-Next >100 tok/s kurz und 6085 tok/s bei 64K256K, Direktvergleich gegen RTX 5090. Praxismodell: Flash-Next als lokales Default in Open Minis und Hermes Agent; Referenzprojekt 99 Tage Agentenbetrieb (DeepSeek V4 Flash + olmOCR) für 0 $ | blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md |
*(Weitere Kandidaten: Graeme (gkisokay), Mr. Cy (Cyb3rblade), Pit Weber (Kai) — bei Bedarf nachziehen)* *(Weitere Kandidaten: Graeme (gkisokay), Mr. Cy (Cyb3rblade), Pit Weber (Kai) — bei Bedarf nachziehen)*
@ -526,6 +528,7 @@
| [Astera Labs](institutions/astera-labs.md) | US-Halbleiteranbieter für Rechenzentrums-Connectivity (CXL-Smart-Memory-Controller **Leo**, PCIe-Switches **Scorpio**). **Leo 2** (09/2026): PCIe Gen6/CXL 3.2, 2→4 Kanäle, bis **768 GB DDR4** bzw. **4 TB DDR5** pro Expander, DDR4 bis **3DPC = 12 DIMMs** je Karte, Leo X fabric-attached (KV-Caching, Anbieterangabe 62 % TTFT / 22 % Durchsatz); RAS (Testmuster + Soft-ECC) als Voraussetzung für **Weiterverwendung gealterter DDR4-Module**. **Keine Preise genannt** — Vertrieb über OEM-/Hyperscaler-Wins; Vorgänger Marvell Structera. Monetarisiert den Zweitmarkt, nicht billigen neuen DRAM. **Zweitmarkt-Anker 20.09.2026:** gebrauchte 64-GB-DDR4-RDIMMs ≈ **$58,50/GB** ([DIMMsum](https://dimmsum.com/ddr4/64gb-2666-rdimm)) gegen ~$29/GB beim abgeleiteten DDR5-RDIMM-Neupreis — **35× pro Gigabyte** bei halber Bandbreite; die Rechnung, die die TCO-These beziffert | other/2026-09-20_dram-spotpreise-memoryindex.md + other/2026-09-20_ddr4-gebrauchtmarkt-dimmsum.md | | [Astera Labs](institutions/astera-labs.md) | US-Halbleiteranbieter für Rechenzentrums-Connectivity (CXL-Smart-Memory-Controller **Leo**, PCIe-Switches **Scorpio**). **Leo 2** (09/2026): PCIe Gen6/CXL 3.2, 2→4 Kanäle, bis **768 GB DDR4** bzw. **4 TB DDR5** pro Expander, DDR4 bis **3DPC = 12 DIMMs** je Karte, Leo X fabric-attached (KV-Caching, Anbieterangabe 62 % TTFT / 22 % Durchsatz); RAS (Testmuster + Soft-ECC) als Voraussetzung für **Weiterverwendung gealterter DDR4-Module**. **Keine Preise genannt** — Vertrieb über OEM-/Hyperscaler-Wins; Vorgänger Marvell Structera. Monetarisiert den Zweitmarkt, nicht billigen neuen DRAM. **Zweitmarkt-Anker 20.09.2026:** gebrauchte 64-GB-DDR4-RDIMMs ≈ **$58,50/GB** ([DIMMsum](https://dimmsum.com/ddr4/64gb-2666-rdimm)) gegen ~$29/GB beim abgeleiteten DDR5-RDIMM-Neupreis — **35× pro Gigabyte** bei halber Bandbreite; die Rechnung, die die TCO-These beziffert | other/2026-09-20_dram-spotpreise-memoryindex.md + other/2026-09-20_ddr4-gebrauchtmarkt-dimmsum.md |
| [More Than Moore / TechTechPotato](institutions/more-than-moore.md) | Analysefirma des Halbleiter-Analysten [Ian Cutress](people/ian-cutress.md) (`more-moore.com`) und ihr YouTube-Kanal TechTechPotato. Liefert Branchen-Einordnung und Event-Berichte („The Silicon Notebook"); im Wiki als **Verbreitungs-/Bündelungssignal**, nicht als Primärbeleg. **Disclosure in eigener Sache:** bezahlte Forschung/Beratung für AMD, Arm, Ayar Labs, Broadcom-nahe Firmen, IBM, Intel, MediaTek, NVIDIA, Qualcomm, SiFive, TSMC, Tenstorrent u. a. ⚠️ Beratungskunden können zugleich die berichteten Firmen sein | youtube/2026-09-20_techtechpotato-silicon-notebook-e2.md | | [More Than Moore / TechTechPotato](institutions/more-than-moore.md) | Analysefirma des Halbleiter-Analysten [Ian Cutress](people/ian-cutress.md) (`more-moore.com`) und ihr YouTube-Kanal TechTechPotato. Liefert Branchen-Einordnung und Event-Berichte („The Silicon Notebook"); im Wiki als **Verbreitungs-/Bündelungssignal**, nicht als Primärbeleg. **Disclosure in eigener Sache:** bezahlte Forschung/Beratung für AMD, Arm, Ayar Labs, Broadcom-nahe Firmen, IBM, Intel, MediaTek, NVIDIA, Qualcomm, SiFive, TSMC, Tenstorrent u. a. ⚠️ Beratungskunden können zugleich die berichteten Firmen sein | youtube/2026-09-20_techtechpotato-silicon-notebook-e2.md |
| [AI/ML API](institutions/ai-ml-api.md) | Anbieter eines Modell-Gateways (@aimlapi). Führte den **aussagekräftigsten Jev-Praxistest** durch: **Blitz-Schach 5+0, ein API-Call pro Zug** (16.09.2026, 528.714 Views) — Jev materiell klar unterlegen gegen Fable 5.1, gewinnt aber **auf Zeit** (~2,6 s vs. 615 s pro Zug); gegen GPT-6 Astra **Matt in 18 Zügen**. Misst damit Zeitökonomie eines Entscheidungsmodells gegen generative Modelle. ⚠️ Einzeltest, Selbstauskunft; Versionsangabe „V13" steht nicht in der Launch-Kommunikation | youtube/2026-09-18_berman-jev.md | | [AI/ML API](institutions/ai-ml-api.md) | Anbieter eines Modell-Gateways (@aimlapi). Führte den **aussagekräftigsten Jev-Praxistest** durch: **Blitz-Schach 5+0, ein API-Call pro Zug** (16.09.2026, 528.714 Views) — Jev materiell klar unterlegen gegen Fable 5.1, gewinnt aber **auf Zeit** (~2,6 s vs. 615 s pro Zug); gegen GPT-6 Astra **Matt in 18 Zügen**. Misst damit Zeitökonomie eines Entscheidungsmodells gegen generative Modelle. ⚠️ Einzeltest, Selbstauskunft; Versionsangabe „V13" steht nicht in der Launch-Kommunikation | youtube/2026-09-18_berman-jev.md |
| [MacStories](institutions/macstories.md) | Unabhängige Apple-Publikation (Gründer [Federico Viticci](people/federico-viticci.md)), bekannt für methodisch offengelegte Langform-Tests. **Relevanz: unabhängige Verifikationsquelle für lokale KI auf Apple Silicon** — testet agentische Last (Harness-Kontext, Tool-Calls, Subagenten, lange Threads) statt Chat-Benchmarks. M5-Ultra-Review 21.09. schließt die Lücke „nur Herstellerangaben"; Produktivnachweis 99 Tage Agentenbetrieb für 0 $ (iOS-27-Review-Recherche, 310 Dokumente) | blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md |
## Decisions ## Decisions
@ -564,6 +567,7 @@
| Datei | Typ | Titel | | Datei | Typ | Titel |
|-------|-----|-------| |-------|-----|-------|
| `raw/blog/2026-09-21_xai-grok-47-official.md` | blog | Offizielle Grok-4.7-Akte: xAI-Release + API-Modellkarte + Cursor-Doku; 500k Kontext, vier Effort-Stufen, $2/$6 Basis-I/O, Long-Context-Tarif; Herstellerbenchmarks und Safeguard-Claims markiert | | `raw/blog/2026-09-21_xai-grok-47-official.md` | blog | Offizielle Grok-4.7-Akte: xAI-Release + API-Modellkarte + Cursor-Doku; 500k Kontext, vier Effort-Stufen, $2/$6 Basis-I/O, Long-Context-Tarif; Herstellerbenchmarks und Safeguard-Claims markiert |
| `raw/blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md` | blog | **MacStories / Federico Viticci — „M5 Ultra Mac Studio Review: The Dream Mac for Local AI Agents"** (21.09.2026; web_fetch vollständig, 21.401 Zeichen). Erste unabhängige Verifikation der M5-Ultra-Werte: 256 GB gegen M3 Ultra (512 GB) und RTX 5090; Generierung +70 %, Prefill +150 %, Flash-Next >100 tok/s kurz / 6085 bei 64K256K, 5-Bit vollständig im RAM, bis 3 parallele Sessions (oMLX); Prefill 6.000-Token ~1.700 vs. ~3.000 tok/s (5090), Generierung 5090 ~25 % voraus; Testmethodik (GPT-6-Astra-Harness, oMLX 0.7.0.dev2, LM Studio/CUDA) und offene Projekte (DwarfStar, Inco Splash, Exo) dokumentiert |
| `raw/xpost/2026-09-21_cb-doge-grok-47-release.md` | xpost | DogeDesigner/@cb_doge Release-Zusammenfassung (113.071 Views beim Abruf); Werte gegen xAI geprüft, pauschales „2× fast/half price“ als Account-Verdichtung abgegrenzt | | `raw/xpost/2026-09-21_cb-doge-grok-47-release.md` | xpost | DogeDesigner/@cb_doge Release-Zusammenfassung (113.071 Views beim Abruf); Werte gegen xAI geprüft, pauschales „2× fast/half price“ als Account-Verdichtung abgegrenzt |
| `raw/youtube/2026-09-22_alex-finn-grok-47-grok-bot.md` | youtube | Alex Finn „Grok 4.7 inside Grok Bot is INCREDIBLE“ (14:06, geteilt von Pit); Metadaten/Kapitel, kein Transcript; YouTube-AI- und Herman-Zusammenfassungen klar attribuiert | | `raw/youtube/2026-09-22_alex-finn-grok-47-grok-bot.md` | youtube | Alex Finn „Grok 4.7 inside Grok Bot is INCREDIBLE“ (14:06, geteilt von Pit); Metadaten/Kapitel, kein Transcript; YouTube-AI- und Herman-Zusammenfassungen klar attribuiert |
| `raw/podcast/2026-09-21_grok-ai-daily-amazon-muse-ai-kill-switch.md` | podcast | Grok AI Daily, 29:30, geteilt von Netbits; ART19-Metadaten + vollständiges lokales Maschinen-ASR. Allgemeiner AI-Newsrecap; kein Grok 4.7, Grok Bot nur beiläufig; keine Publisher-Quellenliste/kein Publisher-Transcript | | `raw/podcast/2026-09-21_grok-ai-daily-amazon-muse-ai-kill-switch.md` | podcast | Grok AI Daily, 29:30, geteilt von Netbits; ART19-Metadaten + vollständiges lokales Maschinen-ASR. Allgemeiner AI-Newsrecap; kein Grok 4.7, Grok Bot nur beiläufig; keine Publisher-Quellenliste/kein Publisher-Transcript |

View file

@ -0,0 +1,44 @@
---
created: 2026-09-22
updated: 2026-09-22
sources: [blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md]
tags: [institution, macstories, apple, media, tech-journalism, local-ai, mlx]
---
# MacStories
## Profil
| Feld | Wert |
|------|------|
| Typ | Unabhängige Apple-Publikation (Web-Magazin + Podcast + Club-Mitgliedschaft) |
| Gründer | [[../people/federico-viticci.md|Federico Viticci]] |
| Fokus | Apple-Plattformen (iOS/iPadOS/macOS), Apps, Workflows, Automatisierung — zunehmend lokale KI auf Apple Silicon |
| Homepage | https://www.macstories.net/ |
| Primäre Quellen | `raw/blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md` |
## Fokus & Aktivitäten
MacStories ist eine der ältesten und detailliertesten unabhängigen Apple-Publikationen. Kennzeichnend sind sehr lange, methodisch offengelegte Erfahrungsberichte („Stories") und jährliche iOS-/iPadOS-Reviews, die zu den umfangreichsten im Apple-Ökosystem zählen (die Ausgabe für iOS/iPadOS 27 umfasst laut Viticcis Beschreibung ein Projekt mit 310 Dokumenten).
### Lokale KI auf Apple Silicon
Seit 2025 dokumentiert MacStories zunehmend eigene lokale LLM-Setups auf Mac-Hardware — von frühen Mac-Studio-Benchmarks (Qwen3-235B-A22B, Qwen2.5-VL-72B) über den **M5 iPad Pro** (MLX-Neural-Benchmarks) und DeepSeek-R1-0528 auf dem M3 Ultra bis zuletzt dem **M5 Ultra Mac Studio** (2026-09-21).
Bemerkenswert für dieses Wiki: MacStories testet nicht nur Rohdurchsatz, sondern **agentische Workloads** — Harness-Kontext, Tool-Calls, Subagenten-Koordination, lange Multi-Turn-Schleifen — und veröffentlicht die Messmethodik (oMLX als MLX-Backend, LM Studio/CUDA auf Windows, eigenes Test-Harness).
### Produktivnachweis statt Benchmark
Der bisher stärkste im Wiki dokumentierte Beleg für den praktischen Nutzen lokaler Agenten stammt aus MacStories: Für das iOS/iPadOS-27-Review liefen 99 Tage lang durchgehend Agenten ([[../concepts/llm/deepseek-v4.1-flash.md|DeepSeek V4 Flash]] + olmOCR) über ein Projekt mit 310 Dokumenten — bei Gesamtkosten von 0 $, weil dieselbe Dauerlast über Cloud-APIs als wirtschaftlich untragbar eingeschätzt wurde.
## Relevanz für das Wiki
MacStories dient als **unabhängige Verifikationsquelle** für Apple-Hardware im Kontext lokaler KI. Während die Wiki-Seiten zu M6/M5 Ultra ursprünglich nur Herstellerangaben aus dem heise-Bericht enthielten, liefert MacStories gemessene Werte (Generierung +70 % vs. M3 Ultra, Prefill +150 %) und einen belastbaren Direktvergleich gegen die RTX 5090. Das macht die Publikation zur Referenz für die Frage, ob Apple-Silicon-Bandbreitenversprechen in der Praxis halten.
## Verwandte Wiki-Seiten
- [[../people/federico-viticci.md]] — Gründer und Autor des M5-Ultra-Reviews
- [[../concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md]] — die verifizierte Hardware
- [[../concepts/llm/qwen3.8-flash-next-qwen4-preview.md]] — lokal eingesetztes Modell
- [[../concepts/hardware/china-local-ai-box.md]] — Bandbreiten-These, durch die Messwerte praktisch bestätigt
- [[../concepts/hardware/nvidia-dgx-station-748gb.md]] — Apple im Vergleich zum NVIDIA-Desktop-Format

View file

@ -2,6 +2,21 @@
*Append-only changelog. Start: 2026-06-05* *Append-only changelog. Start: 2026-06-05*
## 2026-09-22 — MacStories: M5 Ultra Mac Studio Review (unabhängige Verifikation)
**Type:** ingest + wiki-update | **Scope:** raw/blog, wiki/people, wiki/institutions, wiki/concepts/hardware, wiki/concepts/llm, wiki/index, wiki/log
**Anlass:** Link von Pit Weber (@PWeber) im OME-Topic „Openclaw mit lokalen Modellen" (#15110): https://www.macstories.net/stories/m5-ultra-mac-studio-review-the-dream-mac-for-local-ai-agents/
**Quelle:** Federico Viticci, MacStories, publiziert 2026-09-21 13:00 UTC (datePublished der Seite). Abruf via web_fetch vollständig (21.401 Zeichen, readability).
**Inhalt:** Erste **unabhängige Verifikation** der M5-Ultra-Leistungsversprechen (bisher nur Apple-/heise-Herstellerangaben — die Apple-Seite trug bis heute „⚠️ unabhängige Benchmarks gab es noch nicht"). Testgerät: M5 Ultra Mac Studio mit 256 GB, verglichen über mehrere Tage gegen M3 Ultra (512 GB) und einen RTX-5090-Desktop.
**Messwerte:** Generierung ~**+70 %** vs. M3 Ultra, Prefill ~**+150 %** (≈2,5×). Qwen3.8-Flash-Next: **>100 tok/s** bei kurzen Prompts, **6085 tok/s** bei 64K256K Kontext, stabil in Multi-Turn-Schleifen mit Subagenten. Gegen RTX 5090: Prefill bei 6.000-Token-Prompt ~**1.700 tok/s** vs. ~**3.000 tok/s** (5090); Generierung 5090 konstant **~25 %** voraus (1,79 vs. 1,2 TB/s) — verliert aber oberhalb 32 GB VRAM durch PCIe-Auslagerung. Architektur bestätigt: Quad-Die via UltraFusion, 80 GPU-Cores mit Neural Accelerators, 819 GB/s → 1,2 TB/s.
**Praxisteil:** Flash-Next ist lokal das Default-Modell in Open Minis und Hermes Agent (5-Bit vollständig im RAM; 6-/8-Bit mit SSD-Offloading der N-Gramm-Tabellen; bis zu 3 parallele Sessions mit Subagenten via oMLX 0.7.0.dev2). Referenzprojekt: **99 Tage** Dauerbetrieb eines Agententeams (DeepSeek V4 Flash + olmOCR) über 310 Dokumente fürs iOS-/iPadOS-27-Review — **Gesamtkosten 0 $**, weil dieselbe Dauerlast über OpenAI-/Anthropic-APIs als wirtschaftlich untragbar eingeschätzt wurde.
**Methodik im Artikel offengelegt:** Test-Harness erstellt mit GPT-6 Astra (koordinierte Codex-Instanzen über drei Maschinen), oMLX für MLX-Modelle, LM Studio/CUDA 12 auf Windows, Daten über vier Tage, Visualisierung mit Claude Fable 5.1 und Opus 5.
**Dateien:**
- raw (NEU): `raw/blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md`
- wiki (NEU): `wiki/people/federico-viticci.md`, `wiki/institutions/macstories.md`
- wiki (UPDATED): `wiki/concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md` (neuer Abschnitt „Verifikation: unabhängige Benchmarks" + Messwert-Tabelle, Quellenlage entschärft), `wiki/concepts/llm/qwen3.8-flash-next-qwen4-preview.md` (erster dokumentierter Praxiseinsatz), `wiki/concepts/hardware/cloud-exit-and-local-superiority.md` (Cross-Ref zum Produktivnachweis), `wiki/index.md` (239. Update)
**⚠️:** Einzelsetup (n=1), keine reproduzierte Benchmark-Suite; Tokens/s-Werte gelten für das vom Autor gewählte Modell/Quant-Setup. Der Artikel selbst nennt als noch offen: DwarfStar, Inco Splash, Exo (RDMA über TB5) und die 512-GB-Variante.
## 2026-09-22 — N8 Programs: unabhängiger Jev-vs.-GPT-5.6-Terra-System-1-Benchmark ## 2026-09-22 — N8 Programs: unabhängiger Jev-vs.-GPT-5.6-Terra-System-1-Benchmark
**Type:** ingest + wiki-update | **Scope:** raw/other, wiki/people, wiki/concepts/llm, wiki/index, wiki/log **Type:** ingest + wiki-update | **Scope:** raw/other, wiki/people, wiki/concepts/llm, wiki/index, wiki/log

View file

@ -0,0 +1,36 @@
---
title: "Federico Viticci"
created: 2026-09-22
updated: 2026-09-22
sources: [blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md]
tags: [person, macstories, apple, local-ai, mlx, mac-studio, journalist, tinkerer]
---
# Federico Viticci
Gründer und Chefredakteur von [MacStories](https://www.macstories.net/) — einer der profiliertesten englischsprachigen Apple-Publikationen. Beschreibt sich selbst als „Tinkerer", nicht als KI-Entwickler: er trainiert und fine-tuned keine Modelle, betreibt aber seit über einem Jahr eigene lokale LLM-Setups auf Mac-Hardware.
## Relevanz für das Wiki
Viticci liefert **unabhängige, reproduzierbar dokumentierte Messwerte** zu Apple-Silicon für lokale Inferenz — in einer Quellenlage, die sonst überwiegend aus Apple-Herstellergaben besteht. Sein M5-Ultra-Review ist die erste im Wiki dokumentierte unabhängige Verifikation der M5-Ultra-Leistungsversprechen (Bandbreite 1,2 TB/s, Prefill- und Generierungszuwächse) und quantifiziert zugleich die Grenzen gegenüber einer RTX 5090.
Wichtig für die Einordnung: Er testet **agentische Workloads** (Harness-Kontext, Tool-Calls, Subagenten, lange Threads), nicht reine Chat-Benchmarks — genau die Last, die im Wiki als neue Referenzgröße gilt.
## Projekt-Autor
- **RemCTL** — CLI für Apple Reminders (github.com/viticci/remctl), u.a. in seinem Agenten-Workflow genutzt.
## Wikifizierte Inhalte
| Datum | Quelle | Thema |
|-------|--------|-------|
| 2026-09-21 | [raw/blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md](../../raw/blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md) | M5 Ultra Mac Studio Review — unabhängige Benchmarks für lokale KI-Agenten |
## Verwandte Wiki-Seiten
- [[../concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md]] — die von ihm verifizierte Hardware (M5 Ultra, 1,2 TB/s)
- [[../institutions/macstories.md]] — seine Publikation
- [[../concepts/llm/qwen3.8-flash-next-qwen4-preview.md]] — sein lokales Default-Modell
- [[../concepts/hardware/lokale-ki-coding.md]] — Kostenfrage lokaler KI (Hardware statt Tokens)
- [[../concepts/hardware/cloud-exit-and-local-superiority.md]] — Cloud-Exit-These, die sein 0-$-Workflow praktisch bestätigt
- [[../concepts/llm/qwen3.8-27b-alibaba.md]] — Qwen3.8-27B als von ihm getestete Modellklasse