knowledge-base/raw/blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md

85 lines
7.2 KiB
Markdown
Raw Normal View History

---
type: blog
source_url: https://www.macstories.net/stories/m5-ultra-mac-studio-review-the-dream-mac-for-local-ai-agents/
retrieved: 2026-09-22
title: "M5 Ultra Mac Studio Review: The Dream Mac for Local AI Agents"
author: "Federico Viticci"
published: 2026-09-21
publisher: "MacStories"
tags: [apple, m5-ultra, mac-studio, local-ai, mlx, unified-memory, memory-bandwidth, rtx-5090, qwen3.8-flash-next, glm-5.3-flash, agenten, omx, quantisierung]
---
# M5 Ultra Mac Studio Review: The Dream Mac for Local AI Agents
## Metadaten
- Publikation: MacStories (https://www.macstories.net/), Autor Federico Viticci
- Veröffentlicht: 2026-09-21, 13:00 UTC (`datePublished` der Seite), zuletzt geändert 13:17 UTC
- Abruf: 2026-09-22 via web_fetch (readability-Extraktion, vollständig; 21.401 Zeichen)
- Geteilt von Kai (@PWeber) in OME-Topic „Openclaw mit lokalen Modellen" (#1744), 2026-09-22 09:19 UTC
- Testgerät: M5 Ultra Mac Studio mit **256 GB** RAM (die 512-GB-Variante erscheint laut Artikel erst Ende Oktober)
## Kurzfassung (Fakten aus dem Artikel)
Viticci testete über mehrere Tage das M5 Ultra Mac Studio (256 GB) gegen seinen Vorgänger M3 Ultra (512 GB) und einen Desktop-Gaming-PC mit RTX 5090. Seine These: Der M5 Ultra ist eine „Traummaschine" für lokale KI-Agenten — schnell genug, dass er Qwen3.8-Flash-Next zu seinem Standardmodell in beiden von ihm genutzten Assistenten gemacht hat (Open Minis für iOS und Hermes Agent), und dass diese Assistenten nun vollständig lokal laufen. Er nennt ausdrücklich, dass er OpenClaw und Hermes Agent zuvor skeptisch gegenüber lokalen Modellen war.
## Architektur und Specs (im Artikel bestätigt)
- **Quad-Die-Aufbau:** UltraFusion verbindet zwei Dual-Die-M5-Max-Chips zu einer Quad-Die-Architektur — laut Artikel ein Novum im Apple-Ökosystem.
- **GPU:** 80 Cores, jeder mit einem Neural Accelerator; bis zu **4,5× Peak-GPU-Compute für KI** gegenüber M3 Ultra.
- **Unified Memory:** weiterhin bis **512 GB** (Modell kommt Ende Oktober).
- **Bandbreite:** **819 GB/s → 1,2 TB/s**, also **+50 %** gegenüber M3 Ultra.
- **Referenzpunkt RTX 5090:** 1,79 TB/s Bandbreite, 32 GB VRAM.
## Messwerte (unabhängiger Test, nicht Herstellerangabe)
### Gegen M3 Ultra
- **Token-Generierung: im Schnitt ~70 % schneller** als M3 Ultra (Side-by-Side-Vergleich mit Open Minis auf iOS).
- **Prompt-Processing (Prefill): im Schnitt +150 %** gegenüber M3 Ultra — laut Autor eine ~2,5-fache Verbesserung.
- Qwen3.8-Flash-Next auf dem M5 Ultra: **über 100 tok/s bei kurzen Prompts**, **6085 tok/s bei 64K bis 256K Kontext**.
- Bei Multi-Turn-Agentenschleifen mit Subagenten: 6085 tok/s, auch während das Thread-Kontextfenster wächst.
### Gegen RTX 5090
- **Prefill (compute-gebunden):** Bei einem 6.000-Token-Prompt liest der M5 Ultra mit **~1.700 tok/s**, die RTX 5090 mit **~3.000 tok/s** (Qwen-Modell in LM Studio). Apples Neural Accelerators verkleinern die Lücke, schließen sie aber nicht.
- **Generierung (bandbreitengebunden):** 5090 (1,79 TB/s) gegen M5 Ultra (1,2 TB/s) ergibt einen **konstanten Vorsprung von ~25 %** bei jeder Prompt-Größe.
- **Grenze der 5090:** Nur 32 GB VRAM; bei 256K Kontext reicht es nur noch für einen 8-Bit-Attention-Cache. Modelle über 32 GB müssen per PCIe in den (langsameren) System-RAM ausgelagert werden.
- **Thermik/Lärm:** Der 5090-PC heizte das Büro spürbar auf; das Mac Studio war warm, aber deutlich leiser, Lüfter nicht hörbar (bei Flash-Next-oQ4e im Dauerbetrieb nur mit dem Ohr direkt am Gehäuse wahrnehmbar).
## Praktische Nutzung (Workflow-Beschreibung des Autors)
- **Lokaler Standard:** Qwen3.8-Flash-Next läuft lokal als Default in Open Minis (iOS) und Hermes Agent.
- **Codex-Integration:** Flash-Next in der Codex-App als lokales Modell eingerichtet; GPT-Modelle orchestrieren lokale Subagenten, Flash-Next koordiniert eigene Subagenten; Nutzung per Codex Remote von iOS möglich.
- **Quantisierung:** 5-Bit läuft auf dem 256-GB-Modell vollständig im RAM (laut Autor der Sweet Spot aus Intelligenz, Performance und Speicherverbrauch); 6- und 8-Bit können die N-Gramm-Tabellen per Architektur-Feature auf SSD auslagern.
- **Parallelität:** Mit **oMLX** (0.7.0.dev2) lassen sich auf 256 GB bis zu **drei gleichzeitige Flash-Next-Sessions mit Subagenten** betreiben.
- Größere Modelle wie **GLM-5.3-Flash** laufen dank Unified Memory mit brauchbarer Performance lokal.
### Referenzprojekt: 99 Tage Agenten für 0 $
- Für die Recherche zum iOS-/iPadOS-27-Review baute Viticci die interne App **Desk**: am Ende **310 Dokumente** (Notizen, Sessions, PDFs, geclippte Webseiten).
- Ein Agententeam auf Basis von **DeepSeek V4 Flash** plus **olmOCR** (PDF-Verarbeitung) lief **24/7 über 99 Tage**.
- Aufgaben: WWDC-Sessions transkribieren (mit `summarize` plus LLM-Verarbeitung), Features aus Quellen extrahieren, Features quervalidieren und Kapiteln zuordnen, Features/Bugs aus Screenshots extrahieren, Organisation über die Notion-API.
- Begründung für lokal: Derart dauerhafte Hintergrundlast wäre über OpenAI-/Anthropic-APIs „cost-prohibitive" gewesen.
- Ergebnis laut Artikel: Der gesamte Recherche-Stack lief lokal auf dem Mac Studio zu **Gesamtkosten von 0 $**.
### Cloud-Vergleich (vom Autor ebenfalls getestet)
- Boutique-Anbieter mit Open Minis: **Inco** (Kimi K3, >300 TPS), **Cerebras** (Qwen3.8-27B, 1.800 TPS), **Fireworks** und **Baseten** (>150 TPS).
- Bewertung: sehr gute Nutzererfahrung, aber teuer — der Autor verbrauchte **20 $ Inco-Credits in rund 10 Minuten**.
## Testaufbau (Methodik)
- Automatisierte Tests über ein selbstgebautes Harness, erstellt mit **GPT-6 Astra**; koordinierte mehrere Codex-Instanzen über M3 Ultra, M5 Ultra und einen Windows-PC (Codex-App/Computer Use).
- macOS-Backend: **oMLX 0.7.0.dev2** als MLX-Server. Getestete Modelle: `Qwen3.8-Flash-Next-oQ4e-mtp`, `GLM-5.3-Flash-MLX-mixed-4_8bit`, `Qwen3.8-27B-oQ4e-mtp`; OS: macOS Golden Gate 27.0.
- Windows: LM Studio mit `Qwen3.8-27B-GGUF` (Q4_K_M), CUDA 12, alle 66 Layer auf der GPU; zusätzlich Splits zwischen GPU und System-RAM.
- Messdaten über vier Tage gesammelt; Visualisierungen erstellt mit Claude Fable 5.1 und Opus 5 (Anthropic-Projects-Feature).
## Offen / nicht getestet (vom Autor genannt)
- **DwarfStar** (`antirez/ds4`) — Projekt, das Frontier-Modelle mit noch weniger Speicher auf verschiedenen Mac-Konfigurationen lauffähig macht.
- **Inco Splash** — neue Inference-Engine für Apple Silicon.
- **Exo** — RDMA-Implementierung, die Inferenz theoretisch über Thunderbolt 5 zwischen M3 Ultra und M5 Ultra aufteilen könnte (OpenAI-kompatibler Server davor).
- **512-GB-M5-Ultra** — der Autor möchte dort den 8-Bit-Quant ohne SSD-Offloading messen.
- Erwartung: Ein künftiger **M7 Ultra** könnte die Speicherbandbreite einer 5090 übertreffen.
## Einordnung des Autors
Laut Viticci outperformt Open-Weight-Software auf Consumer-Hardware inzwischen, was vor rund zehn Monaten als „Frontier" galt; mit der M5-Ultra-Performance werde agentisches Coding lokal machbar, und er erwartet entsprechende Experimente aus der MLX-Community. Er beschreibt sich selbst als Tinkerer, nicht als KI-Entwickler (kein Training/Fine-Tuning), und empfiehlt solche Setups ausdrücklich nicht für Nutzer, die einfach nur ein Abo abschließen wollen.