knowledge-base/raw/blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md

7.2 KiB
Raw Permalink Blame History

type source_url retrieved title author published publisher tags
blog https://www.macstories.net/stories/m5-ultra-mac-studio-review-the-dream-mac-for-local-ai-agents/ 2026-09-22 M5 Ultra Mac Studio Review: The Dream Mac for Local AI Agents Federico Viticci 2026-09-21 MacStories
apple
m5-ultra
mac-studio
local-ai
mlx
unified-memory
memory-bandwidth
rtx-5090
qwen3.8-flash-next
glm-5.3-flash
agenten
omx
quantisierung

M5 Ultra Mac Studio Review: The Dream Mac for Local AI Agents

Metadaten

  • Publikation: MacStories (https://www.macstories.net/), Autor Federico Viticci
  • Veröffentlicht: 2026-09-21, 13:00 UTC (datePublished der Seite), zuletzt geändert 13:17 UTC
  • Abruf: 2026-09-22 via web_fetch (readability-Extraktion, vollständig; 21.401 Zeichen)
  • Geteilt von Kai (@PWeber) in OME-Topic „Openclaw mit lokalen Modellen" (#1744), 2026-09-22 09:19 UTC
  • Testgerät: M5 Ultra Mac Studio mit 256 GB RAM (die 512-GB-Variante erscheint laut Artikel erst Ende Oktober)

Kurzfassung (Fakten aus dem Artikel)

Viticci testete über mehrere Tage das M5 Ultra Mac Studio (256 GB) gegen seinen Vorgänger M3 Ultra (512 GB) und einen Desktop-Gaming-PC mit RTX 5090. Seine These: Der M5 Ultra ist eine „Traummaschine" für lokale KI-Agenten — schnell genug, dass er Qwen3.8-Flash-Next zu seinem Standardmodell in beiden von ihm genutzten Assistenten gemacht hat (Open Minis für iOS und Hermes Agent), und dass diese Assistenten nun vollständig lokal laufen. Er nennt ausdrücklich, dass er OpenClaw und Hermes Agent zuvor skeptisch gegenüber lokalen Modellen war.

Architektur und Specs (im Artikel bestätigt)

  • Quad-Die-Aufbau: UltraFusion verbindet zwei Dual-Die-M5-Max-Chips zu einer Quad-Die-Architektur — laut Artikel ein Novum im Apple-Ökosystem.
  • GPU: 80 Cores, jeder mit einem Neural Accelerator; bis zu 4,5× Peak-GPU-Compute für KI gegenüber M3 Ultra.
  • Unified Memory: weiterhin bis 512 GB (Modell kommt Ende Oktober).
  • Bandbreite: 819 GB/s → 1,2 TB/s, also +50 % gegenüber M3 Ultra.
  • Referenzpunkt RTX 5090: 1,79 TB/s Bandbreite, 32 GB VRAM.

Messwerte (unabhängiger Test, nicht Herstellerangabe)

Gegen M3 Ultra

  • Token-Generierung: im Schnitt ~70 % schneller als M3 Ultra (Side-by-Side-Vergleich mit Open Minis auf iOS).
  • Prompt-Processing (Prefill): im Schnitt +150 % gegenüber M3 Ultra — laut Autor eine ~2,5-fache Verbesserung.
  • Qwen3.8-Flash-Next auf dem M5 Ultra: über 100 tok/s bei kurzen Prompts, 6085 tok/s bei 64K bis 256K Kontext.
  • Bei Multi-Turn-Agentenschleifen mit Subagenten: 6085 tok/s, auch während das Thread-Kontextfenster wächst.

Gegen RTX 5090

  • Prefill (compute-gebunden): Bei einem 6.000-Token-Prompt liest der M5 Ultra mit ~1.700 tok/s, die RTX 5090 mit ~3.000 tok/s (Qwen-Modell in LM Studio). Apples Neural Accelerators verkleinern die Lücke, schließen sie aber nicht.
  • Generierung (bandbreitengebunden): 5090 (1,79 TB/s) gegen M5 Ultra (1,2 TB/s) ergibt einen konstanten Vorsprung von ~25 % bei jeder Prompt-Größe.
  • Grenze der 5090: Nur 32 GB VRAM; bei 256K Kontext reicht es nur noch für einen 8-Bit-Attention-Cache. Modelle über 32 GB müssen per PCIe in den (langsameren) System-RAM ausgelagert werden.
  • Thermik/Lärm: Der 5090-PC heizte das Büro spürbar auf; das Mac Studio war warm, aber deutlich leiser, Lüfter nicht hörbar (bei Flash-Next-oQ4e im Dauerbetrieb nur mit dem Ohr direkt am Gehäuse wahrnehmbar).

Praktische Nutzung (Workflow-Beschreibung des Autors)

  • Lokaler Standard: Qwen3.8-Flash-Next läuft lokal als Default in Open Minis (iOS) und Hermes Agent.
  • Codex-Integration: Flash-Next in der Codex-App als lokales Modell eingerichtet; GPT-Modelle orchestrieren lokale Subagenten, Flash-Next koordiniert eigene Subagenten; Nutzung per Codex Remote von iOS möglich.
  • Quantisierung: 5-Bit läuft auf dem 256-GB-Modell vollständig im RAM (laut Autor der Sweet Spot aus Intelligenz, Performance und Speicherverbrauch); 6- und 8-Bit können die N-Gramm-Tabellen per Architektur-Feature auf SSD auslagern.
  • Parallelität: Mit oMLX (0.7.0.dev2) lassen sich auf 256 GB bis zu drei gleichzeitige Flash-Next-Sessions mit Subagenten betreiben.
  • Größere Modelle wie GLM-5.3-Flash laufen dank Unified Memory mit brauchbarer Performance lokal.

Referenzprojekt: 99 Tage Agenten für 0 $

  • Für die Recherche zum iOS-/iPadOS-27-Review baute Viticci die interne App Desk: am Ende 310 Dokumente (Notizen, Sessions, PDFs, geclippte Webseiten).
  • Ein Agententeam auf Basis von DeepSeek V4 Flash plus olmOCR (PDF-Verarbeitung) lief 24/7 über 99 Tage.
  • Aufgaben: WWDC-Sessions transkribieren (mit summarize plus LLM-Verarbeitung), Features aus Quellen extrahieren, Features quervalidieren und Kapiteln zuordnen, Features/Bugs aus Screenshots extrahieren, Organisation über die Notion-API.
  • Begründung für lokal: Derart dauerhafte Hintergrundlast wäre über OpenAI-/Anthropic-APIs „cost-prohibitive" gewesen.
  • Ergebnis laut Artikel: Der gesamte Recherche-Stack lief lokal auf dem Mac Studio zu Gesamtkosten von 0 $.

Cloud-Vergleich (vom Autor ebenfalls getestet)

  • Boutique-Anbieter mit Open Minis: Inco (Kimi K3, >300 TPS), Cerebras (Qwen3.8-27B, 1.800 TPS), Fireworks und Baseten (>150 TPS).
  • Bewertung: sehr gute Nutzererfahrung, aber teuer — der Autor verbrauchte 20 $ Inco-Credits in rund 10 Minuten.

Testaufbau (Methodik)

  • Automatisierte Tests über ein selbstgebautes Harness, erstellt mit GPT-6 Astra; koordinierte mehrere Codex-Instanzen über M3 Ultra, M5 Ultra und einen Windows-PC (Codex-App/Computer Use).
  • macOS-Backend: oMLX 0.7.0.dev2 als MLX-Server. Getestete Modelle: Qwen3.8-Flash-Next-oQ4e-mtp, GLM-5.3-Flash-MLX-mixed-4_8bit, Qwen3.8-27B-oQ4e-mtp; OS: macOS Golden Gate 27.0.
  • Windows: LM Studio mit Qwen3.8-27B-GGUF (Q4_K_M), CUDA 12, alle 66 Layer auf der GPU; zusätzlich Splits zwischen GPU und System-RAM.
  • Messdaten über vier Tage gesammelt; Visualisierungen erstellt mit Claude Fable 5.1 und Opus 5 (Anthropic-Projects-Feature).

Offen / nicht getestet (vom Autor genannt)

  • DwarfStar (antirez/ds4) — Projekt, das Frontier-Modelle mit noch weniger Speicher auf verschiedenen Mac-Konfigurationen lauffähig macht.
  • Inco Splash — neue Inference-Engine für Apple Silicon.
  • Exo — RDMA-Implementierung, die Inferenz theoretisch über Thunderbolt 5 zwischen M3 Ultra und M5 Ultra aufteilen könnte (OpenAI-kompatibler Server davor).
  • 512-GB-M5-Ultra — der Autor möchte dort den 8-Bit-Quant ohne SSD-Offloading messen.
  • Erwartung: Ein künftiger M7 Ultra könnte die Speicherbandbreite einer 5090 übertreffen.

Einordnung des Autors

Laut Viticci outperformt Open-Weight-Software auf Consumer-Hardware inzwischen, was vor rund zehn Monaten als „Frontier" galt; mit der M5-Ultra-Performance werde agentisches Coding lokal machbar, und er erwartet entsprechende Experimente aus der MLX-Community. Er beschreibt sich selbst als Tinkerer, nicht als KI-Entwickler (kein Training/Fine-Tuning), und empfiehlt solche Setups ausdrücklich nicht für Nutzer, die einfach nur ein Abo abschließen wollen.