--- created: 2026-08-25 updated: 2026-09-22 sources: [youtube/2026-08-25_apfelfunk-neue-macs-m6-m5-ultra.md, blog/2026-08-25_heise-apple-m6-m5-ultra-mac-update.md, blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md] tags: [concept, hardware, apple, m6, m5-pro, m5-max, m5-ultra, mac-mini, mac-studio, unified-memory, local-ai, thunderbolt-5, mlx, rtx-5090, benchmarks, memory-bandwidth] --- # Apple M6 & M5 Ultra — Mac mini/Mac Studio Sommer-Update für lokale KI > **Kern:** Apple aktualisiert am 25.08.2026 unerwartet mitten im Sommer Mac mini und Mac Studio komplett — mit klarem Fokus auf lokale KI. Der M6 ist Apples erster 2-nm-Chip, der M5 Ultra bringt die erste echte UltraFusion-Interconnect-Steigerung seit 2022 (4,4 TB/s, bis 512 GB Unified Memory) und mehrere Studios lassen sich per Thunderbolt 5/RDMA zu Clustern verbinden. Alle Leistungsangaben unten sind **Herstellerangaben (laut Apple)**, zusammengestellt vom heise-Artikel, den das Apfelfunk-Video selbst als Quelle verlinkt. ## Was passiert ist Unerwartetes Hardware-Update am Dienstagabend (deutscher Zeit): neue Chips **M6 und M5 Pro** im Mac mini, **M5 Max und M5 Ultra** im Mac Studio. Vorbestellungen ab 2026-08-25, Verkaufsstart laut Artikel 22.09.2026. Der Zeitpunkt ist ungewöhnlich — neue Macs kamen sonst im Herbst (Oktober/November). Begründung aus Cupertino: hohe Nachfrage. Heise zufolge hat insbesondere der Einsatz von **KI-Agenten wie OpenClaw** kräftig Nachfrage beschert (Zuschreibung Apple/heise, nicht unabhängig verifiziert — aber für die OpenClaw-Ökosophäre ein bemerkenswertes Signal, siehe [[../../tools/openclaw.md]]). ## Chip-Übersicht | Chip | Gerät | Node | CPU | GPU | KI-Claim (laut Apple) | Unified Memory | |------|-------|------|-----|-----|----------------------|----------------| | M6 | Mac mini | **2 nm** (erster Apple-Chip) | 12 Cores (2 Super/4 Perf/6 Eff), +40 % MT vs M4 | 12 Cores, erstmals Neural Accelerators im mini | 4× KI-Rechenleistung, 2× Grafik vs M4 | bis 32 GB @ 170 GB/s | | M5 Pro | Mac mini | 3 nm (Debüt März 2026 im MacBook Pro) | — | — | bis 4× schnellere KI-Workloads | bis 64 GB | | M5 Max | Mac Studio | 3 nm (Frühjahr 2026) | 18 Cores, +30 % vs M4 Max | 40 Cores, Neural Accelerators in jedem Core | bis 4× KI-Aufgaben | bis 128 GB @ 614 GB/s | | M5 Ultra | Mac Studio | 3 nm, zwei M5-Max-Dies via UltraFusion | 36 Cores (12 Super/24 Perf), +30 % MT vs M3 Ultra | 80 Cores, erstmals Neural Accelerators im Ultra | bis 4,5× KI-Rechenleistung, +80 % Grafik | bis **512 GB** @ **1,2 TB/s** (+50 %) | ## Die wichtigsten Details ### M6: 2-nm-Debüt Der M6 ist der erste Apple-Chip in 2-nm-Bauweise; die M5-Familie bleibt bei 3 nm. Dazu Dual-16-Core-Neural Engine. Der Mac mini mit M6 bekommt allerdings nur drei Thunderbolt-4-Ports — **Thunderbolt 5 gibt es nur im M5-Pro-mini**, und damit auch dessen Cluster-Fähigkeit. ### M5 Ultra: erster echter Interconnect-Sprung seit 2022 Die UltraFusion-Bandbreite steigt von 2,5 TB/s (M3 Ultra) auf **4,4 TB/s** — laut heise die erste echte Leistungssteigerung des Interconnects seit Einführung 2022. Vermutlich der Grund, warum Apple einen M4 Ultra komplett übersprungen hat. Media Engine: bis zu 33 gleichzeitige 8K-ProRes-422-Streams bei 30 fps. ### Cluster-Fähigkeit als neues Thema Mehrere Mac Studios lassen sich per Thunderbolt 5 clustern, Grundlage ist RDMA (Remote Direct Memory Access). Genannte Einsatzziele: Training von KI-Modellen bzw. Betrieb von Modellen **mit über einer Billion Parametern**. Auch der Mac mini M5 Pro ist laut Artikel „clusterfähig“ für lokale KI-Modelle. ### Der Haken: Preise und Verfügbarkeit Apple hatte wenige Wochen zuvor wegen **Speicherknappheit** die Preise deutlich erhöht — die neuen Modelle setzen nochmal drauf: | Modell | neu ab | Vergleich zum Vorgänger-Start | |--------|--------|------------------------------| | Mac mini M6 | 1049 € | M4 startete bei 699 € (zuletzt 949 €) | | Mac mini M5 Pro | 1999 € | M4 Pro: 1649 € | | Mac Studio M5 Max | 2999 € | M4 Max: 2499 € | | Mac Studio M5 Ultra | 6599 € | M3 Ultra: 4999 € | Apple werde produzieren, so viel es könne — übersetzt: die Nachfrage dürfte das Angebot knapp halten, Wartezeiten möglich. Die 512-GB-Ultra-Variante kommt erst Ende Oktober. ## Einordnung: lokale KI als Kaufargument Heise benennt den Unternehmens-Winkel explizit: Der Leistungszuwachs der „KI-Kraftwerke“ lasse sich gegen **eingesparte Cloud-Tokens** aufrechnen; dazu Datenschutz und Datensouveränität. Das passt exakt in den Trend, den dieses Wiki an mehreren Stellen dokumentiert: - **Unified-Memory-Rennen:** Strix Halo mit 128 GB ([[edge-inference-als-cloud-alternative.md]]) → DGX Spark mit 128 GB → M5 Ultra mit 512 GB → NVIDIA DGX Station mit 748 GB ([[nvidia-dgx-station-748gb.md]]). RAM/Bandbreite ist das entscheidende Spec-Feld für lokale Inferenz geworden — siehe [[cloud-exit-and-local-superiority.md]]. Mit Perplexity "Portable Computer" ([[../../tools/perplexity-portable-computer.md]]) läuft seit August 2026 erstmals ein vollständiger Agent-Stack (Orchestrator + Subagents + Harness) auf der Spark-Klasse. - **Cluster statt Einzelmaschine:** TB5/RDMA-Clusterung verschiebt die Grenze, was „Desktop-Hardware“ in der Summe kann (>1T-Parameter-Modelle als erklärtes Ziel). Damit konkurriert Consumer-/Prosumer-Hardware erstmals strukturell mit Datacenter-Setups. - **OpenClaw als Nachfrage-Treiber:** Dass ausgerechnet agentengetriebene lokale KI als Verkaufsargument und Ursache des ungewöhnlichen Release-Timings genannt wird, ist ein Validierungs-Signal für den Agenten-Alltag — mit der Einschränkung, dass dies eine Apple/heise-Zuschreibung ist. - **Preis-Schiene:** Speicherknappheit treibt die Preise — RAM bleibt die knappe Währung ([[lokale-ki-coding.md]] nennt dieselbe Dynamik von der Kosten-Seite). - **Chinas Gegenangriff auf dieselbe Schicht:** Laut Devsplainers (26.08.) hat Apple zusätzlich die **512-GB-/256-GB-Mac-Studio-Konfigurationen** entfernt (MacRumors/AppleInsider/9to5Mac zitiert dort) und Xiaomi greift mit dem O100 (1,22 TB/s) die Bandbreiten-Führung an — siehe [[china-local-ai-box.md]]. ## Verifikation: unabhängige Benchmarks (MacStories, 2026-09-21) Die zuvor offene Lücke — „nur Herstellerangaben" — ist geschlossen. [[../../people/federico-viticci.md|Federico Viticci]] ([[../../institutions/macstories.md|MacStories]]) testete das **M5 Ultra Mac Studio mit 256 GB** über mehrere Tage gegen einen M3 Ultra (512 GB) und einen Desktop-PC mit RTX 5090. Geteilt von Kai (@PWeber) im OME-Topic „Openclaw mit lokalen Modellen". Die Specs wurden bestätigt: Quad-Die-Aufbau via UltraFusion, 80 GPU-Cores mit je einem Neural Accelerator, **Bandbreite 819 GB/s → 1,2 TB/s (+50 %)**. | Metrik | Messwert | Vergleich | |--------|----------|-----------| | Token-Generierung | ~**+70 %** | vs. M3 Ultra (Side-by-Side, Open Minis) | | Prompt-Processing (Prefill) | ~**+150 %** (≈2,5×) | vs. M3 Ultra | | Generierung, Qwen3.8-Flash-Next | **>100 tok/s** kurz / **60–85 tok/s** | bei 64K–256K Kontext | | Prefill, 6.000-Token-Prompt | **~1.700 tok/s** | RTX 5090: **~3.000 tok/s** | | Generierung (bandbreitengebunden) | — | RTX 5090 konstant **~25 %** voraus (1,79 TB/s vs. 1,2 TB/s) | Die Messwerte bestätigen zugleich die Bandbreiten-These aus [[china-local-ai-box.md]]: Prefill ist compute-gebunden (Tensor/Neural Cores), Generierung ist bandbreitengebunden — und die 5090 verliert trotz ihres Vorsprungs bei Modellen über 32 GB VRAM, weil sie per PCIe in den System-RAM auslagern muss. **Praxistauglichkeit (Agenten-Last, nicht Chat-Benchmark):** Viticci hat Qwen3.8-Flash-Next ([[../llm/qwen3.8-flash-next-qwen4-preview.md]]) als lokales Default-Modell in Open Minis und Hermes Agent gesetzt; 5-Bit läuft vollständig im RAM, mit oMLX sind bis zu drei parallele Flash-Next-Sessions mit Subagenten möglich, größere Modelle wie GLM-5.3-Flash ([[../llm/glm-5.3-z-ai.md]]) laufen lokal mit brauchbarer Performance. Sein Referenzprojekt: 99 Tage durchgehender Agentenbetrieb (DeepSeek V4 Flash + olmOCR, 310 Dokumente) zu Gesamtkosten von **0 $** — siehe [[lokale-ki-coding.md]]. ⚠️ **Quellenlage (aktualisiert):** Die Apple-Angaben aus dem heise-Bericht sind für Bandbreite und Architektur durch unabhängige Messungen bestätigt; die konkreten Tokens/s-Werte stammen aus einem Einzeltest (MacStories, n=1 Setup) und sind nicht breit repliziert. Das Apfelfunk-Video (16:49, deutsch) war ohne Transcript — erfasst sind Metadaten, Beschreibung und Kapitelmarken. ## Verwandte Seiten - [[nvidia-dgx-station-748gb.md]] — Datacenter-Pendant im Desktop-Format (748 GB) - [[edge-inference-als-cloud-alternative.md]] — AMD Strix Halo als x86-Gegenstück (128 GB) - [[cloud-exit-and-local-superiority.md]] — Cloud-Exit-Trend und RAM als digitale Währung - [[lokale-ki-coding.md]] — Kostenfrage lokaler KI: Hardware statt Tokens - [[../../tools/openclaw.md]] — OpenClaw als genannter Nachfrage-Treiber - [[../../tools/perplexity-portable-computer.md]] — lokaler Big-Tech-Agent-Stack, erste Verfügbarkeit auf DGX Spark - [[../../people/federico-viticci.md]] — unabhängiger Tester (M5-Ultra-Review, Messwerte oben) - [[../../institutions/macstories.md]] — Publikation des Reviews, unabhängige Verifikationsquelle - [[../llm/qwen3.8-flash-next-qwen4-preview.md]] — lokal als Default-Modell eingesetzt (>100 tok/s kurz) - [[china-local-ai-box.md]] — Bandbreiten-These, durch die Messwerte praktisch bestätigt