NVIDIAs Desktop-AI-Supercomputer (Projekt „DIGITS", Launch Oktober 2025): ein vollständiges GB10-Grace-Blackwell-System im Desktop-Format, ausgerichtet auf lokale Inferenz und Fine-Tuning kleinerer bis mittlerer Modelle. Erste Zielplattform für Perplexitys vollständig lokalen Agent-Stack („Portable Computer", 2026-08-25).
- **Llama 3.1 70B FP8 (SGLang):** 803 prefill / **2,7 decode** — dichte 70B-Modelle sind auf der Box praktisch unbrauchbar (<3tok/s)
- **EAGLE3 speculative decoding:** bis ~2× Speedup; kein Thermal-Throttling über längere Läufe
### Community / weitere Messungen
- llama.cpp-Diskussion (#16578): gpt-oss-120B ~35 tok/s — nahe am Ollama-Wert; Community-Kritik am Preis-Leistungs-Verhältnis vs. RTX 6000 Pro oder Mac Studio
Zwei Sparks über ConnectX-7 (200 Gb/s RDMA) ergeben einen **256-GB-unified-Memory-Pool**; NVIDIA demonstrierte Llama 3.1 **405B (FP4)** lokal auf zwei Geräten. Die aktuelle Produktseite nennt „bis zu 4 Systeme → 700B Parameter" — reale Multi-Node-Benchmarks dazu sind (Stand 08/2026) nicht unabhängig verifiziert.
- **Reale Stärke:** MoE-Modelle (gpt-oss-120B @ 41 t/s, DeepSeek-R1-14B), 8B–27B-Klasse für Agent-Workloads, Perplexity „Portable Computer" als erste vollständig lokale Agent-Plattform auf Spark — siehe [[perplexity-portable-computer.md]].
- **Reale Schwäche:** dichte 70B+ (2,7 t/s) und der Preis nach der Erhöhung — LMSYS und llama.cpp-Community kommen zu einem kritischen Fazit; DRAM-Teuerung 2026 verstärkt das Problem (siehe [[../concepts/hardware/china-local-ai-box.md]]).
- **Verwandte lokale Infrastruktur:** [[../concepts/hardware/edge-inference-als-cloud-alternative.md]] (AMD Strix Halo, 128 GB als x86-Alternative), [[../concepts/hardware/cloud-exit-and-local-superiority.md]], [[../concepts/hardware/nvidia-dgx-station-748gb.md]] (DGX-Ladder Spark → Station → Datacenter), [[../concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md]] (Apple-Gegenseite).
- **Software:** Ollama, llama.cpp, NIM, LM Studio, DGX OS; „NemoClaw"-Referenz für die OpenClaw-Community auf der NVIDIA-Produktseite — siehe [[openclaw.md]].
- **[NVIDIA-Agenten-Workflow für SimReady-Szenen](../concepts/agents/nvidia-agenten-3d-scene-prep.md)** (17.09.2026): Der DGX Spark wird dort explizit als Prototyping-System für NemoClaw-Subagents, Blender-MCP-Anbindung, USD-Authoring und ovrtx-/ovphysx-Loops empfohlen — die Kategorie „Agenten-Harness auf dem Desktop" neben „lokale Inferenz".