--- created: 2026-06-28 updated: 2026-06-28 sources: [youtube/2026-06-28_nvidia-748gb-ram-desktop-local-ai.md] tags: [concept, hardware, nvidia, dgx-station, gb300, grace-blackwell, unified-memory, local-ai, cloud-exit, lm-studio, ollama] --- # NVIDIA DGX Station — 748 GB Unified Memory Desktop > *"LM Studio and Ollama finally lose their asterisk."* > — The Stack, YouTube, 2026-06-27 ## Kernthese NVIDIAs DGX Station (GB300 Grace Blackwell Ultra Desktop Superchip) bringt **748 GB kohärenter Unified Memory** in einen einzelnen Schreibtisch-Tower — genug, um ein 70B-Modell in voller Präzision (FP16/BF16) ohne Quantisierung zu laden. Das entfernt den letzten Haken von LM Studio und Ollama: die "läuft lokal, aber nur quantisiert"-Einschränkung. Die Maschine ist kein Konzept — sie wurde von Jensen Huang auf der GTC Taipei (31.05.2026) angekündigt, OEMs (ASUS, Dell, HP, MSI) listen sie bereits, und die Cloud-ROI-Mathematik rechtfertigt sie für anhaltende Workloads. ## Architektur: GB300 Grace Blackwell Ultra Desktop Superchip Der GB300 ist ein **Superchip** — CPU und GPU auf einem Die, verbunden über NVLink-C2C: | Komponente | Spec | |------------|------| | CPU | 72-core ARM Grace | | GPU | Blackwell Ultra | | Interconnect | NVLink-C2C @ 900 GB/s | | GPU Memory | 252 GB HBM3e @ 7.1 TB/s | | CPU Memory | 496 GB LPDDR5X | | **Total Unified Memory** | **748 GB (ein Adressraum, kohärent)** | | Compute | 20 petaFLOPS FP4 | **Das entscheidende Architektur-Merkmal:** HBM3e und LPDDR5X sind **fully coherent** — ein Adressraum, zero explicit copies. Die GPU kann direkt auf CPU-Memory zugreifen und umgekehrt. Das eliminiert den PCIe-Bottleneck, der bei diskreten GPU-Setups den Datentransfer dominiert. > Siehe auch: [[edge-inference-als-cloud-alternative.md]] — AMDs Strix Halo bringt das Unified-Memory-Prinzip in die x86-Welt (128 GB). Der GB300 skaliert dasselbe Prinzip um das 5,8-fache. ## Was 748 GB bedeuten | Modell-Größe | FP16 VRAM-Bedarf | Passt in 748 GB? | Quantisierung nötig? | |-------------|-----------------|-------------------|----------------------| | 8B | ~16 GB | ✅ (massiv Spielraum) | Nein | | 34B | ~68 GB | ✅ | Nein | | 70B | ~140 GB | ✅ (5× Platz) | Nein | | 405B | ~810 GB | ❌ | Ja (4-bit → ~200 GB) | | 1T (Trillion) | ~2 TB | ❌ | Ja (4-bit → ~500 GB, knapp) | **Die Trillion-Parameter-Realität:** NVIDIAs Claim, die DGX Station könne Trillionen-Parameter-Modelle laden, ist technisch wahr — aber **nur mit aggressiver 4-Bit-Quantisierung**. In voller Präzision (FP16/BF16) ist bei ~70B–100B die Grenze erreicht. Das ist kein Betrug, aber ein Asterisk, den der Video-Titel nicht zeigt. ## Preis und Positionierung | Produkt | Memory | Preis | Zielgruppe | |---------|--------|-------|------------| | **DGX Spark** | 128 GB | ~$4.700 | Prosumer-Einstieg | | **DGX Station** | 748 GB | ~$85K–$115K | Kleine Teams, sustained Workloads | | **Mac Studio M5 Ultra** | (variiert) | — | Solo-Entwickler, Mid-Size-Modelle (Value Crown) | - **MSI XpertStation WS300:** $96.995,99 (CDW-Listing) - NVIDIA verkauft keine Founders Edition — OEMs übernehmen Vertrieb ### Cloud-ROI-Mathematik | Kostenart | Wert | |-----------|------| | AWS p5 (vergleichbar) | ~$98/Stunde | | DGX Station (Einmal) | ~$98.000 | | Break-even | ~1.000 Stunden (~2 Monate sustained) | | Danach | Nur Strom + Wartung | **Einschätzung:** Für Teams, die 24/7-Inferenz betreiben, ist die DGX Station nach ~2 Monaten günstiger als Cloud. Für sporadische Nutzung bleibt Cloud überlegen. Die Mathematik funktioniert nur bei **anhaltender** Auslastung. ## DGX Station for Windows — Q4 2026 NVIDIA kündigt eine WSL-basierte Variante für Windows an. Status: **Versprechen, nicht lieferbar** (Q4 2026). Die aktuelle DGX Station läuft auf Linux. ## NVIDIA Roadmap: Drei Generationen | Generation | Status | |------------|--------| | Grace Blackwell (GB300) | Lieferbar (Computex 2026) | | Rubin | Geplant | | Rosa Feynman | Geplant | Zusätzlich: **RTX Spark** — NVIDIAs MediaTek-Partner-Consumer-AI-PC-Chip. NVIDIA zielt auf den gesamten PC-Markt ab, nicht nur Workstations. ## Einordnung: Wo steht die DGX Station im Cloud-Exit-Kontext? Die DGX Station ist das **Spitzenmodell** der lokalen KI-Hardware-Ladder: ``` DGX Spark (128 GB, $4.7K) → DGX Station (748 GB, ~$98K) → DGX Datacenter (rack-scale) ↑ ↑ ↑ Prosumer / Einzelbau Kleine Teams / 24-7-Workloads Cloud-Scale ``` ### Vergleich mit bestehenden Wiki-Hardware-Seiten | Plattform | Unified Memory | Preis | Vorteil | Quelle | |-----------|---------------|-------|---------|--------| | AMD Ryzen AI Max+ 395 (Strix Halo) | 128 GB | $1.499 | x86 Edge, lunchbox-Format | [[edge-inference-als-cloud-alternative.md]] | | Mac Studio M5 Ultra | (variiert) | — | Value Crown für Solo-Dev | Video-Comparison | | **NVIDIA DGX Station (GB300)** | **748 GB** | **~$85K–$115K** | **Full-precision 70B, sustained ROI** | Diese Seite | | NVIDIA DGX Spark | 128 GB | ~$4.700 | Prosumer-Einstieg | Diese Seite | ### Verbindung zum Cloud-Exit-Pattern Die DGX Station bestätigt die [[cloud-exit-and-local-superiority.md]]-These von einer neuen Seite: Nicht nur werden Cloud-Server teurer (Hetzner/HP-Preisschock), sondern lokale Hardware wird **kapazitativ** — 748 GB Unified Memory waren bisher Server-Rack-Territorium. Die "RAM als neue digitale Währung"-These aus dem OME21-Briefing bekommt hier ihre radikalste Bestätigung. Cross-Ref zu [[cloud-exit-and-local-superiority.md]] § "RAM als Währung": Dort war die These, dass Arbeitsspeicher zum Engpass und damit zur wertvollsten Resource wird. 748 GB in einer Desktop-Box ist die konsequente Antwort. ### LM Studio und Ollama: Der Asterisk verschwindet Bisher: Lokale LLM-Inferenz = "ja, aber nur quantisiert" (GGUF Q4/Q8). Die DGX Station entfernt diesen Asterisk: - **70B in FP16/BF16:** ~140 GB → passt in 748 GB mit 5× Reserve - **Keine Quantisierungs-Artifakte:** Full-precision-Inferenz ohne Quality-Loss - **LM Studio + Ollama:** Beide Tools werden auf der DGX Station unterstützt Das ist ein Paradigmenwechsel für die lokale KI-Community: die Frage verschiebt sich von "passt das Modell in den VRAM?" zu "ist die Hardware wirtschaftlich gerechtfertigt?". ## Quellen - **YouTube-Video:** [NVIDIA'S 748GB Ram Desktop Makes Local AI INSANELY Good](https://www.youtube.com/watch?v=EhXQysElOY8) — The Stack, 2026-06-27, 8:14 - **NVIDIA DGX Station:** [nvidia.com](https://www.nvidia.com/en-us/products/workstations/dgx-station/) - **NVIDIA DGX Spark:** [nvidia.com](https://www.nvidia.com/en-us/products/workstations/dgx-spark/) - **LM Studio:** [lmstudio.ai](https://lmstudio.ai) - **Ollama:** [ollama.com](https://ollama.com) ## Cross-Refs - [[cloud-exit-and-local-superiority.md]] — Cloud-Exit-These, Preisschock, lokale Performance-Parität - [[edge-inference-als-cloud-alternative.md]] — AMD Strix Halo (128 GB unified), x86-Alternative - [[neuromorphic-chips-und-quantencomputer.md]] — Hardware-Frontier-Perspektive (Prof. Mainzer) - [[../../architecture/model-routing.md]] — Model-Routing (lokale Modelle in OpenClaw) - [[../llm/llm-model-catalog.md]] — Modell-Katalog (welche Modelle lokal laufen)