- raw: youtube/2026-06-28_nvidia-748gb-ram-desktop-local-ai.md (The Stack, 8:14) - wiki: concepts/hardware/nvidia-dgx-station-748gb.md (NEW — 748 GB unified, full-precision 70B, ~$85K-$115K, ROI break-even ~2 months) - index: 39. Update, new hardware row + raw source entry - log: entry appended
7.2 KiB
| created | updated | sources | tags | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-06-28 | 2026-06-28 |
|
|
NVIDIA DGX Station — 748 GB Unified Memory Desktop
"LM Studio and Ollama finally lose their asterisk." — The Stack, YouTube, 2026-06-27
Kernthese
NVIDIAs DGX Station (GB300 Grace Blackwell Ultra Desktop Superchip) bringt 748 GB kohärenter Unified Memory in einen einzelnen Schreibtisch-Tower — genug, um ein 70B-Modell in voller Präzision (FP16/BF16) ohne Quantisierung zu laden. Das entfernt den letzten Haken von LM Studio und Ollama: die "läuft lokal, aber nur quantisiert"-Einschränkung. Die Maschine ist kein Konzept — sie wurde von Jensen Huang auf der GTC Taipei (31.05.2026) angekündigt, OEMs (ASUS, Dell, HP, MSI) listen sie bereits, und die Cloud-ROI-Mathematik rechtfertigt sie für anhaltende Workloads.
Architektur: GB300 Grace Blackwell Ultra Desktop Superchip
Der GB300 ist ein Superchip — CPU und GPU auf einem Die, verbunden über NVLink-C2C:
| Komponente | Spec |
|---|---|
| CPU | 72-core ARM Grace |
| GPU | Blackwell Ultra |
| Interconnect | NVLink-C2C @ 900 GB/s |
| GPU Memory | 252 GB HBM3e @ 7.1 TB/s |
| CPU Memory | 496 GB LPDDR5X |
| Total Unified Memory | 748 GB (ein Adressraum, kohärent) |
| Compute | 20 petaFLOPS FP4 |
Das entscheidende Architektur-Merkmal: HBM3e und LPDDR5X sind fully coherent — ein Adressraum, zero explicit copies. Die GPU kann direkt auf CPU-Memory zugreifen und umgekehrt. Das eliminiert den PCIe-Bottleneck, der bei diskreten GPU-Setups den Datentransfer dominiert.
Siehe auch: edge-inference-als-cloud-alternative.md — AMDs Strix Halo bringt das Unified-Memory-Prinzip in die x86-Welt (128 GB). Der GB300 skaliert dasselbe Prinzip um das 5,8-fache.
Was 748 GB bedeuten
| Modell-Größe | FP16 VRAM-Bedarf | Passt in 748 GB? | Quantisierung nötig? |
|---|---|---|---|
| 8B | ~16 GB | ✅ (massiv Spielraum) | Nein |
| 34B | ~68 GB | ✅ | Nein |
| 70B | ~140 GB | ✅ (5× Platz) | Nein |
| 405B | ~810 GB | ❌ | Ja (4-bit → ~200 GB) |
| 1T (Trillion) | ~2 TB | ❌ | Ja (4-bit → ~500 GB, knapp) |
Die Trillion-Parameter-Realität: NVIDIAs Claim, die DGX Station könne Trillionen-Parameter-Modelle laden, ist technisch wahr — aber nur mit aggressiver 4-Bit-Quantisierung. In voller Präzision (FP16/BF16) ist bei ~70B–100B die Grenze erreicht. Das ist kein Betrug, aber ein Asterisk, den der Video-Titel nicht zeigt.
Preis und Positionierung
| Produkt | Memory | Preis | Zielgruppe |
|---|---|---|---|
| DGX Spark | 128 GB | ~$4.700 | Prosumer-Einstieg |
| DGX Station | 748 GB | ~$85K–$115K | Kleine Teams, sustained Workloads |
| Mac Studio M5 Ultra | (variiert) | — | Solo-Entwickler, Mid-Size-Modelle (Value Crown) |
- MSI XpertStation WS300: $96.995,99 (CDW-Listing)
- NVIDIA verkauft keine Founders Edition — OEMs übernehmen Vertrieb
Cloud-ROI-Mathematik
| Kostenart | Wert |
|---|---|
| AWS p5 (vergleichbar) | ~$98/Stunde |
| DGX Station (Einmal) | ~$98.000 |
| Break-even | ~1.000 Stunden (~2 Monate sustained) |
| Danach | Nur Strom + Wartung |
Einschätzung: Für Teams, die 24/7-Inferenz betreiben, ist die DGX Station nach ~2 Monaten günstiger als Cloud. Für sporadische Nutzung bleibt Cloud überlegen. Die Mathematik funktioniert nur bei anhaltender Auslastung.
DGX Station for Windows — Q4 2026
NVIDIA kündigt eine WSL-basierte Variante für Windows an. Status: Versprechen, nicht lieferbar (Q4 2026). Die aktuelle DGX Station läuft auf Linux.
NVIDIA Roadmap: Drei Generationen
| Generation | Status |
|---|---|
| Grace Blackwell (GB300) | Lieferbar (Computex 2026) |
| Rubin | Geplant |
| Rosa Feynman | Geplant |
Zusätzlich: RTX Spark — NVIDIAs MediaTek-Partner-Consumer-AI-PC-Chip. NVIDIA zielt auf den gesamten PC-Markt ab, nicht nur Workstations.
Einordnung: Wo steht die DGX Station im Cloud-Exit-Kontext?
Die DGX Station ist das Spitzenmodell der lokalen KI-Hardware-Ladder:
DGX Spark (128 GB, $4.7K) → DGX Station (748 GB, ~$98K) → DGX Datacenter (rack-scale)
↑ ↑ ↑
Prosumer / Einzelbau Kleine Teams / 24-7-Workloads Cloud-Scale
Vergleich mit bestehenden Wiki-Hardware-Seiten
| Plattform | Unified Memory | Preis | Vorteil | Quelle |
|---|---|---|---|---|
| AMD Ryzen AI Max+ 395 (Strix Halo) | 128 GB | $1.499 | x86 Edge, lunchbox-Format | edge-inference-als-cloud-alternative.md |
| Mac Studio M5 Ultra | (variiert) | — | Value Crown für Solo-Dev | Video-Comparison |
| NVIDIA DGX Station (GB300) | 748 GB | ~$85K–$115K | Full-precision 70B, sustained ROI | Diese Seite |
| NVIDIA DGX Spark | 128 GB | ~$4.700 | Prosumer-Einstieg | Diese Seite |
Verbindung zum Cloud-Exit-Pattern
Die DGX Station bestätigt die cloud-exit-and-local-superiority.md-These von einer neuen Seite: Nicht nur werden Cloud-Server teurer (Hetzner/HP-Preisschock), sondern lokale Hardware wird kapazitativ — 748 GB Unified Memory waren bisher Server-Rack-Territorium. Die "RAM als neue digitale Währung"-These aus dem OME21-Briefing bekommt hier ihre radikalste Bestätigung.
Cross-Ref zu cloud-exit-and-local-superiority.md § "RAM als Währung": Dort war die These, dass Arbeitsspeicher zum Engpass und damit zur wertvollsten Resource wird. 748 GB in einer Desktop-Box ist die konsequente Antwort.
LM Studio und Ollama: Der Asterisk verschwindet
Bisher: Lokale LLM-Inferenz = "ja, aber nur quantisiert" (GGUF Q4/Q8). Die DGX Station entfernt diesen Asterisk:
- 70B in FP16/BF16: ~140 GB → passt in 748 GB mit 5× Reserve
- Keine Quantisierungs-Artifakte: Full-precision-Inferenz ohne Quality-Loss
- LM Studio + Ollama: Beide Tools werden auf der DGX Station unterstützt
Das ist ein Paradigmenwechsel für die lokale KI-Community: die Frage verschiebt sich von "passt das Modell in den VRAM?" zu "ist die Hardware wirtschaftlich gerechtfertigt?".
Quellen
- YouTube-Video: NVIDIA'S 748GB Ram Desktop Makes Local AI INSANELY Good — The Stack, 2026-06-27, 8:14
- NVIDIA DGX Station: nvidia.com
- NVIDIA DGX Spark: nvidia.com
- LM Studio: lmstudio.ai
- Ollama: ollama.com
Cross-Refs
- cloud-exit-and-local-superiority.md — Cloud-Exit-These, Preisschock, lokale Performance-Parität
- edge-inference-als-cloud-alternative.md — AMD Strix Halo (128 GB unified), x86-Alternative
- neuromorphic-chips-und-quantencomputer.md — Hardware-Frontier-Perspektive (Prof. Mainzer)
- ../../architecture/model-routing.md — Model-Routing (lokale Modelle in OpenClaw)
- ../llm/llm-model-catalog.md — Modell-Katalog (welche Modelle lokal laufen)