knowledge-base/wiki/concepts/hardware/nvidia-dgx-station-748gb.md

131 lines
7.2 KiB
Markdown
Raw Permalink Normal View History

---
created: 2026-06-28
updated: 2026-06-28
sources: [youtube/2026-06-28_nvidia-748gb-ram-desktop-local-ai.md]
tags: [concept, hardware, nvidia, dgx-station, gb300, grace-blackwell, unified-memory, local-ai, cloud-exit, lm-studio, ollama]
---
# NVIDIA DGX Station — 748 GB Unified Memory Desktop
> *"LM Studio and Ollama finally lose their asterisk."*
> — The Stack, YouTube, 2026-06-27
## Kernthese
NVIDIAs DGX Station (GB300 Grace Blackwell Ultra Desktop Superchip) bringt **748 GB kohärenter Unified Memory** in einen einzelnen Schreibtisch-Tower — genug, um ein 70B-Modell in voller Präzision (FP16/BF16) ohne Quantisierung zu laden. Das entfernt den letzten Haken von LM Studio und Ollama: die "läuft lokal, aber nur quantisiert"-Einschränkung. Die Maschine ist kein Konzept — sie wurde von Jensen Huang auf der GTC Taipei (31.05.2026) angekündigt, OEMs (ASUS, Dell, HP, MSI) listen sie bereits, und die Cloud-ROI-Mathematik rechtfertigt sie für anhaltende Workloads.
## Architektur: GB300 Grace Blackwell Ultra Desktop Superchip
Der GB300 ist ein **Superchip** — CPU und GPU auf einem Die, verbunden über NVLink-C2C:
| Komponente | Spec |
|------------|------|
| CPU | 72-core ARM Grace |
| GPU | Blackwell Ultra |
| Interconnect | NVLink-C2C @ 900 GB/s |
| GPU Memory | 252 GB HBM3e @ 7.1 TB/s |
| CPU Memory | 496 GB LPDDR5X |
| **Total Unified Memory** | **748 GB (ein Adressraum, kohärent)** |
| Compute | 20 petaFLOPS FP4 |
**Das entscheidende Architektur-Merkmal:** HBM3e und LPDDR5X sind **fully coherent** — ein Adressraum, zero explicit copies. Die GPU kann direkt auf CPU-Memory zugreifen und umgekehrt. Das eliminiert den PCIe-Bottleneck, der bei diskreten GPU-Setups den Datentransfer dominiert.
> Siehe auch: [[edge-inference-als-cloud-alternative.md]] — AMDs Strix Halo bringt das Unified-Memory-Prinzip in die x86-Welt (128 GB). Der GB300 skaliert dasselbe Prinzip um das 5,8-fache.
## Was 748 GB bedeuten
| Modell-Größe | FP16 VRAM-Bedarf | Passt in 748 GB? | Quantisierung nötig? |
|-------------|-----------------|-------------------|----------------------|
| 8B | ~16 GB | ✅ (massiv Spielraum) | Nein |
| 34B | ~68 GB | ✅ | Nein |
| 70B | ~140 GB | ✅ (5× Platz) | Nein |
| 405B | ~810 GB | ❌ | Ja (4-bit → ~200 GB) |
| 1T (Trillion) | ~2 TB | ❌ | Ja (4-bit → ~500 GB, knapp) |
**Die Trillion-Parameter-Realität:** NVIDIAs Claim, die DGX Station könne Trillionen-Parameter-Modelle laden, ist technisch wahr — aber **nur mit aggressiver 4-Bit-Quantisierung**. In voller Präzision (FP16/BF16) ist bei ~70B100B die Grenze erreicht. Das ist kein Betrug, aber ein Asterisk, den der Video-Titel nicht zeigt.
## Preis und Positionierung
| Produkt | Memory | Preis | Zielgruppe |
|---------|--------|-------|------------|
| **DGX Spark** | 128 GB | ~$4.700 | Prosumer-Einstieg |
| **DGX Station** | 748 GB | ~$85K$115K | Kleine Teams, sustained Workloads |
| **Mac Studio M5 Ultra** | (variiert) | — | Solo-Entwickler, Mid-Size-Modelle (Value Crown) |
- **MSI XpertStation WS300:** $96.995,99 (CDW-Listing)
- NVIDIA verkauft keine Founders Edition — OEMs übernehmen Vertrieb
### Cloud-ROI-Mathematik
| Kostenart | Wert |
|-----------|------|
| AWS p5 (vergleichbar) | ~$98/Stunde |
| DGX Station (Einmal) | ~$98.000 |
| Break-even | ~1.000 Stunden (~2 Monate sustained) |
| Danach | Nur Strom + Wartung |
**Einschätzung:** Für Teams, die 24/7-Inferenz betreiben, ist die DGX Station nach ~2 Monaten günstiger als Cloud. Für sporadische Nutzung bleibt Cloud überlegen. Die Mathematik funktioniert nur bei **anhaltender** Auslastung.
## DGX Station for Windows — Q4 2026
NVIDIA kündigt eine WSL-basierte Variante für Windows an. Status: **Versprechen, nicht lieferbar** (Q4 2026). Die aktuelle DGX Station läuft auf Linux.
## NVIDIA Roadmap: Drei Generationen
| Generation | Status |
|------------|--------|
| Grace Blackwell (GB300) | Lieferbar (Computex 2026) |
| Rubin | Geplant |
| Rosa Feynman | Geplant |
Zusätzlich: **RTX Spark** — NVIDIAs MediaTek-Partner-Consumer-AI-PC-Chip. NVIDIA zielt auf den gesamten PC-Markt ab, nicht nur Workstations.
## Einordnung: Wo steht die DGX Station im Cloud-Exit-Kontext?
Die DGX Station ist das **Spitzenmodell** der lokalen KI-Hardware-Ladder:
```
DGX Spark (128 GB, $4.7K) → DGX Station (748 GB, ~$98K) → DGX Datacenter (rack-scale)
↑ ↑ ↑
Prosumer / Einzelbau Kleine Teams / 24-7-Workloads Cloud-Scale
```
### Vergleich mit bestehenden Wiki-Hardware-Seiten
| Plattform | Unified Memory | Preis | Vorteil | Quelle |
|-----------|---------------|-------|---------|--------|
| AMD Ryzen AI Max+ 395 (Strix Halo) | 128 GB | $1.499 | x86 Edge, lunchbox-Format | [[edge-inference-als-cloud-alternative.md]] |
| Mac Studio M5 Ultra | (variiert) | — | Value Crown für Solo-Dev | Video-Comparison |
| **NVIDIA DGX Station (GB300)** | **748 GB** | **~$85K$115K** | **Full-precision 70B, sustained ROI** | Diese Seite |
| NVIDIA DGX Spark | 128 GB | ~$4.700 | Prosumer-Einstieg | Diese Seite |
### Verbindung zum Cloud-Exit-Pattern
Die DGX Station bestätigt die [[cloud-exit-and-local-superiority.md]]-These von einer neuen Seite: Nicht nur werden Cloud-Server teurer (Hetzner/HP-Preisschock), sondern lokale Hardware wird **kapazitativ** — 748 GB Unified Memory waren bisher Server-Rack-Territorium. Die "RAM als neue digitale Währung"-These aus dem OME21-Briefing bekommt hier ihre radikalste Bestätigung.
Cross-Ref zu [[cloud-exit-and-local-superiority.md]] § "RAM als Währung": Dort war die These, dass Arbeitsspeicher zum Engpass und damit zur wertvollsten Resource wird. 748 GB in einer Desktop-Box ist die konsequente Antwort.
### LM Studio und Ollama: Der Asterisk verschwindet
Bisher: Lokale LLM-Inferenz = "ja, aber nur quantisiert" (GGUF Q4/Q8). Die DGX Station entfernt diesen Asterisk:
- **70B in FP16/BF16:** ~140 GB → passt in 748 GB mit 5× Reserve
- **Keine Quantisierungs-Artifakte:** Full-precision-Inferenz ohne Quality-Loss
- **LM Studio + Ollama:** Beide Tools werden auf der DGX Station unterstützt
Das ist ein Paradigmenwechsel für die lokale KI-Community: die Frage verschiebt sich von "passt das Modell in den VRAM?" zu "ist die Hardware wirtschaftlich gerechtfertigt?".
## Quellen
- **YouTube-Video:** [NVIDIA'S 748GB Ram Desktop Makes Local AI INSANELY Good](https://www.youtube.com/watch?v=EhXQysElOY8) — The Stack, 2026-06-27, 8:14
- **NVIDIA DGX Station:** [nvidia.com](https://www.nvidia.com/en-us/products/workstations/dgx-station/)
- **NVIDIA DGX Spark:** [nvidia.com](https://www.nvidia.com/en-us/products/workstations/dgx-spark/)
- **LM Studio:** [lmstudio.ai](https://lmstudio.ai)
- **Ollama:** [ollama.com](https://ollama.com)
## Cross-Refs
- [[cloud-exit-and-local-superiority.md]] — Cloud-Exit-These, Preisschock, lokale Performance-Parität
- [[edge-inference-als-cloud-alternative.md]] — AMD Strix Halo (128 GB unified), x86-Alternative
- [[neuromorphic-chips-und-quantencomputer.md]] — Hardware-Frontier-Perspektive (Prof. Mainzer)
- [[../../architecture/model-routing.md]] — Model-Routing (lokale Modelle in OpenClaw)
- [[../llm/llm-model-catalog.md]] — Modell-Katalog (welche Modelle lokal laufen)