knowledge-base/wiki/concepts/hardware/nvidia-dgx-station-748gb.md
Hector 0007c0cb50 ingest(hardware): nvidia dgx station gb300 — 748gb unified memory desktop
- raw: youtube/2026-06-28_nvidia-748gb-ram-desktop-local-ai.md (The Stack, 8:14)
- wiki: concepts/hardware/nvidia-dgx-station-748gb.md (NEW — 748 GB unified, full-precision 70B, ~$85K-$115K, ROI break-even ~2 months)
- index: 39. Update, new hardware row + raw source entry
- log: entry appended
2026-06-28 15:09:44 +02:00

131 lines
No EOL
7.2 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-06-28
updated: 2026-06-28
sources: [youtube/2026-06-28_nvidia-748gb-ram-desktop-local-ai.md]
tags: [concept, hardware, nvidia, dgx-station, gb300, grace-blackwell, unified-memory, local-ai, cloud-exit, lm-studio, ollama]
---
# NVIDIA DGX Station — 748 GB Unified Memory Desktop
> *"LM Studio and Ollama finally lose their asterisk."*
> — The Stack, YouTube, 2026-06-27
## Kernthese
NVIDIAs DGX Station (GB300 Grace Blackwell Ultra Desktop Superchip) bringt **748 GB kohärenter Unified Memory** in einen einzelnen Schreibtisch-Tower — genug, um ein 70B-Modell in voller Präzision (FP16/BF16) ohne Quantisierung zu laden. Das entfernt den letzten Haken von LM Studio und Ollama: die "läuft lokal, aber nur quantisiert"-Einschränkung. Die Maschine ist kein Konzept — sie wurde von Jensen Huang auf der GTC Taipei (31.05.2026) angekündigt, OEMs (ASUS, Dell, HP, MSI) listen sie bereits, und die Cloud-ROI-Mathematik rechtfertigt sie für anhaltende Workloads.
## Architektur: GB300 Grace Blackwell Ultra Desktop Superchip
Der GB300 ist ein **Superchip** — CPU und GPU auf einem Die, verbunden über NVLink-C2C:
| Komponente | Spec |
|------------|------|
| CPU | 72-core ARM Grace |
| GPU | Blackwell Ultra |
| Interconnect | NVLink-C2C @ 900 GB/s |
| GPU Memory | 252 GB HBM3e @ 7.1 TB/s |
| CPU Memory | 496 GB LPDDR5X |
| **Total Unified Memory** | **748 GB (ein Adressraum, kohärent)** |
| Compute | 20 petaFLOPS FP4 |
**Das entscheidende Architektur-Merkmal:** HBM3e und LPDDR5X sind **fully coherent** — ein Adressraum, zero explicit copies. Die GPU kann direkt auf CPU-Memory zugreifen und umgekehrt. Das eliminiert den PCIe-Bottleneck, der bei diskreten GPU-Setups den Datentransfer dominiert.
> Siehe auch: [[edge-inference-als-cloud-alternative.md]] — AMDs Strix Halo bringt das Unified-Memory-Prinzip in die x86-Welt (128 GB). Der GB300 skaliert dasselbe Prinzip um das 5,8-fache.
## Was 748 GB bedeuten
| Modell-Größe | FP16 VRAM-Bedarf | Passt in 748 GB? | Quantisierung nötig? |
|-------------|-----------------|-------------------|----------------------|
| 8B | ~16 GB | ✅ (massiv Spielraum) | Nein |
| 34B | ~68 GB | ✅ | Nein |
| 70B | ~140 GB | ✅ (5× Platz) | Nein |
| 405B | ~810 GB | ❌ | Ja (4-bit → ~200 GB) |
| 1T (Trillion) | ~2 TB | ❌ | Ja (4-bit → ~500 GB, knapp) |
**Die Trillion-Parameter-Realität:** NVIDIAs Claim, die DGX Station könne Trillionen-Parameter-Modelle laden, ist technisch wahr — aber **nur mit aggressiver 4-Bit-Quantisierung**. In voller Präzision (FP16/BF16) ist bei ~70B100B die Grenze erreicht. Das ist kein Betrug, aber ein Asterisk, den der Video-Titel nicht zeigt.
## Preis und Positionierung
| Produkt | Memory | Preis | Zielgruppe |
|---------|--------|-------|------------|
| **DGX Spark** | 128 GB | ~$4.700 | Prosumer-Einstieg |
| **DGX Station** | 748 GB | ~$85K$115K | Kleine Teams, sustained Workloads |
| **Mac Studio M5 Ultra** | (variiert) | — | Solo-Entwickler, Mid-Size-Modelle (Value Crown) |
- **MSI XpertStation WS300:** $96.995,99 (CDW-Listing)
- NVIDIA verkauft keine Founders Edition — OEMs übernehmen Vertrieb
### Cloud-ROI-Mathematik
| Kostenart | Wert |
|-----------|------|
| AWS p5 (vergleichbar) | ~$98/Stunde |
| DGX Station (Einmal) | ~$98.000 |
| Break-even | ~1.000 Stunden (~2 Monate sustained) |
| Danach | Nur Strom + Wartung |
**Einschätzung:** Für Teams, die 24/7-Inferenz betreiben, ist die DGX Station nach ~2 Monaten günstiger als Cloud. Für sporadische Nutzung bleibt Cloud überlegen. Die Mathematik funktioniert nur bei **anhaltender** Auslastung.
## DGX Station for Windows — Q4 2026
NVIDIA kündigt eine WSL-basierte Variante für Windows an. Status: **Versprechen, nicht lieferbar** (Q4 2026). Die aktuelle DGX Station läuft auf Linux.
## NVIDIA Roadmap: Drei Generationen
| Generation | Status |
|------------|--------|
| Grace Blackwell (GB300) | Lieferbar (Computex 2026) |
| Rubin | Geplant |
| Rosa Feynman | Geplant |
Zusätzlich: **RTX Spark** — NVIDIAs MediaTek-Partner-Consumer-AI-PC-Chip. NVIDIA zielt auf den gesamten PC-Markt ab, nicht nur Workstations.
## Einordnung: Wo steht die DGX Station im Cloud-Exit-Kontext?
Die DGX Station ist das **Spitzenmodell** der lokalen KI-Hardware-Ladder:
```
DGX Spark (128 GB, $4.7K) → DGX Station (748 GB, ~$98K) → DGX Datacenter (rack-scale)
↑ ↑ ↑
Prosumer / Einzelbau Kleine Teams / 24-7-Workloads Cloud-Scale
```
### Vergleich mit bestehenden Wiki-Hardware-Seiten
| Plattform | Unified Memory | Preis | Vorteil | Quelle |
|-----------|---------------|-------|---------|--------|
| AMD Ryzen AI Max+ 395 (Strix Halo) | 128 GB | $1.499 | x86 Edge, lunchbox-Format | [[edge-inference-als-cloud-alternative.md]] |
| Mac Studio M5 Ultra | (variiert) | — | Value Crown für Solo-Dev | Video-Comparison |
| **NVIDIA DGX Station (GB300)** | **748 GB** | **~$85K$115K** | **Full-precision 70B, sustained ROI** | Diese Seite |
| NVIDIA DGX Spark | 128 GB | ~$4.700 | Prosumer-Einstieg | Diese Seite |
### Verbindung zum Cloud-Exit-Pattern
Die DGX Station bestätigt die [[cloud-exit-and-local-superiority.md]]-These von einer neuen Seite: Nicht nur werden Cloud-Server teurer (Hetzner/HP-Preisschock), sondern lokale Hardware wird **kapazitativ** — 748 GB Unified Memory waren bisher Server-Rack-Territorium. Die "RAM als neue digitale Währung"-These aus dem OME21-Briefing bekommt hier ihre radikalste Bestätigung.
Cross-Ref zu [[cloud-exit-and-local-superiority.md]] § "RAM als Währung": Dort war die These, dass Arbeitsspeicher zum Engpass und damit zur wertvollsten Resource wird. 748 GB in einer Desktop-Box ist die konsequente Antwort.
### LM Studio und Ollama: Der Asterisk verschwindet
Bisher: Lokale LLM-Inferenz = "ja, aber nur quantisiert" (GGUF Q4/Q8). Die DGX Station entfernt diesen Asterisk:
- **70B in FP16/BF16:** ~140 GB → passt in 748 GB mit 5× Reserve
- **Keine Quantisierungs-Artifakte:** Full-precision-Inferenz ohne Quality-Loss
- **LM Studio + Ollama:** Beide Tools werden auf der DGX Station unterstützt
Das ist ein Paradigmenwechsel für die lokale KI-Community: die Frage verschiebt sich von "passt das Modell in den VRAM?" zu "ist die Hardware wirtschaftlich gerechtfertigt?".
## Quellen
- **YouTube-Video:** [NVIDIA'S 748GB Ram Desktop Makes Local AI INSANELY Good](https://www.youtube.com/watch?v=EhXQysElOY8) — The Stack, 2026-06-27, 8:14
- **NVIDIA DGX Station:** [nvidia.com](https://www.nvidia.com/en-us/products/workstations/dgx-station/)
- **NVIDIA DGX Spark:** [nvidia.com](https://www.nvidia.com/en-us/products/workstations/dgx-spark/)
- **LM Studio:** [lmstudio.ai](https://lmstudio.ai)
- **Ollama:** [ollama.com](https://ollama.com)
## Cross-Refs
- [[cloud-exit-and-local-superiority.md]] — Cloud-Exit-These, Preisschock, lokale Performance-Parität
- [[edge-inference-als-cloud-alternative.md]] — AMD Strix Halo (128 GB unified), x86-Alternative
- [[neuromorphic-chips-und-quantencomputer.md]] — Hardware-Frontier-Perspektive (Prof. Mainzer)
- [[../../architecture/model-routing.md]] — Model-Routing (lokale Modelle in OpenClaw)
- [[../llm/llm-model-catalog.md]] — Modell-Katalog (welche Modelle lokal laufen)