- raw: youtube/2026-06-28_nvidia-748gb-ram-desktop-local-ai.md (The Stack, 8:14) - wiki: concepts/hardware/nvidia-dgx-station-748gb.md (NEW — 748 GB unified, full-precision 70B, ~$85K-$115K, ROI break-even ~2 months) - index: 39. Update, new hardware row + raw source entry - log: entry appended
131 lines
No EOL
7.2 KiB
Markdown
131 lines
No EOL
7.2 KiB
Markdown
---
|
||
created: 2026-06-28
|
||
updated: 2026-06-28
|
||
sources: [youtube/2026-06-28_nvidia-748gb-ram-desktop-local-ai.md]
|
||
tags: [concept, hardware, nvidia, dgx-station, gb300, grace-blackwell, unified-memory, local-ai, cloud-exit, lm-studio, ollama]
|
||
---
|
||
|
||
# NVIDIA DGX Station — 748 GB Unified Memory Desktop
|
||
|
||
> *"LM Studio and Ollama finally lose their asterisk."*
|
||
> — The Stack, YouTube, 2026-06-27
|
||
|
||
## Kernthese
|
||
|
||
NVIDIAs DGX Station (GB300 Grace Blackwell Ultra Desktop Superchip) bringt **748 GB kohärenter Unified Memory** in einen einzelnen Schreibtisch-Tower — genug, um ein 70B-Modell in voller Präzision (FP16/BF16) ohne Quantisierung zu laden. Das entfernt den letzten Haken von LM Studio und Ollama: die "läuft lokal, aber nur quantisiert"-Einschränkung. Die Maschine ist kein Konzept — sie wurde von Jensen Huang auf der GTC Taipei (31.05.2026) angekündigt, OEMs (ASUS, Dell, HP, MSI) listen sie bereits, und die Cloud-ROI-Mathematik rechtfertigt sie für anhaltende Workloads.
|
||
|
||
## Architektur: GB300 Grace Blackwell Ultra Desktop Superchip
|
||
|
||
Der GB300 ist ein **Superchip** — CPU und GPU auf einem Die, verbunden über NVLink-C2C:
|
||
|
||
| Komponente | Spec |
|
||
|------------|------|
|
||
| CPU | 72-core ARM Grace |
|
||
| GPU | Blackwell Ultra |
|
||
| Interconnect | NVLink-C2C @ 900 GB/s |
|
||
| GPU Memory | 252 GB HBM3e @ 7.1 TB/s |
|
||
| CPU Memory | 496 GB LPDDR5X |
|
||
| **Total Unified Memory** | **748 GB (ein Adressraum, kohärent)** |
|
||
| Compute | 20 petaFLOPS FP4 |
|
||
|
||
**Das entscheidende Architektur-Merkmal:** HBM3e und LPDDR5X sind **fully coherent** — ein Adressraum, zero explicit copies. Die GPU kann direkt auf CPU-Memory zugreifen und umgekehrt. Das eliminiert den PCIe-Bottleneck, der bei diskreten GPU-Setups den Datentransfer dominiert.
|
||
|
||
> Siehe auch: [[edge-inference-als-cloud-alternative.md]] — AMDs Strix Halo bringt das Unified-Memory-Prinzip in die x86-Welt (128 GB). Der GB300 skaliert dasselbe Prinzip um das 5,8-fache.
|
||
|
||
## Was 748 GB bedeuten
|
||
|
||
| Modell-Größe | FP16 VRAM-Bedarf | Passt in 748 GB? | Quantisierung nötig? |
|
||
|-------------|-----------------|-------------------|----------------------|
|
||
| 8B | ~16 GB | ✅ (massiv Spielraum) | Nein |
|
||
| 34B | ~68 GB | ✅ | Nein |
|
||
| 70B | ~140 GB | ✅ (5× Platz) | Nein |
|
||
| 405B | ~810 GB | ❌ | Ja (4-bit → ~200 GB) |
|
||
| 1T (Trillion) | ~2 TB | ❌ | Ja (4-bit → ~500 GB, knapp) |
|
||
|
||
**Die Trillion-Parameter-Realität:** NVIDIAs Claim, die DGX Station könne Trillionen-Parameter-Modelle laden, ist technisch wahr — aber **nur mit aggressiver 4-Bit-Quantisierung**. In voller Präzision (FP16/BF16) ist bei ~70B–100B die Grenze erreicht. Das ist kein Betrug, aber ein Asterisk, den der Video-Titel nicht zeigt.
|
||
|
||
## Preis und Positionierung
|
||
|
||
| Produkt | Memory | Preis | Zielgruppe |
|
||
|---------|--------|-------|------------|
|
||
| **DGX Spark** | 128 GB | ~$4.700 | Prosumer-Einstieg |
|
||
| **DGX Station** | 748 GB | ~$85K–$115K | Kleine Teams, sustained Workloads |
|
||
| **Mac Studio M5 Ultra** | (variiert) | — | Solo-Entwickler, Mid-Size-Modelle (Value Crown) |
|
||
|
||
- **MSI XpertStation WS300:** $96.995,99 (CDW-Listing)
|
||
- NVIDIA verkauft keine Founders Edition — OEMs übernehmen Vertrieb
|
||
|
||
### Cloud-ROI-Mathematik
|
||
|
||
| Kostenart | Wert |
|
||
|-----------|------|
|
||
| AWS p5 (vergleichbar) | ~$98/Stunde |
|
||
| DGX Station (Einmal) | ~$98.000 |
|
||
| Break-even | ~1.000 Stunden (~2 Monate sustained) |
|
||
| Danach | Nur Strom + Wartung |
|
||
|
||
**Einschätzung:** Für Teams, die 24/7-Inferenz betreiben, ist die DGX Station nach ~2 Monaten günstiger als Cloud. Für sporadische Nutzung bleibt Cloud überlegen. Die Mathematik funktioniert nur bei **anhaltender** Auslastung.
|
||
|
||
## DGX Station for Windows — Q4 2026
|
||
|
||
NVIDIA kündigt eine WSL-basierte Variante für Windows an. Status: **Versprechen, nicht lieferbar** (Q4 2026). Die aktuelle DGX Station läuft auf Linux.
|
||
|
||
## NVIDIA Roadmap: Drei Generationen
|
||
|
||
| Generation | Status |
|
||
|------------|--------|
|
||
| Grace Blackwell (GB300) | Lieferbar (Computex 2026) |
|
||
| Rubin | Geplant |
|
||
| Rosa Feynman | Geplant |
|
||
|
||
Zusätzlich: **RTX Spark** — NVIDIAs MediaTek-Partner-Consumer-AI-PC-Chip. NVIDIA zielt auf den gesamten PC-Markt ab, nicht nur Workstations.
|
||
|
||
## Einordnung: Wo steht die DGX Station im Cloud-Exit-Kontext?
|
||
|
||
Die DGX Station ist das **Spitzenmodell** der lokalen KI-Hardware-Ladder:
|
||
|
||
```
|
||
DGX Spark (128 GB, $4.7K) → DGX Station (748 GB, ~$98K) → DGX Datacenter (rack-scale)
|
||
↑ ↑ ↑
|
||
Prosumer / Einzelbau Kleine Teams / 24-7-Workloads Cloud-Scale
|
||
```
|
||
|
||
### Vergleich mit bestehenden Wiki-Hardware-Seiten
|
||
|
||
| Plattform | Unified Memory | Preis | Vorteil | Quelle |
|
||
|-----------|---------------|-------|---------|--------|
|
||
| AMD Ryzen AI Max+ 395 (Strix Halo) | 128 GB | $1.499 | x86 Edge, lunchbox-Format | [[edge-inference-als-cloud-alternative.md]] |
|
||
| Mac Studio M5 Ultra | (variiert) | — | Value Crown für Solo-Dev | Video-Comparison |
|
||
| **NVIDIA DGX Station (GB300)** | **748 GB** | **~$85K–$115K** | **Full-precision 70B, sustained ROI** | Diese Seite |
|
||
| NVIDIA DGX Spark | 128 GB | ~$4.700 | Prosumer-Einstieg | Diese Seite |
|
||
|
||
### Verbindung zum Cloud-Exit-Pattern
|
||
|
||
Die DGX Station bestätigt die [[cloud-exit-and-local-superiority.md]]-These von einer neuen Seite: Nicht nur werden Cloud-Server teurer (Hetzner/HP-Preisschock), sondern lokale Hardware wird **kapazitativ** — 748 GB Unified Memory waren bisher Server-Rack-Territorium. Die "RAM als neue digitale Währung"-These aus dem OME21-Briefing bekommt hier ihre radikalste Bestätigung.
|
||
|
||
Cross-Ref zu [[cloud-exit-and-local-superiority.md]] § "RAM als Währung": Dort war die These, dass Arbeitsspeicher zum Engpass und damit zur wertvollsten Resource wird. 748 GB in einer Desktop-Box ist die konsequente Antwort.
|
||
|
||
### LM Studio und Ollama: Der Asterisk verschwindet
|
||
|
||
Bisher: Lokale LLM-Inferenz = "ja, aber nur quantisiert" (GGUF Q4/Q8). Die DGX Station entfernt diesen Asterisk:
|
||
- **70B in FP16/BF16:** ~140 GB → passt in 748 GB mit 5× Reserve
|
||
- **Keine Quantisierungs-Artifakte:** Full-precision-Inferenz ohne Quality-Loss
|
||
- **LM Studio + Ollama:** Beide Tools werden auf der DGX Station unterstützt
|
||
|
||
Das ist ein Paradigmenwechsel für die lokale KI-Community: die Frage verschiebt sich von "passt das Modell in den VRAM?" zu "ist die Hardware wirtschaftlich gerechtfertigt?".
|
||
|
||
## Quellen
|
||
|
||
- **YouTube-Video:** [NVIDIA'S 748GB Ram Desktop Makes Local AI INSANELY Good](https://www.youtube.com/watch?v=EhXQysElOY8) — The Stack, 2026-06-27, 8:14
|
||
- **NVIDIA DGX Station:** [nvidia.com](https://www.nvidia.com/en-us/products/workstations/dgx-station/)
|
||
- **NVIDIA DGX Spark:** [nvidia.com](https://www.nvidia.com/en-us/products/workstations/dgx-spark/)
|
||
- **LM Studio:** [lmstudio.ai](https://lmstudio.ai)
|
||
- **Ollama:** [ollama.com](https://ollama.com)
|
||
|
||
## Cross-Refs
|
||
|
||
- [[cloud-exit-and-local-superiority.md]] — Cloud-Exit-These, Preisschock, lokale Performance-Parität
|
||
- [[edge-inference-als-cloud-alternative.md]] — AMD Strix Halo (128 GB unified), x86-Alternative
|
||
- [[neuromorphic-chips-und-quantencomputer.md]] — Hardware-Frontier-Perspektive (Prof. Mainzer)
|
||
- [[../../architecture/model-routing.md]] — Model-Routing (lokale Modelle in OpenClaw)
|
||
- [[../llm/llm-model-catalog.md]] — Modell-Katalog (welche Modelle lokal laufen) |