knowledge-base/wiki/concepts/hardware/nvidia-dgx-station-748gb.md
Hector 0007c0cb50 ingest(hardware): nvidia dgx station gb300 — 748gb unified memory desktop
- raw: youtube/2026-06-28_nvidia-748gb-ram-desktop-local-ai.md (The Stack, 8:14)
- wiki: concepts/hardware/nvidia-dgx-station-748gb.md (NEW — 748 GB unified, full-precision 70B, ~$85K-$115K, ROI break-even ~2 months)
- index: 39. Update, new hardware row + raw source entry
- log: entry appended
2026-06-28 15:09:44 +02:00

7.2 KiB
Raw Permalink Blame History

created updated sources tags
2026-06-28 2026-06-28
youtube/2026-06-28_nvidia-748gb-ram-desktop-local-ai.md
concept
hardware
nvidia
dgx-station
gb300
grace-blackwell
unified-memory
local-ai
cloud-exit
lm-studio
ollama

NVIDIA DGX Station — 748 GB Unified Memory Desktop

"LM Studio and Ollama finally lose their asterisk." — The Stack, YouTube, 2026-06-27

Kernthese

NVIDIAs DGX Station (GB300 Grace Blackwell Ultra Desktop Superchip) bringt 748 GB kohärenter Unified Memory in einen einzelnen Schreibtisch-Tower — genug, um ein 70B-Modell in voller Präzision (FP16/BF16) ohne Quantisierung zu laden. Das entfernt den letzten Haken von LM Studio und Ollama: die "läuft lokal, aber nur quantisiert"-Einschränkung. Die Maschine ist kein Konzept — sie wurde von Jensen Huang auf der GTC Taipei (31.05.2026) angekündigt, OEMs (ASUS, Dell, HP, MSI) listen sie bereits, und die Cloud-ROI-Mathematik rechtfertigt sie für anhaltende Workloads.

Architektur: GB300 Grace Blackwell Ultra Desktop Superchip

Der GB300 ist ein Superchip — CPU und GPU auf einem Die, verbunden über NVLink-C2C:

Komponente Spec
CPU 72-core ARM Grace
GPU Blackwell Ultra
Interconnect NVLink-C2C @ 900 GB/s
GPU Memory 252 GB HBM3e @ 7.1 TB/s
CPU Memory 496 GB LPDDR5X
Total Unified Memory 748 GB (ein Adressraum, kohärent)
Compute 20 petaFLOPS FP4

Das entscheidende Architektur-Merkmal: HBM3e und LPDDR5X sind fully coherent — ein Adressraum, zero explicit copies. Die GPU kann direkt auf CPU-Memory zugreifen und umgekehrt. Das eliminiert den PCIe-Bottleneck, der bei diskreten GPU-Setups den Datentransfer dominiert.

Siehe auch: edge-inference-als-cloud-alternative.md — AMDs Strix Halo bringt das Unified-Memory-Prinzip in die x86-Welt (128 GB). Der GB300 skaliert dasselbe Prinzip um das 5,8-fache.

Was 748 GB bedeuten

Modell-Größe FP16 VRAM-Bedarf Passt in 748 GB? Quantisierung nötig?
8B ~16 GB (massiv Spielraum) Nein
34B ~68 GB Nein
70B ~140 GB (5× Platz) Nein
405B ~810 GB Ja (4-bit → ~200 GB)
1T (Trillion) ~2 TB Ja (4-bit → ~500 GB, knapp)

Die Trillion-Parameter-Realität: NVIDIAs Claim, die DGX Station könne Trillionen-Parameter-Modelle laden, ist technisch wahr — aber nur mit aggressiver 4-Bit-Quantisierung. In voller Präzision (FP16/BF16) ist bei ~70B100B die Grenze erreicht. Das ist kein Betrug, aber ein Asterisk, den der Video-Titel nicht zeigt.

Preis und Positionierung

Produkt Memory Preis Zielgruppe
DGX Spark 128 GB ~$4.700 Prosumer-Einstieg
DGX Station 748 GB ~$85K$115K Kleine Teams, sustained Workloads
Mac Studio M5 Ultra (variiert) Solo-Entwickler, Mid-Size-Modelle (Value Crown)
  • MSI XpertStation WS300: $96.995,99 (CDW-Listing)
  • NVIDIA verkauft keine Founders Edition — OEMs übernehmen Vertrieb

Cloud-ROI-Mathematik

Kostenart Wert
AWS p5 (vergleichbar) ~$98/Stunde
DGX Station (Einmal) ~$98.000
Break-even ~1.000 Stunden (~2 Monate sustained)
Danach Nur Strom + Wartung

Einschätzung: Für Teams, die 24/7-Inferenz betreiben, ist die DGX Station nach ~2 Monaten günstiger als Cloud. Für sporadische Nutzung bleibt Cloud überlegen. Die Mathematik funktioniert nur bei anhaltender Auslastung.

DGX Station for Windows — Q4 2026

NVIDIA kündigt eine WSL-basierte Variante für Windows an. Status: Versprechen, nicht lieferbar (Q4 2026). Die aktuelle DGX Station läuft auf Linux.

NVIDIA Roadmap: Drei Generationen

Generation Status
Grace Blackwell (GB300) Lieferbar (Computex 2026)
Rubin Geplant
Rosa Feynman Geplant

Zusätzlich: RTX Spark — NVIDIAs MediaTek-Partner-Consumer-AI-PC-Chip. NVIDIA zielt auf den gesamten PC-Markt ab, nicht nur Workstations.

Einordnung: Wo steht die DGX Station im Cloud-Exit-Kontext?

Die DGX Station ist das Spitzenmodell der lokalen KI-Hardware-Ladder:

DGX Spark (128 GB, $4.7K)  →  DGX Station (748 GB, ~$98K)  →  DGX Datacenter (rack-scale)
        ↑                              ↑                              ↑
   Prosumer / Einzelbau            Kleine Teams / 24-7-Workloads      Cloud-Scale

Vergleich mit bestehenden Wiki-Hardware-Seiten

Plattform Unified Memory Preis Vorteil Quelle
AMD Ryzen AI Max+ 395 (Strix Halo) 128 GB $1.499 x86 Edge, lunchbox-Format edge-inference-als-cloud-alternative.md
Mac Studio M5 Ultra (variiert) Value Crown für Solo-Dev Video-Comparison
NVIDIA DGX Station (GB300) 748 GB ~$85K$115K Full-precision 70B, sustained ROI Diese Seite
NVIDIA DGX Spark 128 GB ~$4.700 Prosumer-Einstieg Diese Seite

Verbindung zum Cloud-Exit-Pattern

Die DGX Station bestätigt die cloud-exit-and-local-superiority.md-These von einer neuen Seite: Nicht nur werden Cloud-Server teurer (Hetzner/HP-Preisschock), sondern lokale Hardware wird kapazitativ — 748 GB Unified Memory waren bisher Server-Rack-Territorium. Die "RAM als neue digitale Währung"-These aus dem OME21-Briefing bekommt hier ihre radikalste Bestätigung.

Cross-Ref zu cloud-exit-and-local-superiority.md § "RAM als Währung": Dort war die These, dass Arbeitsspeicher zum Engpass und damit zur wertvollsten Resource wird. 748 GB in einer Desktop-Box ist die konsequente Antwort.

LM Studio und Ollama: Der Asterisk verschwindet

Bisher: Lokale LLM-Inferenz = "ja, aber nur quantisiert" (GGUF Q4/Q8). Die DGX Station entfernt diesen Asterisk:

  • 70B in FP16/BF16: ~140 GB → passt in 748 GB mit 5× Reserve
  • Keine Quantisierungs-Artifakte: Full-precision-Inferenz ohne Quality-Loss
  • LM Studio + Ollama: Beide Tools werden auf der DGX Station unterstützt

Das ist ein Paradigmenwechsel für die lokale KI-Community: die Frage verschiebt sich von "passt das Modell in den VRAM?" zu "ist die Hardware wirtschaftlich gerechtfertigt?".

Quellen

Cross-Refs