| created |
updated |
sources |
tags |
| 2026-06-19 |
2026-08-25 |
| other/2026-06-19_ome21-briefing-ki-fortschritte-lokale-modelle.md |
| other/2026-08-25_pit-souveraene-ki-bitchute.md |
|
| concept |
| cloud-exit |
| local-models |
| hardware |
| moe |
| ram-as-currency |
| cost-shift |
|
Cloud-Exit & Lokale Überlegenheit
"Rechenleistung verliert an Wertschöpfung; lokaler Arbeitsspeicher (RAM) wird zur neuen digitalen Währung."
— OME21-01 Debrief, Club 77.7
Kernthese
Die Ära der billigen Cloud-Miete endet. HP verdoppelt Hardware-Preise, Hetzner verdoppelt bis verdreifacht Cloud-Server-Kosten für US-Kunden. Gleichzeitig erreichen lokale MoE-Modelle auf Apple M-Series-Hardware Geschwindigkeiten auf Gemini-Flash-Niveau — komplett offline. Die Kombination aus Preisschock und lokaler Performance-Parität macht Cloud-Exit zur rationalen Strategie.
Drei Treiber
1. Preisschock (Angebotsseite)
- HP: verdoppelt Hardware-Preise
- Hetzner: verdoppelt bis verdreifacht Cloud-Server-Kosten für US-Kunden
- Freibier der günstigen Miet-Server versiegt
- Siehe: The Flat Curve Society — Kosten-Druck als Beschleuniger
2. Lokale Performance-Parität (Nachfrageseite)
Lokale MoE-Modelle erreichen inference-Geschwindigkeiten, die Cloud-Modelle nicht mehr überlegen machen:
| Modell |
Tokens/s |
Typ |
Hardware |
| NLS 2.5 |
150 |
Mixture of Experts (1,5 Mrd. Parameter pro Expert) |
MacBook Pro M-Series |
| Qwen 3.5 Vision |
80 |
Vision/OCR |
MacBook Pro M-Series |
Vergleichsmaßstab: Gemini 3.5 Flash Niveau — aber lokal und offline.
3. RAM als neue Währung
- Rechenleistung (FLOPS) verliert an Wertschöpfung
- Arbeitsspeicher (RAM) wird zum limitierenden Faktor — wer große Modelle lokal laufen lassen will, braucht RAM, nicht Cloud-Compute
- M4/M5 Mac Mini Pro mit 64GB RAM für ca. 2.000 EUR = langfristige KI-Autarkie ohne Folgekosten
- 48 GB RAM = kritische Untergrenze; 64-128 GB empfohlen
- SSD-Caching (KV Caching) als Ergänzung
Hardware-Empfehlung (Stand Juni 2026)
| Setup |
RAM |
Preis (~) |
Geeignet für |
| MacBook Pro M-Series |
48 GB |
~2.500 EUR |
Einsteiger, kleinere Modelle |
| Mac Mini Pro M4/M5 |
64 GB |
~2.000 EUR |
Autarkie-Setup, MoE-Modelle |
| Mac Studio M-Series |
128 GB |
~4.500 EUR |
Power-User, parallele Modelle |
Verbindung zu anderen Wiki-Seiten
- KI-Souveränität: Dezentralisierung statt Konzern-Kontrolle — politisch-normativer Überbau der lokalen Ausführung: Korporatismus vs. Souveränität, Privatsphäre, Zensur-Schutz, „KI wird so fundamental wie Elektrizität"
- Geopolitik der KI — Open-Source-Beschleunigung als Reaktion auf Exportkontrollen; DeepSeek V1 und GLM 5.2 beweisen Skalierung ohne Nvidia-Monopol
- GLM 5.2 — Chinese Frontier Coding Model als lokaler Gamechanger
- Hardware-Frontier: Neuromorphe Chips — Langfristige Hardware-Entwicklung jenseits klassischer Chips
- Model Routing — OpenClaw-Pipeline mit GLM-5.2 auf Ollama Cloud
- Edge-Inferenz als Cloud-Alternative — AMDs Ryzen AI Max+ 395 (Strix Halo): 235B lokal, 128 GB unified memory, $1.499 — die x86-Antwort auf die Mac-only-Bewegung
- Local-AI-Box & Chinas Vorstoß — Xiaomi O100 (1,22 TB/s) und Alibaba XuanTie C950 (27B ohne GPU): China greift die Box-Schicht an; DRAM-Knappheit macht ganze Boxes zur günstigen RAM-Quelle
- Intelligence Commoditization Thesis — RAM als Währung = physische Manifestation der Kommoditisierung
- Apple M6 & M5 Ultra — Unabhängig verifizierte Bandbreiten-/Prefill-Werte der M5 Ultra (1,2 TB/s) gegen RTX 5090; MacStories belegt die These praktisch: 99 Tage Agentenbetrieb, 0 $ Cloud-Kosten
- Lokale KI zum Coding — dieselbe Kostenlogik (Hardware statt Tokens) aus der Coding-Perspektive
- Datenhaltung & Cache-Seitenkanäle bei Cloud-Inferenz — die Gegenprobe zur Cloud-Miete: ZDR-Zusagen sind vertraglich, nicht technisch; wer lokal fährt, teilt keinen Cache mit Fremden
| Operator |
Anwendung |
Modell/Tool |
DSGVO |
| Rüdiger |
Zeugniserstellung (Schulwesen) |
Gemini 3.5 Flash lokal |
100% |
| Andreas |
E-Book-Vektorisierung (persönl. RAG) |
Server-Pipeline |
— |
| Christian |
SLA-Übersetzung (juristisch) |
Kimi lokal |
— |
Quellen