# Lokale KI zum Coding — Kostenfrage & Hardware-Vorteile
> **TL;DR:** Lokale KI-Modelle für Coding versprechen „Coding zum Nulltarif" — keine laufenden API-Kosten. Die Realität: Die Modellnutzung ist kostenlos, aber die **Hardware** (RAM, GPU) ist der eigentliche Kostenfaktor. Schnellere lokale Hardware macht lokale Coding-Agents praktikabel. Kontext: David Tielkes Video „Lokale KI: Coding zum Nulltarif?" (August 2026).
**Geteilt von:** René Kl. in der OME-Gruppe als „Sendung mit der Maus"-Moment für erwachsene KI-Verstehenwoller — ein nüchterner Erklärgang, der gut zeigt, was im Detail abläuft.
**Lokale KI zum Coding** bedeutet: KI-Modelle für Softwareentwicklung laufen auf eigener Hardware (Laptop, Desktop, NAS, Workstation) statt über Cloud-APIs. Die zentrale Frage des Videos ist die **Kostenfrage** — ist lokales Coding wirklich „zum Nulltarif"?
### Die Kostenfrage: „Nulltarif" vs. Hardware-Kosten
| **Skalierung** | Unbegrenzt | Durch Hardware begrenzt |
**Kernaussage:** Der „Nulltarif" bezieht sich auf die **Modellnutzung** — keine laufenden API-Gebühren. Die tatsächlichen Kosten verschieben sich zur **Hardware**: Wer große Modelle lokal laufen lassen will, braucht ausreichend RAM und Rechenleistung. Das deckt sich mit der [[cloud-exit-and-local-superiority.md|Cloud-Exit-These]]: RAM wird zur neuen digitalen Währung.
### Vorteile schnellerer Hardware
Schnellere lokale Hardware (mehr RAM, bessere GPU) macht lokale Coding-Agents erst praktikabel:
- **Offline / DSGVO** → keine Datenverlagerung in die Cloud
- **Keine Rate-Limits** → unbegrenzte Iterationen ohne Kostenangst
### Bezug zu lokalen Agents
Ein Viewer-Kommentar wünscht sich mehr Details zum **Setup lokaler Agents** — also lokale KI-Agenten, die Coding-Aufgaben autonom ausführen. Das verbindet das Video mit der Agenten-Architektur-Diskussion: lokale Agents brauchen ein Harness ([[../../architecture/agent-orchestration.md|Agent Orchestration]]), ein Modell (lokal) und ausreichend Hardware.
- **Time to First Token (Prefill):** Wie schnell der eingehende Prompt durchgerechnet wird. Hängt von der Zahl der Shader-Kerne ab.
- **Tokens pro Sekunde:** Wie schnell das Modell antwortet. **Bottleneck ist die Speicherbandbreite** — pro Token muss das gesamte Modell + Kontextfenster durch den Speicherbus.
- **MoE-Modelle** (Mixture of Experts, z.B. Qwen 3 35B A3B, Qwen 3 Coder Next 80B): Nur ~8 von 256 Experten (≈3 Mrd. aktive Parameter) werden pro Token geladen. → Strix Halo (260 GB/s, aber 96 GB VRAM) schlägt die GPU, weil das große Modell dort überhaupt reinpasst.
### Spillover
Passt ein Modell nicht in den VRAM, fällt ein Teil in den langsameren RAM (80 GB/s) → Tokens brechen ein (im Test: 14 statt erwarteter Tokens/s).
### Fazit des Videos
- **Lokale KI ist im x86-Bereich quasi unbegrenzt möglich.**
- **Aber: Die lokalen Modelle sind der limitierende Faktor.** Qwen 3 Coder Next (80B) hält sich nicht an Vorgaben, braucht 40–50k Token Harness und ist trotzdem unzuverlässig. Für Office/Vibe-Coding super, für professionelles agentisches Coding noch nicht.
- Tielke hält die oft gepriesenen 35B-Modelle für „Schwachsinn" für ernsthafte Entwicklung.
- **These:** Steigende Tokenpreise wären gut für lokale KI, weil dann mehr in Open-Weight-Modelle investiert würde. (Nächste Video-Ankündigung: warum Tokenpreise nicht steigen.)
- AMD-Leihprogramm zum kostenlosen Testen.
> **Warum es zählt:** Nüchterner Gegenpol zum Hype — die Hardware kann's schon, die Modelle noch nicht.