7.8 KiB
| created | updated | sources | tags | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-08-10 | 2026-08-10 |
|
|
Lokale KI zum Coding — Kostenfrage & Hardware-Vorteile
TL;DR: Lokale KI-Modelle für Coding versprechen „Coding zum Nulltarif" — keine laufenden API-Kosten. Die Realität: Die Modellnutzung ist kostenlos, aber die Hardware (RAM, GPU) ist der eigentliche Kostenfaktor. Schnellere lokale Hardware macht lokale Coding-Agents praktikabel. Kontext: David Tielkes Video „Lokale KI: Coding zum Nulltarif?" (August 2026).
Quelle
| Quelle | Kanal | Datum | Engagement |
|---|---|---|---|
| Video: „Lokale KI: Coding zum Nulltarif?" | David Tielke | ~2026-08-09/10 | ~8.6K Views, 417 Likes |
Geteilt von: René Kl. in der OME-Gruppe als „Sendung mit der Maus"-Moment für erwachsene KI-Verstehenwoller — ein nüchterner Erklärgang, der gut zeigt, was im Detail abläuft.
Video-Details: 32 Min, gesponsert von AMD. Inhalt basiert auf dem Transcript (via Gruppen-Zusammenfassung).
Das Konzept
Lokale KI zum Coding bedeutet: KI-Modelle für Softwareentwicklung laufen auf eigener Hardware (Laptop, Desktop, NAS, Workstation) statt über Cloud-APIs. Die zentrale Frage des Videos ist die Kostenfrage — ist lokales Coding wirklich „zum Nulltarif"?
Die Kostenfrage: „Nulltarif" vs. Hardware-Kosten
| Kostenart | Cloud-API | Lokale KI |
|---|---|---|
| Laufende Modellkosten | Pro-Token / Abo | €0 (einmalig geladen) |
| Hardware-Anschaffung | Keine | Der eigentliche Kostenfaktor (RAM, GPU) |
| Strom / Betrieb | Inklusive | Gering, aber vorhanden |
| Skalierung | Unbegrenzt | Durch Hardware begrenzt |
Kernaussage: Der „Nulltarif" bezieht sich auf die Modellnutzung — keine laufenden API-Gebühren. Die tatsächlichen Kosten verschieben sich zur Hardware: Wer große Modelle lokal laufen lassen will, braucht ausreichend RAM und Rechenleistung. Das deckt sich mit der cloud-exit-and-local-superiority.md: RAM wird zur neuen digitalen Währung.
Vorteile schnellerer Hardware
Schnellere lokale Hardware (mehr RAM, bessere GPU) macht lokale Coding-Agents erst praktikabel:
- Höhere Tokens/s → flüssigere Agent-Schleifen (Plan → Code → Test → Refine)
- Größere Modelle → bessere Code-Qualität (z.B. Qwen3.6-27B statt kleinerer Modelle)
- Offline / DSGVO → keine Datenverlagerung in die Cloud
- Keine Rate-Limits → unbegrenzte Iterationen ohne Kostenangst
Bezug zu lokalen Agents
Ein Viewer-Kommentar wünscht sich mehr Details zum Setup lokaler Agents — also lokale KI-Agenten, die Coding-Aufgaben autonom ausführen. Das verbindet das Video mit der Agenten-Architektur-Diskussion: lokale Agents brauchen ein Harness (../../architecture/agent-orchestration.md), ein Modell (lokal) und ausreichend Hardware.
Technische Details aus dem Transcript
Tielke vergleicht zwei Hardware-Setups für lokale KI:
| Setup | Hardware | Speicher | Bandbreite |
|---|---|---|---|
| AMD Strix Halo (HP Zbook) | iGPU | 128 GB Unified Memory | ~260 GB/s |
| Desktop-PC | Dedizierte High-End-GPU | 16 GB VRAM | ~900 GB/s |
Zwei entscheidende Kennzahlen
- Time to First Token (Prefill): Wie schnell der eingehende Prompt durchgerechnet wird. Hängt von der Zahl der Shader-Kerne ab.
- Tokens pro Sekunde: Wie schnell das Modell antwortet. Bottleneck ist die Speicherbandbreite — pro Token muss das gesamte Modell + Kontextfenster durch den Speicherbus.
Der Kern-Trick: Dense vs. MoE
- Dense-Modelle (z.B. Gemma 4): Jeder Token lädt das gesamte Modell. → Dedizierte GPU (900 GB/s) gewinnt klar.
- MoE-Modelle (Mixture of Experts, z.B. Qwen 3 35B A3B, Qwen 3 Coder Next 80B): Nur ~8 von 256 Experten (≈3 Mrd. aktive Parameter) werden pro Token geladen. → Strix Halo (260 GB/s, aber 96 GB VRAM) schlägt die GPU, weil das große Modell dort überhaupt reinpasst.
Spillover
Passt ein Modell nicht in den VRAM, fällt ein Teil in den langsameren RAM (80 GB/s) → Tokens brechen ein (im Test: 14 statt erwarteter Tokens/s).
Fazit des Videos
- Lokale KI ist im x86-Bereich quasi unbegrenzt möglich.
- Aber: Die lokalen Modelle sind der limitierende Faktor. Qwen 3 Coder Next (80B) hält sich nicht an Vorgaben, braucht 40–50k Token Harness und ist trotzdem unzuverlässig. Für Office/Vibe-Coding super, für professionelles agentisches Coding noch nicht.
- Tielke hält die oft gepriesenen 35B-Modelle für „Schwachsinn" für ernsthafte Entwicklung.
- These: Steigende Tokenpreise wären gut für lokale KI, weil dann mehr in Open-Weight-Modelle investiert würde. (Nächste Video-Ankündigung: warum Tokenpreise nicht steigen.)
- AMD-Leihprogramm zum kostenlosen Testen.
Warum es zählt: Nüchterner Gegenpol zum Hype — die Hardware kann's schon, die Modelle noch nicht.
Verbindung zu bestehendem Wiki-Wissen
Hardware-Tier (Cloud-Exit erweitert)
| Hardware-Tier | Lokale Coding-Option | Quelle |
|---|---|---|
| Laptop (beliebig) | Qwen3.6-27B / Gemma 4 mit Unsloth-Quants via LM Studio/llama.cpp | ../llm/local-llm-laptop-guide.md |
| Mac (Apple Silicon) | MoE-Modelle (Minimax-M3.0, DeepSeek-v4-Flash) via MLX | ../llm/mlx-moe-local-ai-optimization.md |
| Prosumer-Desktop | AMD Strix Halo (128 GB) | edge-inference-als-cloud-alternative.md |
| Enterprise-Desktop | NVIDIA DGX Station (748 GB) | nvidia-dgx-station-748gb.md |
| NAS / Server | Hermes-Agent per SSH (Tielkes Experiment) | ../../people/david-tielke.md |
Kosten- & Qualitäts-Debatte
- ../llm/coding-benchmark-price-performance.md — 39× Kostenspanne zwischen Frontier- und Budget-Modellen; Qualitäts-Kurve ist logarithmisch
- ../llm/chinese-model-cost-routing.md — 87% Cost-Cut-Playbook (chinesische Modelle als lokale Gamechanger)
- ../llm/glm-5.2-zai-coding-model.md — GLM 5.2 als lokales Frontier-Coding-Modell
- ../llm/ai-intelligence-commoditization-thesis.md — Kommoditisierung der Intelligenz
Lokale Agents & Architektur
- ../../architecture/agent-orchestration.md — Orchestrator-Pattern für Agenten
- ../../architecture/model-routing.md — 5-Tier-Routing (lokale Modelle in Tier 0-1)
- ../../tools/hermes-desktop.md — Hermes-Agent als lokales Coding-Werkzeug (Tielkes Experiment)
Cross-References
- cloud-exit-and-local-superiority.md — Cloud-Exit-These (RAM als Währung, lokale Überlegenheit)
- ../llm/local-llm-laptop-guide.md — Beste lokale Modelle für Laptop-Hardware
- ../llm/mlx-moe-local-ai-optimization.md — MoE-Optimierung auf Apple Silicon
- edge-inference-als-cloud-alternative.md — AMD Strix Halo (x86-Edge-Inferenz)
- nvidia-dgx-station-748gb.md — NVIDIA DGX Station (Enterprise-Tier)
- ../llm/coding-benchmark-price-performance.md — Preis-Leistungs-Vergleich von Coding-Modellen
- ../llm/chinese-model-cost-routing.md — Kosten-Routing mit chinesischen Modellen
- ../llm/glm-5.2-zai-coding-model.md — GLM 5.2 als lokales Coding-Modell
- ../../people/david-tielke.md — David Tielke (Video-Autor, 45-Tage-Experiment)
- ../../architecture/agent-orchestration.md — Agent-Orchestrierung (lokale Agents)
- ../../architecture/model-routing.md — Modell-Routing-Architektur