knowledge-base/wiki/concepts/hardware/lokale-ki-coding.md

7.9 KiB
Raw Permalink Blame History

created updated sources tags
2026-08-10 2026-08-10
youtube/2026-08-10_lokale-ki-coding-nulltarif.md
concept
lokale-ki
coding
kosten
hardware
local-ai
agents

Lokale KI zum Coding — Kostenfrage & Hardware-Vorteile

TL;DR: Lokale KI-Modelle für Coding versprechen „Coding zum Nulltarif" — keine laufenden API-Kosten. Die Realität: Die Modellnutzung ist kostenlos, aber die Hardware (RAM, GPU) ist der eigentliche Kostenfaktor. Schnellere lokale Hardware macht lokale Coding-Agents praktikabel. Kontext: David Tielkes Video „Lokale KI: Coding zum Nulltarif?" (August 2026).

Quelle

Quelle Kanal Datum Engagement
Video: „Lokale KI: Coding zum Nulltarif?" David Tielke ~2026-08-09/10 ~8.6K Views, 417 Likes

Geteilt von: René Kl. in der OME-Gruppe als „Sendung mit der Maus"-Moment für erwachsene KI-Verstehenwoller — ein nüchterner Erklärgang, der gut zeigt, was im Detail abläuft.

Video-Details: 32 Min, gesponsert von AMD. Inhalt basiert auf dem Transcript (via Gruppen-Zusammenfassung).


Das Konzept

Lokale KI zum Coding bedeutet: KI-Modelle für Softwareentwicklung laufen auf eigener Hardware (Laptop, Desktop, NAS, Workstation) statt über Cloud-APIs. Die zentrale Frage des Videos ist die Kostenfrage — ist lokales Coding wirklich „zum Nulltarif"?

Die Kostenfrage: „Nulltarif" vs. Hardware-Kosten

Kostenart Cloud-API Lokale KI
Laufende Modellkosten Pro-Token / Abo €0 (einmalig geladen)
Hardware-Anschaffung Keine Der eigentliche Kostenfaktor (RAM, GPU)
Strom / Betrieb Inklusive Gering, aber vorhanden
Skalierung Unbegrenzt Durch Hardware begrenzt

Kernaussage: Der „Nulltarif" bezieht sich auf die Modellnutzung — keine laufenden API-Gebühren. Die tatsächlichen Kosten verschieben sich zur Hardware: Wer große Modelle lokal laufen lassen will, braucht ausreichend RAM und Rechenleistung. Das deckt sich mit der cloud-exit-and-local-superiority.md: RAM wird zur neuen digitalen Währung.

Vorteile schnellerer Hardware

Schnellere lokale Hardware (mehr RAM, bessere GPU) macht lokale Coding-Agents erst praktikabel:

  • Höhere Tokens/s → flüssigere Agent-Schleifen (Plan → Code → Test → Refine)
  • Größere Modelle → bessere Code-Qualität (z.B. Qwen3.6-27B statt kleinerer Modelle)
  • Offline / DSGVO → keine Datenverlagerung in die Cloud
  • Keine Rate-Limits → unbegrenzte Iterationen ohne Kostenangst

Bezug zu lokalen Agents

Ein Viewer-Kommentar wünscht sich mehr Details zum Setup lokaler Agents — also lokale KI-Agenten, die Coding-Aufgaben autonom ausführen. Das verbindet das Video mit der Agenten-Architektur-Diskussion: lokale Agents brauchen ein Harness (../../architecture/agent-orchestration.md), ein Modell (lokal) und ausreichend Hardware.


Technische Details aus dem Transcript

Tielke vergleicht zwei Hardware-Setups für lokale KI:

Setup Hardware Speicher Bandbreite
AMD Strix Halo (HP Zbook) iGPU 128 GB Unified Memory ~260 GB/s
Desktop-PC Dedizierte High-End-GPU 16 GB VRAM ~900 GB/s

Zwei entscheidende Kennzahlen

  • Time to First Token (Prefill): Wie schnell der eingehende Prompt durchgerechnet wird. Hängt von der Zahl der Shader-Kerne ab.
  • Tokens pro Sekunde: Wie schnell das Modell antwortet. Bottleneck ist die Speicherbandbreite — pro Token muss das gesamte Modell + Kontextfenster durch den Speicherbus.

Der Kern-Trick: Dense vs. MoE

  • Dense-Modelle (z.B. Gemma 4): Jeder Token lädt das gesamte Modell. → Dedizierte GPU (900 GB/s) gewinnt klar.
  • MoE-Modelle (Mixture of Experts, z.B. Qwen 3 35B A3B, Qwen 3 Coder Next 80B): Nur ~8 von 256 Experten (≈3 Mrd. aktive Parameter) werden pro Token geladen. → Strix Halo (260 GB/s, aber 96 GB VRAM) schlägt die GPU, weil das große Modell dort überhaupt reinpasst.

Spillover

Passt ein Modell nicht in den VRAM, fällt ein Teil in den langsameren RAM (80 GB/s) → Tokens brechen ein (im Test: 14 statt erwarteter Tokens/s).

Fazit des Videos

  • Lokale KI ist im x86-Bereich quasi unbegrenzt möglich.
  • Aber: Die lokalen Modelle sind der limitierende Faktor. Qwen 3 Coder Next (80B) hält sich nicht an Vorgaben, braucht 4050k Token Harness und ist trotzdem unzuverlässig. Für Office/Vibe-Coding super, für professionelles agentisches Coding noch nicht.
  • Tielke hält die oft gepriesenen 35B-Modelle für „Schwachsinn" für ernsthafte Entwicklung.
  • These: Steigende Tokenpreise wären gut für lokale KI, weil dann mehr in Open-Weight-Modelle investiert würde. (Nächste Video-Ankündigung: warum Tokenpreise nicht steigen.)
  • AMD-Leihprogramm zum kostenlosen Testen.

Warum es zählt: Nüchterner Gegenpol zum Hype — die Hardware kann's schon, die Modelle noch nicht.


Verbindung zu bestehendem Wiki-Wissen

Hardware-Tier (Cloud-Exit erweitert)

Hardware-Tier Lokale Coding-Option Quelle
Laptop (beliebig) Qwen3.6-27B / Gemma 4 mit Unsloth-Quants via LM Studio/llama.cpp ../llm/local-llm-laptop-guide.md
Mac (Apple Silicon) MoE-Modelle (Minimax-M3.0, DeepSeek-v4-Flash) via MLX ../llm/mlx-moe-local-ai-optimization.md
Prosumer-Desktop AMD Strix Halo (128 GB) edge-inference-als-cloud-alternative.md
Enterprise-Desktop NVIDIA DGX Station (748 GB) nvidia-dgx-station-748gb.md
NAS / Server Hermes-Agent per SSH (Tielkes Experiment) ../../people/david-tielke.md

Kosten- & Qualitäts-Debatte

Lokale Agents & Architektur


Cross-References