--- created: 2026-08-10 updated: 2026-08-10 sources: - youtube/2026-08-10_lokale-ki-coding-nulltarif.md tags: [concept, lokale-ki, coding, kosten, hardware, local-ai, agents] --- # Lokale KI zum Coding — Kostenfrage & Hardware-Vorteile > **TL;DR:** Lokale KI-Modelle für Coding versprechen „Coding zum Nulltarif" — keine laufenden API-Kosten. Die Realität: Die Modellnutzung ist kostenlos, aber die **Hardware** (RAM, GPU) ist der eigentliche Kostenfaktor. Schnellere lokale Hardware macht lokale Coding-Agents praktikabel. Kontext: David Tielkes Video „Lokale KI: Coding zum Nulltarif?" (August 2026). ## Quelle | Quelle | Kanal | Datum | Engagement | |--------|-------|-------|------------| | [Video: „Lokale KI: Coding zum Nulltarif?"](https://www.youtube.com/watch?v=3VwC7zCQT_E) | [David Tielke](https://www.youtube.com/@DavidTielke) | ~2026-08-09/10 | ~8.6K Views, 417 Likes | **Geteilt von:** René Kl. in der OME-Gruppe als „Sendung mit der Maus"-Moment für erwachsene KI-Verstehenwoller — ein nüchterner Erklärgang, der gut zeigt, was im Detail abläuft. > **Video-Details:** 32 Min, gesponsert von AMD. Inhalt basiert auf dem Transcript (via Gruppen-Zusammenfassung). --- ## Das Konzept **Lokale KI zum Coding** bedeutet: KI-Modelle für Softwareentwicklung laufen auf eigener Hardware (Laptop, Desktop, NAS, Workstation) statt über Cloud-APIs. Die zentrale Frage des Videos ist die **Kostenfrage** — ist lokales Coding wirklich „zum Nulltarif"? ### Die Kostenfrage: „Nulltarif" vs. Hardware-Kosten | Kostenart | Cloud-API | Lokale KI | |-----------|-----------|-----------| | **Laufende Modellkosten** | Pro-Token / Abo | **€0** (einmalig geladen) | | **Hardware-Anschaffung** | Keine | **Der eigentliche Kostenfaktor** (RAM, GPU) | | **Strom / Betrieb** | Inklusive | Gering, aber vorhanden | | **Skalierung** | Unbegrenzt | Durch Hardware begrenzt | **Kernaussage:** Der „Nulltarif" bezieht sich auf die **Modellnutzung** — keine laufenden API-Gebühren. Die tatsächlichen Kosten verschieben sich zur **Hardware**: Wer große Modelle lokal laufen lassen will, braucht ausreichend RAM und Rechenleistung. Das deckt sich mit der [[cloud-exit-and-local-superiority.md|Cloud-Exit-These]]: RAM wird zur neuen digitalen Währung. ### Vorteile schnellerer Hardware Schnellere lokale Hardware (mehr RAM, bessere GPU) macht lokale Coding-Agents erst praktikabel: - **Höhere Tokens/s** → flüssigere Agent-Schleifen (Plan → Code → Test → Refine) - **Größere Modelle** → bessere Code-Qualität (z.B. Qwen3.6-27B statt kleinerer Modelle) - **Offline / DSGVO** → keine Datenverlagerung in die Cloud - **Keine Rate-Limits** → unbegrenzte Iterationen ohne Kostenangst ### Bezug zu lokalen Agents Ein Viewer-Kommentar wünscht sich mehr Details zum **Setup lokaler Agents** — also lokale KI-Agenten, die Coding-Aufgaben autonom ausführen. Das verbindet das Video mit der Agenten-Architektur-Diskussion: lokale Agents brauchen ein Harness ([[../../architecture/agent-orchestration.md|Agent Orchestration]]), ein Modell (lokal) und ausreichend Hardware. --- ## Technische Details aus dem Transcript Tielke vergleicht zwei Hardware-Setups für lokale KI: | Setup | Hardware | Speicher | Bandbreite | |-------|----------|----------|------------| | **AMD Strix Halo** (HP Zbook) | iGPU | 128 GB Unified Memory | ~260 GB/s | | **Desktop-PC** | Dedizierte High-End-GPU | 16 GB VRAM | ~900 GB/s | ### Zwei entscheidende Kennzahlen - **Time to First Token (Prefill):** Wie schnell der eingehende Prompt durchgerechnet wird. Hängt von der Zahl der Shader-Kerne ab. - **Tokens pro Sekunde:** Wie schnell das Modell antwortet. **Bottleneck ist die Speicherbandbreite** — pro Token muss das gesamte Modell + Kontextfenster durch den Speicherbus. ### Der Kern-Trick: Dense vs. MoE - **Dense-Modelle** (z.B. Gemma 4): Jeder Token lädt das **gesamte** Modell. → Dedizierte GPU (900 GB/s) gewinnt klar. - **MoE-Modelle** (Mixture of Experts, z.B. Qwen 3 35B A3B, Qwen 3 Coder Next 80B): Nur ~8 von 256 Experten (≈3 Mrd. aktive Parameter) werden pro Token geladen. → Strix Halo (260 GB/s, aber 96 GB VRAM) schlägt die GPU, weil das große Modell dort überhaupt reinpasst. ### Spillover Passt ein Modell nicht in den VRAM, fällt ein Teil in den langsameren RAM (80 GB/s) → Tokens brechen ein (im Test: 14 statt erwarteter Tokens/s). ### Fazit des Videos - **Lokale KI ist im x86-Bereich quasi unbegrenzt möglich.** - **Aber: Die lokalen Modelle sind der limitierende Faktor.** Qwen 3 Coder Next (80B) hält sich nicht an Vorgaben, braucht 40–50k Token Harness und ist trotzdem unzuverlässig. Für Office/Vibe-Coding super, für professionelles agentisches Coding noch nicht. - Tielke hält die oft gepriesenen 35B-Modelle für „Schwachsinn" für ernsthafte Entwicklung. - **These:** Steigende Tokenpreise wären gut für lokale KI, weil dann mehr in Open-Weight-Modelle investiert würde. (Nächste Video-Ankündigung: warum Tokenpreise nicht steigen.) - AMD-Leihprogramm zum kostenlosen Testen. > **Warum es zählt:** Nüchterner Gegenpol zum Hype — die Hardware kann's schon, die Modelle noch nicht. --- ## Verbindung zu bestehendem Wiki-Wissen ### Hardware-Tier (Cloud-Exit erweitert) | Hardware-Tier | Lokale Coding-Option | Quelle | |---------------|----------------------|--------| | Laptop (beliebig) | Qwen3.6-27B / Gemma 4 mit Unsloth-Quants via LM Studio/llama.cpp | [[../llm/local-llm-laptop-guide.md]] | | Mac (Apple Silicon) | MoE-Modelle (Minimax-M3.0, DeepSeek-v4-Flash) via MLX | [[../llm/mlx-moe-local-ai-optimization.md]] | | Prosumer-Desktop | AMD Strix Halo (128 GB) | [[edge-inference-als-cloud-alternative.md]] | | Enterprise-Desktop | NVIDIA DGX Station (748 GB) | [[nvidia-dgx-station-748gb.md]] | | NAS / Server | Hermes-Agent per SSH (Tielkes Experiment) | [[../../people/david-tielke.md]] | ### Kosten- & Qualitäts-Debatte - [[../llm/coding-benchmark-price-performance.md]] — 39× Kostenspanne zwischen Frontier- und Budget-Modellen; Qualitäts-Kurve ist logarithmisch - [[../llm/chinese-model-cost-routing.md]] — 87% Cost-Cut-Playbook (chinesische Modelle als lokale Gamechanger) - [[../llm/glm-5.2-zai-coding-model.md]] — GLM 5.2 als lokales Frontier-Coding-Modell - [[../llm/ai-intelligence-commoditization-thesis.md]] — Kommoditisierung der Intelligenz ### Lokale Agents & Architektur - [[../../architecture/agent-orchestration.md]] — Orchestrator-Pattern für Agenten - [[../../architecture/model-routing.md]] — 5-Tier-Routing (lokale Modelle in Tier 0-1) - [[../../tools/hermes-desktop.md]] — Hermes-Agent als lokales Coding-Werkzeug (Tielkes Experiment) --- ## Cross-References - [[cloud-exit-and-local-superiority.md]] — Cloud-Exit-These (RAM als Währung, lokale Überlegenheit) - [[../llm/local-llm-laptop-guide.md]] — Beste lokale Modelle für Laptop-Hardware - [[../llm/mlx-moe-local-ai-optimization.md]] — MoE-Optimierung auf Apple Silicon - [[edge-inference-als-cloud-alternative.md]] — AMD Strix Halo (x86-Edge-Inferenz) - [[nvidia-dgx-station-748gb.md]] — NVIDIA DGX Station (Enterprise-Tier) - [[deepseek-v41-flash-lokale-hardware.md]] — Extremfall lokaler Inferenz: V4.1 Flash, Hardware-Stufen 16 GB–512 GB, Payback-Rechnung gegen die API - [[../llm/coding-benchmark-price-performance.md]] — Preis-Leistungs-Vergleich von Coding-Modellen - [[../llm/chinese-model-cost-routing.md]] — Kosten-Routing mit chinesischen Modellen - [[../llm/glm-5.2-zai-coding-model.md]] — GLM 5.2 als lokales Coding-Modell - [[../../people/david-tielke.md]] — David Tielke (Video-Autor, 45-Tage-Experiment) - [[../../architecture/agent-orchestration.md]] — Agent-Orchestrierung (lokale Agents) - [[../../architecture/model-routing.md]] — Modell-Routing-Architektur ## External Links - [Video: „Lokale KI: Coding zum Nulltarif?"](https://www.youtube.com/watch?v=3VwC7zCQT_E) - [YouTube-Kanal David Tielke](https://www.youtube.com/@DavidTielke) - [45-Tage-Enterprise-KI-Experiment](https://www.youtube.com/watch?v=eLDHrqKplVI)