136 lines
7.9 KiB
Markdown
136 lines
7.9 KiB
Markdown
---
|
||
created: 2026-08-10
|
||
updated: 2026-08-10
|
||
sources:
|
||
- youtube/2026-08-10_lokale-ki-coding-nulltarif.md
|
||
tags: [concept, lokale-ki, coding, kosten, hardware, local-ai, agents]
|
||
---
|
||
|
||
# Lokale KI zum Coding — Kostenfrage & Hardware-Vorteile
|
||
|
||
> **TL;DR:** Lokale KI-Modelle für Coding versprechen „Coding zum Nulltarif" — keine laufenden API-Kosten. Die Realität: Die Modellnutzung ist kostenlos, aber die **Hardware** (RAM, GPU) ist der eigentliche Kostenfaktor. Schnellere lokale Hardware macht lokale Coding-Agents praktikabel. Kontext: David Tielkes Video „Lokale KI: Coding zum Nulltarif?" (August 2026).
|
||
|
||
## Quelle
|
||
|
||
| Quelle | Kanal | Datum | Engagement |
|
||
|--------|-------|-------|------------|
|
||
| [Video: „Lokale KI: Coding zum Nulltarif?"](https://www.youtube.com/watch?v=3VwC7zCQT_E) | [David Tielke](https://www.youtube.com/@DavidTielke) | ~2026-08-09/10 | ~8.6K Views, 417 Likes |
|
||
|
||
**Geteilt von:** René Kl. in der OME-Gruppe als „Sendung mit der Maus"-Moment für erwachsene KI-Verstehenwoller — ein nüchterner Erklärgang, der gut zeigt, was im Detail abläuft.
|
||
|
||
> **Video-Details:** 32 Min, gesponsert von AMD. Inhalt basiert auf dem Transcript (via Gruppen-Zusammenfassung).
|
||
|
||
---
|
||
|
||
## Das Konzept
|
||
|
||
**Lokale KI zum Coding** bedeutet: KI-Modelle für Softwareentwicklung laufen auf eigener Hardware (Laptop, Desktop, NAS, Workstation) statt über Cloud-APIs. Die zentrale Frage des Videos ist die **Kostenfrage** — ist lokales Coding wirklich „zum Nulltarif"?
|
||
|
||
### Die Kostenfrage: „Nulltarif" vs. Hardware-Kosten
|
||
|
||
| Kostenart | Cloud-API | Lokale KI |
|
||
|-----------|-----------|-----------|
|
||
| **Laufende Modellkosten** | Pro-Token / Abo | **€0** (einmalig geladen) |
|
||
| **Hardware-Anschaffung** | Keine | **Der eigentliche Kostenfaktor** (RAM, GPU) |
|
||
| **Strom / Betrieb** | Inklusive | Gering, aber vorhanden |
|
||
| **Skalierung** | Unbegrenzt | Durch Hardware begrenzt |
|
||
|
||
**Kernaussage:** Der „Nulltarif" bezieht sich auf die **Modellnutzung** — keine laufenden API-Gebühren. Die tatsächlichen Kosten verschieben sich zur **Hardware**: Wer große Modelle lokal laufen lassen will, braucht ausreichend RAM und Rechenleistung. Das deckt sich mit der [[cloud-exit-and-local-superiority.md|Cloud-Exit-These]]: RAM wird zur neuen digitalen Währung.
|
||
|
||
### Vorteile schnellerer Hardware
|
||
|
||
Schnellere lokale Hardware (mehr RAM, bessere GPU) macht lokale Coding-Agents erst praktikabel:
|
||
|
||
- **Höhere Tokens/s** → flüssigere Agent-Schleifen (Plan → Code → Test → Refine)
|
||
- **Größere Modelle** → bessere Code-Qualität (z.B. Qwen3.6-27B statt kleinerer Modelle)
|
||
- **Offline / DSGVO** → keine Datenverlagerung in die Cloud
|
||
- **Keine Rate-Limits** → unbegrenzte Iterationen ohne Kostenangst
|
||
|
||
### Bezug zu lokalen Agents
|
||
|
||
Ein Viewer-Kommentar wünscht sich mehr Details zum **Setup lokaler Agents** — also lokale KI-Agenten, die Coding-Aufgaben autonom ausführen. Das verbindet das Video mit der Agenten-Architektur-Diskussion: lokale Agents brauchen ein Harness ([[../../architecture/agent-orchestration.md|Agent Orchestration]]), ein Modell (lokal) und ausreichend Hardware.
|
||
|
||
---
|
||
|
||
## Technische Details aus dem Transcript
|
||
|
||
Tielke vergleicht zwei Hardware-Setups für lokale KI:
|
||
|
||
| Setup | Hardware | Speicher | Bandbreite |
|
||
|-------|----------|----------|------------|
|
||
| **AMD Strix Halo** (HP Zbook) | iGPU | 128 GB Unified Memory | ~260 GB/s |
|
||
| **Desktop-PC** | Dedizierte High-End-GPU | 16 GB VRAM | ~900 GB/s |
|
||
|
||
### Zwei entscheidende Kennzahlen
|
||
|
||
- **Time to First Token (Prefill):** Wie schnell der eingehende Prompt durchgerechnet wird. Hängt von der Zahl der Shader-Kerne ab.
|
||
- **Tokens pro Sekunde:** Wie schnell das Modell antwortet. **Bottleneck ist die Speicherbandbreite** — pro Token muss das gesamte Modell + Kontextfenster durch den Speicherbus.
|
||
|
||
### Der Kern-Trick: Dense vs. MoE
|
||
|
||
- **Dense-Modelle** (z.B. Gemma 4): Jeder Token lädt das **gesamte** Modell. → Dedizierte GPU (900 GB/s) gewinnt klar.
|
||
- **MoE-Modelle** (Mixture of Experts, z.B. Qwen 3 35B A3B, Qwen 3 Coder Next 80B): Nur ~8 von 256 Experten (≈3 Mrd. aktive Parameter) werden pro Token geladen. → Strix Halo (260 GB/s, aber 96 GB VRAM) schlägt die GPU, weil das große Modell dort überhaupt reinpasst.
|
||
|
||
### Spillover
|
||
|
||
Passt ein Modell nicht in den VRAM, fällt ein Teil in den langsameren RAM (80 GB/s) → Tokens brechen ein (im Test: 14 statt erwarteter Tokens/s).
|
||
|
||
### Fazit des Videos
|
||
|
||
- **Lokale KI ist im x86-Bereich quasi unbegrenzt möglich.**
|
||
- **Aber: Die lokalen Modelle sind der limitierende Faktor.** Qwen 3 Coder Next (80B) hält sich nicht an Vorgaben, braucht 40–50k Token Harness und ist trotzdem unzuverlässig. Für Office/Vibe-Coding super, für professionelles agentisches Coding noch nicht.
|
||
- Tielke hält die oft gepriesenen 35B-Modelle für „Schwachsinn" für ernsthafte Entwicklung.
|
||
- **These:** Steigende Tokenpreise wären gut für lokale KI, weil dann mehr in Open-Weight-Modelle investiert würde. (Nächste Video-Ankündigung: warum Tokenpreise nicht steigen.)
|
||
- AMD-Leihprogramm zum kostenlosen Testen.
|
||
|
||
> **Warum es zählt:** Nüchterner Gegenpol zum Hype — die Hardware kann's schon, die Modelle noch nicht.
|
||
|
||
---
|
||
|
||
## Verbindung zu bestehendem Wiki-Wissen
|
||
|
||
### Hardware-Tier (Cloud-Exit erweitert)
|
||
|
||
| Hardware-Tier | Lokale Coding-Option | Quelle |
|
||
|---------------|----------------------|--------|
|
||
| Laptop (beliebig) | Qwen3.6-27B / Gemma 4 mit Unsloth-Quants via LM Studio/llama.cpp | [[../llm/local-llm-laptop-guide.md]] |
|
||
| Mac (Apple Silicon) | MoE-Modelle (Minimax-M3.0, DeepSeek-v4-Flash) via MLX | [[../llm/mlx-moe-local-ai-optimization.md]] |
|
||
| Prosumer-Desktop | AMD Strix Halo (128 GB) | [[edge-inference-als-cloud-alternative.md]] |
|
||
| Enterprise-Desktop | NVIDIA DGX Station (748 GB) | [[nvidia-dgx-station-748gb.md]] |
|
||
| NAS / Server | Hermes-Agent per SSH (Tielkes Experiment) | [[../../people/david-tielke.md]] |
|
||
|
||
### Kosten- & Qualitäts-Debatte
|
||
|
||
- [[../llm/coding-benchmark-price-performance.md]] — 39× Kostenspanne zwischen Frontier- und Budget-Modellen; Qualitäts-Kurve ist logarithmisch
|
||
- [[../llm/chinese-model-cost-routing.md]] — 87% Cost-Cut-Playbook (chinesische Modelle als lokale Gamechanger)
|
||
- [[../llm/glm-5.2-zai-coding-model.md]] — GLM 5.2 als lokales Frontier-Coding-Modell
|
||
- [[../llm/ai-intelligence-commoditization-thesis.md]] — Kommoditisierung der Intelligenz
|
||
|
||
### Lokale Agents & Architektur
|
||
|
||
- [[../../architecture/agent-orchestration.md]] — Orchestrator-Pattern für Agenten
|
||
- [[../../architecture/model-routing.md]] — 5-Tier-Routing (lokale Modelle in Tier 0-1)
|
||
- [[../../tools/hermes-desktop.md]] — Hermes-Agent als lokales Coding-Werkzeug (Tielkes Experiment)
|
||
|
||
---
|
||
|
||
## Cross-References
|
||
|
||
- [[cloud-exit-and-local-superiority.md]] — Cloud-Exit-These (RAM als Währung, lokale Überlegenheit)
|
||
- [[../llm/local-llm-laptop-guide.md]] — Beste lokale Modelle für Laptop-Hardware
|
||
- [[../llm/mlx-moe-local-ai-optimization.md]] — MoE-Optimierung auf Apple Silicon
|
||
- [[edge-inference-als-cloud-alternative.md]] — AMD Strix Halo (x86-Edge-Inferenz)
|
||
- [[nvidia-dgx-station-748gb.md]] — NVIDIA DGX Station (Enterprise-Tier)
|
||
- [[deepseek-v41-flash-lokale-hardware.md]] — Extremfall lokaler Inferenz: V4.1 Flash, Hardware-Stufen 16 GB–512 GB, Payback-Rechnung gegen die API
|
||
- [[../llm/coding-benchmark-price-performance.md]] — Preis-Leistungs-Vergleich von Coding-Modellen
|
||
- [[../llm/chinese-model-cost-routing.md]] — Kosten-Routing mit chinesischen Modellen
|
||
- [[../llm/glm-5.2-zai-coding-model.md]] — GLM 5.2 als lokales Coding-Modell
|
||
- [[../../people/david-tielke.md]] — David Tielke (Video-Autor, 45-Tage-Experiment)
|
||
- [[../../architecture/agent-orchestration.md]] — Agent-Orchestrierung (lokale Agents)
|
||
- [[../../architecture/model-routing.md]] — Modell-Routing-Architektur
|
||
|
||
## External Links
|
||
|
||
- [Video: „Lokale KI: Coding zum Nulltarif?"](https://www.youtube.com/watch?v=3VwC7zCQT_E)
|
||
- [YouTube-Kanal David Tielke](https://www.youtube.com/@DavidTielke)
|
||
- [45-Tage-Enterprise-KI-Experiment](https://www.youtube.com/watch?v=eLDHrqKplVI)
|