wiki-update(concepts): transcript-details lokale-ki-coding

This commit is contained in:
Hector 2026-08-10 15:41:32 +02:00
parent 601341d889
commit 3de76ea9ad
2 changed files with 41 additions and 2 deletions

View file

@ -16,9 +16,9 @@ tags: [concept, lokale-ki, coding, kosten, hardware, local-ai, agents]
|--------|-------|-------|------------| |--------|-------|-------|------------|
| [Video: „Lokale KI: Coding zum Nulltarif?"](https://www.youtube.com/watch?v=3VwC7zCQT_E) | [David Tielke](https://www.youtube.com/@DavidTielke) | ~2026-08-09/10 | ~8.6K Views, 417 Likes | | [Video: „Lokale KI: Coding zum Nulltarif?"](https://www.youtube.com/watch?v=3VwC7zCQT_E) | [David Tielke](https://www.youtube.com/@DavidTielke) | ~2026-08-09/10 | ~8.6K Views, 417 Likes |
**Geteilt von:** René Kl. in der OME-Gruppe als „Sendung mit der Maus"-Moment für erwachsene KI-Verstehenwoller. **Geteilt von:** René Kl. in der OME-Gruppe als „Sendung mit der Maus"-Moment für erwachsene KI-Verstehenwoller — ein nüchterner Erklärgang, der gut zeigt, was im Detail abläuft.
> ⚠️ **Metadata-only:** Kein Transcript verfügbar. Diese Seite dokumentiert das Konzept anhand der belegten Fakten (Titel, Kanal, Themenschwerpunkt laut Suche) und verknüpft es mit bestehendem Wiki-Wissen. Keine Videoinhalte erfunden. > **Video-Details:** 32 Min, gesponsert von AMD. Inhalt basiert auf dem Transcript (via Gruppen-Zusammenfassung).
--- ---
@ -52,6 +52,41 @@ Ein Viewer-Kommentar wünscht sich mehr Details zum **Setup lokaler Agents** —
--- ---
## Technische Details aus dem Transcript
Tielke vergleicht zwei Hardware-Setups für lokale KI:
| Setup | Hardware | Speicher | Bandbreite |
|-------|----------|----------|------------|
| **AMD Strix Halo** (HP Zbook) | iGPU | 128 GB Unified Memory | ~260 GB/s |
| **Desktop-PC** | Dedizierte High-End-GPU | 16 GB VRAM | ~900 GB/s |
### Zwei entscheidende Kennzahlen
- **Time to First Token (Prefill):** Wie schnell der eingehende Prompt durchgerechnet wird. Hängt von der Zahl der Shader-Kerne ab.
- **Tokens pro Sekunde:** Wie schnell das Modell antwortet. **Bottleneck ist die Speicherbandbreite** — pro Token muss das gesamte Modell + Kontextfenster durch den Speicherbus.
### Der Kern-Trick: Dense vs. MoE
- **Dense-Modelle** (z.B. Gemma 4): Jeder Token lädt das **gesamte** Modell. → Dedizierte GPU (900 GB/s) gewinnt klar.
- **MoE-Modelle** (Mixture of Experts, z.B. Qwen 3 35B A3B, Qwen 3 Coder Next 80B): Nur ~8 von 256 Experten (≈3 Mrd. aktive Parameter) werden pro Token geladen. → Strix Halo (260 GB/s, aber 96 GB VRAM) schlägt die GPU, weil das große Modell dort überhaupt reinpasst.
### Spillover
Passt ein Modell nicht in den VRAM, fällt ein Teil in den langsameren RAM (80 GB/s) → Tokens brechen ein (im Test: 14 statt erwarteter Tokens/s).
### Fazit des Videos
- **Lokale KI ist im x86-Bereich quasi unbegrenzt möglich.**
- **Aber: Die lokalen Modelle sind der limitierende Faktor.** Qwen 3 Coder Next (80B) hält sich nicht an Vorgaben, braucht 4050k Token Harness und ist trotzdem unzuverlässig. Für Office/Vibe-Coding super, für professionelles agentisches Coding noch nicht.
- Tielke hält die oft gepriesenen 35B-Modelle für „Schwachsinn" für ernsthafte Entwicklung.
- **These:** Steigende Tokenpreise wären gut für lokale KI, weil dann mehr in Open-Weight-Modelle investiert würde. (Nächste Video-Ankündigung: warum Tokenpreise nicht steigen.)
- AMD-Leihprogramm zum kostenlosen Testen.
> **Warum es zählt:** Nüchterner Gegenpol zum Hype — die Hardware kann's schon, die Modelle noch nicht.
---
## Verbindung zu bestehendem Wiki-Wissen ## Verbindung zu bestehendem Wiki-Wissen
### Hardware-Tier (Cloud-Exit erweitert) ### Hardware-Tier (Cloud-Exit erweitert)

View file

@ -1678,3 +1678,7 @@ Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Über
- raw (NEW): `raw/youtube/2026-08-08_karl-olsberg-huggingface-neue-details.md` (created — oEmbed-Metadaten: Titel "Neue Details zum Hugging Face-Vorfall: OpenAI-KIs kooperierten heimlich", Kanal Karl Olsberg @KarlOlsbergAutor, video_id 4QPHY8spgFo. Transkript nicht abrufbar, YouTube-Bot-Schutz LOGIN_REQUIRED. Gepostet von Pit @PWeber in Topic 6 aGi/eMergence #10569) - raw (NEW): `raw/youtube/2026-08-08_karl-olsberg-huggingface-neue-details.md` (created — oEmbed-Metadaten: Titel "Neue Details zum Hugging Face-Vorfall: OpenAI-KIs kooperierten heimlich", Kanal Karl Olsberg @KarlOlsbergAutor, video_id 4QPHY8spgFo. Transkript nicht abrufbar, YouTube-Bot-Schutz LOGIN_REQUIRED. Gepostet von Pit @PWeber in Topic 6 aGi/eMergence #10569)
- wiki (UPDATED): `concepts/openai-huggingface-incident.md` (ergänzt Update 08.08.: OpenAI-KIs kooperierten heimlich — emergente Zusammenarbeit der Modelle bei der Infiltration, neues Detail zur Koordinationsfähigkeit. Erstmals in index.md aufgenommen) - wiki (UPDATED): `concepts/openai-huggingface-incident.md` (ergänzt Update 08.08.: OpenAI-KIs kooperierten heimlich — emergente Zusammenarbeit der Modelle bei der Infiltration, neues Detail zur Koordinationsfähigkeit. Erstmals in index.md aufgenommen)
- log: this entry - log: this entry
## 2026-08-10 — Ergänzung: Transcript-Details zu lokale-ki-coding
- **wiki/concepts/hardware/lokale-ki-coding.md** — Technische Details aus dem Transcript ergänzt (Dense vs. MoE, Spillover, Time to First Token, Strix Halo vs. Desktop-GPU, Fazit: Hardware kann's, Modelle noch nicht). Metadata-only-Hinweis entfernt.
- Quelle: Gruppen-Zusammenfassung des Transcripts (Herman, OME-Gruppe).