From 3de76ea9ada31982ac0d25453003b988d0a74674 Mon Sep 17 00:00:00 2001 From: Hector Date: Mon, 10 Aug 2026 15:41:32 +0200 Subject: [PATCH] wiki-update(concepts): transcript-details lokale-ki-coding --- wiki/concepts/hardware/lokale-ki-coding.md | 39 ++++++++++++++++++++-- wiki/log.md | 4 +++ 2 files changed, 41 insertions(+), 2 deletions(-) diff --git a/wiki/concepts/hardware/lokale-ki-coding.md b/wiki/concepts/hardware/lokale-ki-coding.md index 06f4f79..0805007 100644 --- a/wiki/concepts/hardware/lokale-ki-coding.md +++ b/wiki/concepts/hardware/lokale-ki-coding.md @@ -16,9 +16,9 @@ tags: [concept, lokale-ki, coding, kosten, hardware, local-ai, agents] |--------|-------|-------|------------| | [Video: „Lokale KI: Coding zum Nulltarif?"](https://www.youtube.com/watch?v=3VwC7zCQT_E) | [David Tielke](https://www.youtube.com/@DavidTielke) | ~2026-08-09/10 | ~8.6K Views, 417 Likes | -**Geteilt von:** René Kl. in der OME-Gruppe als „Sendung mit der Maus"-Moment für erwachsene KI-Verstehenwoller. +**Geteilt von:** René Kl. in der OME-Gruppe als „Sendung mit der Maus"-Moment für erwachsene KI-Verstehenwoller — ein nüchterner Erklärgang, der gut zeigt, was im Detail abläuft. -> ⚠️ **Metadata-only:** Kein Transcript verfügbar. Diese Seite dokumentiert das Konzept anhand der belegten Fakten (Titel, Kanal, Themenschwerpunkt laut Suche) und verknüpft es mit bestehendem Wiki-Wissen. Keine Videoinhalte erfunden. +> **Video-Details:** 32 Min, gesponsert von AMD. Inhalt basiert auf dem Transcript (via Gruppen-Zusammenfassung). --- @@ -52,6 +52,41 @@ Ein Viewer-Kommentar wünscht sich mehr Details zum **Setup lokaler Agents** — --- +## Technische Details aus dem Transcript + +Tielke vergleicht zwei Hardware-Setups für lokale KI: + +| Setup | Hardware | Speicher | Bandbreite | +|-------|----------|----------|------------| +| **AMD Strix Halo** (HP Zbook) | iGPU | 128 GB Unified Memory | ~260 GB/s | +| **Desktop-PC** | Dedizierte High-End-GPU | 16 GB VRAM | ~900 GB/s | + +### Zwei entscheidende Kennzahlen + +- **Time to First Token (Prefill):** Wie schnell der eingehende Prompt durchgerechnet wird. Hängt von der Zahl der Shader-Kerne ab. +- **Tokens pro Sekunde:** Wie schnell das Modell antwortet. **Bottleneck ist die Speicherbandbreite** — pro Token muss das gesamte Modell + Kontextfenster durch den Speicherbus. + +### Der Kern-Trick: Dense vs. MoE + +- **Dense-Modelle** (z.B. Gemma 4): Jeder Token lädt das **gesamte** Modell. → Dedizierte GPU (900 GB/s) gewinnt klar. +- **MoE-Modelle** (Mixture of Experts, z.B. Qwen 3 35B A3B, Qwen 3 Coder Next 80B): Nur ~8 von 256 Experten (≈3 Mrd. aktive Parameter) werden pro Token geladen. → Strix Halo (260 GB/s, aber 96 GB VRAM) schlägt die GPU, weil das große Modell dort überhaupt reinpasst. + +### Spillover + +Passt ein Modell nicht in den VRAM, fällt ein Teil in den langsameren RAM (80 GB/s) → Tokens brechen ein (im Test: 14 statt erwarteter Tokens/s). + +### Fazit des Videos + +- **Lokale KI ist im x86-Bereich quasi unbegrenzt möglich.** +- **Aber: Die lokalen Modelle sind der limitierende Faktor.** Qwen 3 Coder Next (80B) hält sich nicht an Vorgaben, braucht 40–50k Token Harness und ist trotzdem unzuverlässig. Für Office/Vibe-Coding super, für professionelles agentisches Coding noch nicht. +- Tielke hält die oft gepriesenen 35B-Modelle für „Schwachsinn" für ernsthafte Entwicklung. +- **These:** Steigende Tokenpreise wären gut für lokale KI, weil dann mehr in Open-Weight-Modelle investiert würde. (Nächste Video-Ankündigung: warum Tokenpreise nicht steigen.) +- AMD-Leihprogramm zum kostenlosen Testen. + +> **Warum es zählt:** Nüchterner Gegenpol zum Hype — die Hardware kann's schon, die Modelle noch nicht. + +--- + ## Verbindung zu bestehendem Wiki-Wissen ### Hardware-Tier (Cloud-Exit erweitert) diff --git a/wiki/log.md b/wiki/log.md index 82e14b2..130844c 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -1678,3 +1678,7 @@ Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Über - raw (NEW): `raw/youtube/2026-08-08_karl-olsberg-huggingface-neue-details.md` (created — oEmbed-Metadaten: Titel "Neue Details zum Hugging Face-Vorfall: OpenAI-KIs kooperierten heimlich", Kanal Karl Olsberg @KarlOlsbergAutor, video_id 4QPHY8spgFo. Transkript nicht abrufbar, YouTube-Bot-Schutz LOGIN_REQUIRED. Gepostet von Pit @PWeber in Topic 6 aGi/eMergence #10569) - wiki (UPDATED): `concepts/openai-huggingface-incident.md` (ergänzt Update 08.08.: OpenAI-KIs kooperierten heimlich — emergente Zusammenarbeit der Modelle bei der Infiltration, neues Detail zur Koordinationsfähigkeit. Erstmals in index.md aufgenommen) - log: this entry + +## 2026-08-10 — Ergänzung: Transcript-Details zu lokale-ki-coding +- **wiki/concepts/hardware/lokale-ki-coding.md** — Technische Details aus dem Transcript ergänzt (Dense vs. MoE, Spillover, Time to First Token, Strix Halo vs. Desktop-GPU, Fazit: Hardware kann's, Modelle noch nicht). Metadata-only-Hinweis entfernt. +- Quelle: Gruppen-Zusammenfassung des Transcripts (Herman, OME-Gruppe).