diff --git a/raw/youtube/2026-08-21_8-dollar-chip-llm-no-ram.md b/raw/youtube/2026-08-21_8-dollar-chip-llm-no-ram.md new file mode 100644 index 0000000..2bdda99 --- /dev/null +++ b/raw/youtube/2026-08-21_8-dollar-chip-llm-no-ram.md @@ -0,0 +1,32 @@ +--- +type: youtube +source_url: https://www.youtube.com/watch?v=0qXVMt3pIjU +retrieved: 2026-08-21 +channel: "Better Stack" +title: "How This Tiny $8 Chip Runs an LLM With Almost No RAM" +duration_sec: null +has_transcript: false +--- + +# How This Tiny $8 Chip Runs an LLM With Almost No RAM + +**Quelle:** YouTube-Video von [Better Stack](https://www.youtube.com/@betterstack), geteilt von Netbits ⚡️ Stachelbanane in der OME-Gruppe, Topic "Tips & Tricks", 2026-08-21. + +> ⚠️ **Metadata-only:** YouTube-Bot-Schutz hat Transkript und Video-Beschreibung blockiert (kein yt-dlp/JS-Runtime ohne Cookies). Titel und Kanal via oEmbed bestätigt. Inhaltliche Kernaussagen konnten nicht extrahiert werden. + +## Bekannte Metadaten + +- **Titel:** "How This Tiny $8 Chip Runs an LLM With Almost No RAM" +- **Kanal:** Better Stack (https://www.youtube.com/@betterstack) +- **URL:** https://www.youtube.com/watch?v=0qXVMt3pIjU +- **Thema (aus Titel abgeleitet):** Extrem günstiger Mikrocontroller-Chip (~$8), der ein LLM mit minimalem RAM ausführt — Edge-Inferenz im Ultra-Kleinformat. + +## Kontext (aus Titel abgeleitet, nicht verifiziert) + +Der Titel beschreibt einen ~8$-Chip, der ein LLM mit fast keinem RAM betreiben kann. Das fällt in die Kategorie **TinyML / Mikrocontroller-Inferenz** (z. B. ESP32-Klasse, Raspberry Pi Pico, RP2040, oder spezialisierte NPU-SoC). Solche Chips haben typischerweise nur einige hundert KB bis wenige MB RAM — ein LLM dort zu betreiben erfordert extreme Quantisierung (z. B. 1-bit / ternäre Gewichte) und/oder Flash-basiertes Streaming von Gewichten. + +Die genauen technischen Details (welcher Chip, welches Modell, welche Quantisierung, gemessene tok/s) sind ohne Transkript nicht bestätigt. + +## Offene Frage an die Gruppe + +Falls jemand das Video kennt: Welcher Chip konkret, welches Modell, und wie hoch ist die reale Token-Rate? Das wäre die fachliche Kante, die diese Wiki-Seite vervollständigt. diff --git a/scripts/wiki-lint-report.md b/scripts/wiki-lint-report.md index 0400a19..6789dd6 100644 --- a/scripts/wiki-lint-report.md +++ b/scripts/wiki-lint-report.md @@ -1,6 +1,6 @@ # Wiki Lint Report -*Generated: 2026-08-21 09:45:45 UTC* +*Generated: 2026-08-21 19:08:54 UTC* *Repo: /home/node/workspace/knowledge-base* *Script: scripts/wiki-lint.sh v1.0* @@ -15,7 +15,7 @@ | wiki/concepts/agi | 7 | ✅ | | wiki/concepts/directives | 4 | ✅ | | wiki/concepts/finance | 5 | ✅ | -| wiki/concepts/hardware | 6 | ✅ | +| wiki/concepts/hardware | 7 | ✅ | | wiki/concepts/llm | 46 | ❌ FAIL (refactor) | | wiki/concepts/policy | 19 | ⚠️ warn (refactor) | | wiki/concepts/tutorials | 1 | ✅ | @@ -23,7 +23,7 @@ | wiki/events | 5 | ✅ | | wiki/ideas | 4 | ✅ | | wiki/institutions | 36 | ❌ FAIL (refactor) | -| wiki/people | 59 | ❌ FAIL (refactor) | +| wiki/people | 60 | ❌ FAIL (refactor) | | wiki/teams | 3 | ✅ | | wiki/tools | 26 | ❌ FAIL (refactor) | | wiki/tools/openclaw | 1 | ✅ | @@ -32,10 +32,10 @@ _Schema v1.5 Sub-Categories: `concepts/hardware`, `concepts/agi`, `people/`, `institutions/` (alle in Counts oben enthalten)_ ### Stub-Quote (<30 Zeilen) -⚠️ **44 / 280 (15%)** — threshold 10% +⚠️ **44 / 282 (15%)** — threshold 10% ### Frontmatter Präsenz -❌ **7 missing, 270 present** +❌ **7 missing, 272 present** Missing: - `wiki/concepts/bmass-roemmele.md` @@ -109,12 +109,13 @@ Missing: - `wiki/ideas/2026-05-29_plur1bus-priority-fix.md` (4 Treffer) - `wiki/ideas/2026-06-06_plur1bus-priority-fix.md` (5 Treffer) - `wiki/people/k9ert-antigravity.md` (3 Treffer) -⚠️ **memory**: 19 Files (≥3 Vorkommen je File) +⚠️ **memory**: 20 Files (≥3 Vorkommen je File) - `wiki/architecture/memory-system.md` (22 Treffer) - `wiki/concepts/agents/agent-memory-taxonomy.md` (26 Treffer) - `wiki/concepts/agents/compound-knowledge.md` (5 Treffer) - `wiki/concepts/agents/graph-based-agents.md` (5 Treffer) - `wiki/concepts/agents/plur1bus-memory-model.md` (5 Treffer) + - `wiki/concepts/hardware/8-dollar-chip-llm-tinyml.md` (3 Treffer) - `wiki/concepts/hardware/edge-inference-als-cloud-alternative.md` (9 Treffer) - `wiki/concepts/hardware/nvidia-dgx-station-748gb.md` (11 Treffer) - `wiki/concepts/llm/ai-value-migration-orchestration.md` (4 Treffer) @@ -169,7 +170,7 @@ Missing: ## Summary -- Total Wiki-Pages: 280 +- Total Wiki-Pages: 282 - Issues: 7 → **Action needed**: subagent spawn for fixes. See '## Recommended Subagent Spawns'. diff --git a/wiki/concepts/hardware/8-dollar-chip-llm-tinyml.md b/wiki/concepts/hardware/8-dollar-chip-llm-tinyml.md new file mode 100644 index 0000000..d103573 --- /dev/null +++ b/wiki/concepts/hardware/8-dollar-chip-llm-tinyml.md @@ -0,0 +1,51 @@ +--- +created: 2026-08-21 +updated: 2026-08-21 +sources: + - youtube/2026-08-21_8-dollar-chip-llm-no-ram.md +tags: [concept, hardware, tinyml, microcontroller, edge-inference, quantization, local-ai, low-power] +--- + +# $8-Chip mit LLM ohne RAM — TinyML-Inferenz im Ultra-Kleinformat + +> **TL;DR:** Ein YouTube-Video von Better Stack zeigt einen extrem günstigen (~$8) Mikrocontroller-Chip, der ein LLM mit fast keinem RAM ausführt. Das ist die Ultra-Klein-Form der Edge-Inferenz (TinyML): Modelle auf Chips mit nur wenigen hundert KB bis wenigen MB RAM — möglich durch extreme Quantisierung und/oder Flash-Streaming der Gewichte. + +> ⚠️ **Metadata-only (Stand 2026-08-21):** YouTube-Bot-Schutz blockierte Transkript/Beschreibung. Titel und Kanal via oEmbed bestätigt, technische Details (Chip-Typ, Modell, Token-Rate) sind nicht verifiziert. Offene Frage an die Gruppe. + +## Quelle + +| Quelle | Kanal | Datum | Status | +|--------|-------|-------|--------| +| [Video: „How This Tiny $8 Chip Runs an LLM With Almost No RAM"](https://www.youtube.com/watch?v=0qXVMt3pIjU) | [Better Stack](https://www.youtube.com/@betterstack) | ~2026-08-21 | ⚠️ Metadata-only | + +**Geteilt von:** Netbits ⚡️ Stachelbanane in der OME-Gruppe, Topic "Tips & Tricks" (2026-08-21). + +## Einordnung: TinyML als untere Kante der Edge-Inferenz + +Das Video gehört in die Kategorie **TinyML / Mikrocontroller-Inferenz** — die extreme Untergrenze der lokalen KI-Hardware. Während [[edge-inference-als-cloud-alternative.md|AMDs Lunchbox-PC]] 235B-Modelle mit 128 GB unified memory lokal betreibt (Edge-Inferenz als Cloud-Alternative), verschiebt diese Kategorie die Grenze nach unten: LLMs auf Chips der ESP32-/Raspberry-Pi-Pico-Klasse (~$8, nur wenige hundert KB RAM). + +### Warum das relevant ist: Drei Anschlüsse ans Wiki + +1. **Vollständigkeit der Hardware-Skala.** Das Wiki hat die obere Kante (NVIDIA DGX 748 GB, [[nvidia-dgx-station-748gb.md]]) und die Mitte (AMD Strix Halo, [[edge-inference-als-cloud-alternative.md]], lokale Coding-KI, [[lokale-ki-coding.md]]). Der $8-Chip schließt die untere Kante: die Skala von „wenige hundert KB RAM" bis „748 GB unified memory" ist damit komplett. Dieselbe Technologie (Quantisierung, Gewichts-Kompression) wirkt auf allen Ebenen — nur die Modellgröße skaliert mit dem Speicher. + +2. **Quantisierung als verbindendes Prinzip.** Extreme Quantisierung (1-bit / ternäre Gewichte, Flash-Streaming) ist der Hebel, der ein LLM auf einen $8-Chip bringt. Das ist das gleiche Prinzip, das [[../llm/qwen3.8-27b-alibaba.md|Qwen3.8-27B]] auf 6,2 GB (IQ1_S) schrumpft — nur noch eine Größenordnung radikaler. Wer die TinyML-Kante versteht, versteht den unteren Rand der Quantisierungs-Skala, die auch auf Consumer-Hardware wirkt. + +3. **[[../../people/klaus-mainzer.md|Mainzers]] Energie-Argument wird greifbar.** [[neuromorphic-chips-und-quantencomputer.md|Prof. Mainzer]] argumentiert, das Gehirn leiste mit ~20 W, wofür LLM-Cluster Megawatt brauchen. Ein $8-Chip mit LLM in Milli- bis Watt-Klasse ist der Gegenpol zur Megawatt-Cloud: maximale Energie-Effizienz durch minimale Parameter. Nicht neuromorph, aber der extremste Ausdruck der „Token value per watt per user"-These. + +## Grenzen und offene Fragen + +- **Chip-Typ unbekannt:** ESP32-Klasse, RP2040/Pico, oder ein spezialisierter NPU-SoC? Nicht verifiziert. +- **Modell & Quantisierung unbekannt:** Welches Modell, welche Bit-Breite, Flash- vs. RAM-Streaming? Nicht verifiziert. +- **Reale Token-Rate:** Marketing-Zahl („läuft") vs. praktisch nutzbar (interaktiv)? Bei TinyML liegt der Sweet Spot meist unterhalb interaktiver Token-Raten. +- **Praktischer Nutzen:** Ein LLM auf einem $8-Chip ist technisch faszinierend — die Frage ist, welcher Workload davon real profitiert (embedded Klassifikation/Routing eher als echtes Reasoning). + +**Offene Frage an die Gruppe:** Falls jemand das Video kennt — welcher Chip konkret, welches Modell, und wie hoch ist die reale Token-Rate? Das wäre die fachliche Kante, die diese Seite vervollständigt. + +## Verwandte Wiki-Seiten + +- [[edge-inference-als-cloud-alternative.md]] — obere/mittlere Kante: 235B lokal auf 128 GB +- [[nvidia-dgx-station-748gb.md]] — 748 GB unified memory Desktop +- [[cloud-exit-and-local-superiority.md]] — lokale Überlegenheit, RAM als Währung +- [[lokale-ki-coding.md]] — lokale KI zum Coding, Hardware als Kostenfaktor +- [[neuromorphic-chips-und-quantencomputer.md]] — Energie-Argument, 20W-Gehirn +- [[../llm/qwen3.8-27b-alibaba.md]] — Quantisierung als Kompressions-Hebel diff --git a/wiki/index.md b/wiki/index.md index ef0a1e3..1a99a95 100644 --- a/wiki/index.md +++ b/wiki/index.md @@ -163,6 +163,7 @@ | [NVIDIA DGX Station — 748 GB Unified Memory Desktop](concepts/hardware/nvidia-dgx-station-748gb.md) | GB300 Grace Blackwell Ultra Superchip: 748 GB kohärent (252 GB HBM3e + 496 GB LPDDR5X), 20 petaFLOPS FP4. Full-precision 70B ohne Quantisierung. ~$85K–$115K, ROI break-even ~2 Monate vs Cloud. DGX Spark (128 GB, $4.7K) als Prosumer-Einstieg. LM Studio/Ollama-Asterisk verschwindet | youtube/2026-06-28_nvidia-748gb-ram-desktop-local-ai.md | | [Lokale KI zum Coding — Kostenfrage & Hardware-Vorteile](concepts/hardware/lokale-ki-coding.md) | David Tielke: „Lokale KI: Coding zum Nulltarif?" — Modellnutzung gratis, aber Hardware (RAM/GPU) ist der eigentliche Kostenfaktor. Vorteile schnellerer Hardware (höhere tok/s, größere Modelle, offline/DSGVO). Bezug zu lokalen Agents. ⚠️ Metadata-only (kein Transcript) | youtube/2026-08-10_lokale-ki-coding-nulltarif.md | | [UBTECH U1 — Chinas hyperrealistische Humanoide Roboter](concepts/hardware/ubtech-u1-humanoid-roboter.md) | UBTECH (erstes börsennotiertes Humanoid-Unternehmen): U1 mit Silikonhaut, 88 DOF, Cloud-KI, 13K+ Vorbestellungen ($17.6K–$45K), demografischer Treiber (HK 0,77). **Update 19.08.:** China 97 % aller humanoiden Roboter weltweit, US-Importverbot für vernetzte Roboter >2 kg | youtube/2026-07-05_everlast-ki-news-china-roboter-sonnet5-fable5.md + youtube/2026-08-19_ki-experten-alles-zum-kippen.md | +| [$8-Chip mit LLM ohne RAM — TinyML-Inferenz im Ultra-Kleinformat](concepts/hardware/8-dollar-chip-llm-tinyml.md) | Better Stack: ~$8-Mikrocontroller, der ein LLM mit fast keinem RAM ausführt (ESP32-/Pico-Klasse, extreme Quantisierung/Flash-Streaming). Untere Kante der Edge-Inferenz-Skala (wenige KB bis MB) — Gegenpol zu DGX 748 GB / Strix Halo 128 GB. Verbindendes Prinzip: Quantisierung. ⚠️ Metadata-only (kein Transcript) | youtube/2026-08-21_8-dollar-chip-llm-no-ram.md | ### Agents | Seite | Beschreibung | Quellen | diff --git a/wiki/log.md b/wiki/log.md index b503931..f2f7e4a 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -2257,3 +2257,13 @@ Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Über - wiki (UPDATED): `wiki/tools/hermes-desktop.md` — neuer Abschnitt "Interaktive Website-Touren (Tour Feature)": Hermes generiert im In-App-Browser interaktive Schritt-für-Schritt-Walkthroughs direkt auf jeder Live-Website (Beispiel: 7-Schritte-Tour auf CoinMarketCap mit Highlights für Navigation, Preis, Chart, Markets, Stats, Community); on-the-fly-Verfeinerung; funktioniert über Dashboards/Analytics/Admin-Panels/Doku; Feature gebaut von @imbabybrooklyn. Einordnung: Hermes als aktiver UI-Tutor statt nur ausführender Browser-Agent; Verwandtschaft zu Browser-Extension (@jonkomet) und Jarvis/Agent-OS. Frontmatter-sources/updated/tags ergänzt. - index.md: 120. Update, Hermes-Desktop-Eintrag erweitert, Raw-Katalog (+1). - log: this entry + +## 2026-08-21 — $8-Chip mit LLM ohne RAM — TinyML-Inferenz (Better Stack) + +**Type:** ingest | **Scope:** raw/youtube (1 new), wiki/concepts/hardware (1 new), wiki/index, wiki/log +**Source:** YouTube-Video auf dem Kanal Better Stack, geteilt von Netbits ⚡️ Stachelbanane im OME-Topic "Tips & Tricks" (2026-08-21). URL: https://www.youtube.com/watch?v=0qXVMt3pIjU. Titel: "How This Tiny $8 Chip Runs an LLM With Almost No RAM". + +- raw (NEW): `raw/youtube/2026-08-21_8-dollar-chip-llm-no-ram.md` — neutrale Rohdaten (nur Metadaten + Titel-/Kanal-basierte Zusammenfassung, ⚠️ kein Transcript verfügbar, keine erfundenen Inhalte). +- wiki (NEW): `wiki/concepts/hardware/8-dollar-chip-llm-tinyml.md` — Konzept-Seite zu TinyML-Mikrocontroller-Inferenz (~$8-Chip, ESP32-/Pico-Klasse, extreme Quantisierung/Flash-Streaming) als untere Kante der Edge-Inferenz-Skala; Cross-Refs zu Edge-Inferenz, NVIDIA DGX, Cloud-Exit, lokale Coding-KI, Mainzer, Qwen3.8-27B-Quantisierung. +- index.md: 122. Update, neue Hardware-Konzept-Seite, Raw-Katalog (+1). +- log: this entry