# $8-Chip mit LLM ohne RAM — TinyML-Inferenz im Ultra-Kleinformat
> **TL;DR:** Ein YouTube-Video von Better Stack zeigt einen extrem günstigen (~$8) Mikrocontroller-Chip, der ein LLM mit fast keinem RAM ausführt. Das ist die Ultra-Klein-Form der Edge-Inferenz (TinyML): Modelle auf Chips mit nur wenigen hundert KB bis wenigen MB RAM — möglich durch extreme Quantisierung und/oder Flash-Streaming der Gewichte.
> ⚠️ **Metadata-only (Stand 2026-08-21):** YouTube-Bot-Schutz blockierte Transkript/Beschreibung. Titel und Kanal via oEmbed bestätigt, technische Details (Chip-Typ, Modell, Token-Rate) sind nicht verifiziert. Offene Frage an die Gruppe.
## Quelle
| Quelle | Kanal | Datum | Status |
|--------|-------|-------|--------|
| [Video: „How This Tiny $8 Chip Runs an LLM With Almost No RAM"](https://www.youtube.com/watch?v=0qXVMt3pIjU) | [Better Stack](https://www.youtube.com/@betterstack) | ~2026-08-21 | ⚠️ Metadata-only |
**Geteilt von:** Netbits ⚡️ Stachelbanane in der OME-Gruppe, Topic "Tips & Tricks" (2026-08-21).
## Einordnung: TinyML als untere Kante der Edge-Inferenz
Das Video gehört in die Kategorie **TinyML / Mikrocontroller-Inferenz** — die extreme Untergrenze der lokalen KI-Hardware. Während [[edge-inference-als-cloud-alternative.md|AMDs Lunchbox-PC]] 235B-Modelle mit 128 GB unified memory lokal betreibt (Edge-Inferenz als Cloud-Alternative), verschiebt diese Kategorie die Grenze nach unten: LLMs auf Chips der ESP32-/Raspberry-Pi-Pico-Klasse (~$8, nur wenige hundert KB RAM).
### Warum das relevant ist: Drei Anschlüsse ans Wiki
1.**Vollständigkeit der Hardware-Skala.** Das Wiki hat die obere Kante (NVIDIA DGX 748 GB, [[nvidia-dgx-station-748gb.md]]) und die Mitte (AMD Strix Halo, [[edge-inference-als-cloud-alternative.md]], lokale Coding-KI, [[lokale-ki-coding.md]]). Der $8-Chip schließt die untere Kante: die Skala von „wenige hundert KB RAM" bis „748 GB unified memory" ist damit komplett. Dieselbe Technologie (Quantisierung, Gewichts-Kompression) wirkt auf allen Ebenen — nur die Modellgröße skaliert mit dem Speicher.
2.**Quantisierung als verbindendes Prinzip.** Extreme Quantisierung (1-bit / ternäre Gewichte, Flash-Streaming) ist der Hebel, der ein LLM auf einen $8-Chip bringt. Das ist das gleiche Prinzip, das [[../llm/qwen3.8-27b-alibaba.md|Qwen3.8-27B]] auf 6,2 GB (IQ1_S) schrumpft — nur noch eine Größenordnung radikaler. Wer die TinyML-Kante versteht, versteht den unteren Rand der Quantisierungs-Skala, die auch auf Consumer-Hardware wirkt.
3.**[[../../people/klaus-mainzer.md|Mainzers]] Energie-Argument wird greifbar.** [[neuromorphic-chips-und-quantencomputer.md|Prof. Mainzer]] argumentiert, das Gehirn leiste mit ~20 W, wofür LLM-Cluster Megawatt brauchen. Ein $8-Chip mit LLM in Milli- bis Watt-Klasse ist der Gegenpol zur Megawatt-Cloud: maximale Energie-Effizienz durch minimale Parameter. Nicht neuromorph, aber der extremste Ausdruck der „Token value per watt per user"-These.
## Grenzen und offene Fragen
- **Chip-Typ unbekannt:** ESP32-Klasse, RP2040/Pico, oder ein spezialisierter NPU-SoC? Nicht verifiziert.
- **Modell & Quantisierung unbekannt:** Welches Modell, welche Bit-Breite, Flash- vs. RAM-Streaming? Nicht verifiziert.
- **Reale Token-Rate:** Marketing-Zahl („läuft") vs. praktisch nutzbar (interaktiv)? Bei TinyML liegt der Sweet Spot meist unterhalb interaktiver Token-Raten.
- **Praktischer Nutzen:** Ein LLM auf einem $8-Chip ist technisch faszinierend — die Frage ist, welcher Workload davon real profitiert (embedded Klassifikation/Routing eher als echtes Reasoning).
**Offene Frage an die Gruppe:** Falls jemand das Video kennt — welcher Chip konkret, welches Modell, und wie hoch ist die reale Token-Rate? Das wäre die fachliche Kante, die diese Seite vervollständigt.
Der Kanal veröffentlichte ~2,5 Wochen später eine **neue Version derselben Serie**: [[needle2-14mb-toolcalling-esp32.md|Needle 2]] („I Can't Believe This AI Model Fits in 14 Megabytes") referenziert Video 1 explizit als „gimmick, kein echtes LLM". Kernunterschiede: 45M-Parameter (14 MB, Cactus Compute) statt 28,9M, **Tool-Calling statt Chatten** (steuert per Sprache eine LED), **2-Bit-Training von Anfang an** (statt nachträglicher Quantisierung) via Hadamard-Transform + Hashed Lookup-Tables, Confidence-Score + Refusal-Verhalten statt Drift zur Trainingsgeschichte.