5.1 KiB
| created | updated | sources | related_raw | tags | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-08-21 | 2026-08-23 |
|
|
|
$8-Chip mit LLM ohne RAM — TinyML-Inferenz im Ultra-Kleinformat
TL;DR: Ein YouTube-Video von Better Stack zeigt einen extrem günstigen (~$8) Mikrocontroller-Chip, der ein LLM mit fast keinem RAM ausführt. Das ist die Ultra-Klein-Form der Edge-Inferenz (TinyML): Modelle auf Chips mit nur wenigen hundert KB bis wenigen MB RAM — möglich durch extreme Quantisierung und/oder Flash-Streaming der Gewichte.
⚠️ Metadata-only (Stand 2026-08-21): YouTube-Bot-Schutz blockierte Transkript/Beschreibung. Titel und Kanal via oEmbed bestätigt, technische Details (Chip-Typ, Modell, Token-Rate) sind nicht verifiziert. Offene Frage an die Gruppe.
Quelle
| Quelle | Kanal | Datum | Status |
|---|---|---|---|
| Video: „How This Tiny $8 Chip Runs an LLM With Almost No RAM" | Better Stack | ~2026-08-21 | ⚠️ Metadata-only |
Geteilt von: Netbits ⚡️ Stachelbanane in der OME-Gruppe, Topic "Tips & Tricks" (2026-08-21).
Einordnung: TinyML als untere Kante der Edge-Inferenz
Das Video gehört in die Kategorie TinyML / Mikrocontroller-Inferenz — die extreme Untergrenze der lokalen KI-Hardware. Während edge-inference-als-cloud-alternative.md 235B-Modelle mit 128 GB unified memory lokal betreibt (Edge-Inferenz als Cloud-Alternative), verschiebt diese Kategorie die Grenze nach unten: LLMs auf Chips der ESP32-/Raspberry-Pi-Pico-Klasse (~$8, nur wenige hundert KB RAM).
Warum das relevant ist: Drei Anschlüsse ans Wiki
-
Vollständigkeit der Hardware-Skala. Das Wiki hat die obere Kante (NVIDIA DGX 748 GB, nvidia-dgx-station-748gb.md) und die Mitte (AMD Strix Halo, edge-inference-als-cloud-alternative.md, lokale Coding-KI, lokale-ki-coding.md). Der $8-Chip schließt die untere Kante: die Skala von „wenige hundert KB RAM" bis „748 GB unified memory" ist damit komplett. Dieselbe Technologie (Quantisierung, Gewichts-Kompression) wirkt auf allen Ebenen — nur die Modellgröße skaliert mit dem Speicher.
-
Quantisierung als verbindendes Prinzip. Extreme Quantisierung (1-bit / ternäre Gewichte, Flash-Streaming) ist der Hebel, der ein LLM auf einen $8-Chip bringt. Das ist das gleiche Prinzip, das ../llm/qwen3.8-27b-alibaba.md auf 6,2 GB (IQ1_S) schrumpft — nur noch eine Größenordnung radikaler. Wer die TinyML-Kante versteht, versteht den unteren Rand der Quantisierungs-Skala, die auch auf Consumer-Hardware wirkt.
-
../../people/klaus-mainzer.md Energie-Argument wird greifbar. neuromorphic-chips-und-quantencomputer.md argumentiert, das Gehirn leiste mit ~20 W, wofür LLM-Cluster Megawatt brauchen. Ein $8-Chip mit LLM in Milli- bis Watt-Klasse ist der Gegenpol zur Megawatt-Cloud: maximale Energie-Effizienz durch minimale Parameter. Nicht neuromorph, aber der extremste Ausdruck der „Token value per watt per user"-These.
Grenzen und offene Fragen
- Chip-Typ unbekannt: ESP32-Klasse, RP2040/Pico, oder ein spezialisierter NPU-SoC? Nicht verifiziert.
- Modell & Quantisierung unbekannt: Welches Modell, welche Bit-Breite, Flash- vs. RAM-Streaming? Nicht verifiziert.
- Reale Token-Rate: Marketing-Zahl („läuft") vs. praktisch nutzbar (interaktiv)? Bei TinyML liegt der Sweet Spot meist unterhalb interaktiver Token-Raten.
- Praktischer Nutzen: Ein LLM auf einem $8-Chip ist technisch faszinierend — die Frage ist, welcher Workload davon real profitiert (embedded Klassifikation/Routing eher als echtes Reasoning).
Offene Frage an die Gruppe: Falls jemand das Video kennt — welcher Chip konkret, welches Modell, und wie hoch ist die reale Token-Rate? Das wäre die fachliche Kante, die diese Seite vervollständigt.
Nachfolger: Needle 2 (Tool-Calling statt Chatten)
Der Kanal veröffentlichte ~2,5 Wochen später eine neue Version derselben Serie: needle2-14mb-toolcalling-esp32.md („I Can't Believe This AI Model Fits in 14 Megabytes") referenziert Video 1 explizit als „gimmick, kein echtes LLM". Kernunterschiede: 45M-Parameter (14 MB, Cactus Compute) statt 28,9M, Tool-Calling statt Chatten (steuert per Sprache eine LED), 2-Bit-Training von Anfang an (statt nachträglicher Quantisierung) via Hadamard-Transform + Hashed Lookup-Tables, Confidence-Score + Refusal-Verhalten statt Drift zur Trainingsgeschichte.
Verwandte Wiki-Seiten
- edge-inference-als-cloud-alternative.md — obere/mittlere Kante: 235B lokal auf 128 GB
- nvidia-dgx-station-748gb.md — 748 GB unified memory Desktop
- cloud-exit-and-local-superiority.md — lokale Überlegenheit, RAM als Währung
- lokale-ki-coding.md — lokale KI zum Coding, Hardware als Kostenfaktor
- neuromorphic-chips-und-quantencomputer.md — Energie-Argument, 20W-Gehirn
- ../llm/qwen3.8-27b-alibaba.md — Quantisierung als Kompressions-Hebel