| created |
updated |
sources |
related_raw |
tags |
| 2026-08-23 |
2026-08-23 |
| raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md |
|
| raw/youtube/2026-08-21_8-dollar-chip-llm-no-ram.md |
|
| concept |
| hardware |
| tinyml |
| microcontroller |
| esp32 |
| edge-inference |
| tool-calling |
| quantization |
| 2-bit |
| local-ai |
| low-power |
|
Needle 2 — Tool-Calling-LLM in 14 MB auf einem $10-ESP32-S3
TL;DR: Nachfolge-Video zur $8-Chip-Geschichte (8-dollar-chip-llm-tinyml.md): Ein 45M-Parameter-Modell (14 MB, von Cactus Compute) läuft offline auf einem ~$10 ESP32-S3. Anders als das Vorgänger-Video, das sich laut Needle-2-Video selbst als "gimmick, kein echtes LLM" einordnet, macht Needle 2 Tool-Calling statt bloßem Chatten: Das Modell steuert per natürlicher Sprache z.B. eine LED.
⚠️ Metadata-only (Stand 2026-08-23): YouTube-Bot-Schutz blockierte Transkript/Beschreibung beim ersten Abruf (2026-08-21). Details aus öffentlich sichtbaren Metadaten/Beschreibung; nicht transkribiert. Offene Frage an die Gruppe.
Quelle
Kern-Fakten (Needle 2)
- Modell: 45M Parameter, 14 MB, von Cactus Compute
- Hardware: offline auf einem ~$10 ESP32-S3 Mikrocontroller
- Zweck: Tool-Calling statt Chatten — steuert per natürlicher Sprache z.B. eine LED
- Engine: Custom-Inference-Engine
- Tricks:
- Hadamard-Transform-Trick + Hashed Lookup-Tables
- Training von Anfang an auf 2-Bit-Präzision (nicht nachträgliche Quantisierung)
- Output: liefert einen Confidence-Score
- Verhalten: refuses (verweigert) Out-of-Scope-Fragen
Vergleich: ESP32-LLM v1 ($8-Chip) vs. Needle 2
| Aspekt |
$8-Chip / v1 (0qXVMt3pIjU) |
Needle 2 (M24yg6ZM7-I) |
| Parameter |
28,9M |
45M |
| Modellgröße |
(nicht im Metadatum) |
14 MB |
| Modell-Quelle |
(eigenes Training auf TinyStories) |
Cactus Compute |
| Hardware |
ESP32-S3 (~$8), 512 KB SRAM + 16 MB Flash |
ESP32-S3 (~$10) |
| Zweck |
Chatbot (generativ, Little-Girl-Geschichte) |
Tool-Calling (steuert LED) |
| Optimierung |
Embedding-Tabelle in Flash (25M von 28,9M read-only), ~450 B/Layer in SRAM |
Hadamard-Transform + Hashed Lookup-Tables, 2-Bit-Training von Anfang an |
| Speed |
~9 tok/s |
(nicht im Metadaten) |
| Robustheit |
Driftet immer zur Trainingsgeschichte zurück; ein Prompt pro Flash |
Confidence-Score, Refusal-Verhalten bei Out-of-Scope |
| Eigen-Einordnung (Video 2) |
„gimmick, kein echtes LLM" |
die "echte" / funktionsfähige Variante |
Einordnung
Die Needle-2-Seite verschiebt die TinyML-Kante von „extrem kleiner Chatbot" zu funktionalem Tool-Calling auf Mikrocontroller-Niveau. Der entscheidende Architektur-Sprung ist das 2-Bit-Training von Grund auf (statt nachträglicher Quantisierung) + Hadamard/Lookup-Tricks, um die Modellgewichtung auf Flash-basierte Mikrocontroller zu bringen. Damit wird lokale KI für Embedded-/IoT-Einsatz (Offline-Intent-Erkennung, Gerätesteuerung) praktischer — nicht mehr nur Proof-of-Concept, sondern steuerbarer Ausführungsknoten. Verwandte Hardware-Kante: edge-inference-als-cloud-alternative.md (obere/mittlere Kante) vs. diese untere TinyML-Kante.