knowledge-base/wiki/concepts/hardware/needle2-14mb-toolcalling-esp32.md

52 lines
3.6 KiB
Markdown

---
created: 2026-08-23
updated: 2026-08-23
sources:
- raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md
related_raw:
- raw/youtube/2026-08-21_8-dollar-chip-llm-no-ram.md
tags: [concept, hardware, tinyml, microcontroller, esp32, edge-inference, tool-calling, quantization, 2-bit, local-ai, low-power]
---
# Needle 2 — Tool-Calling-LLM in 14 MB auf einem $10-ESP32-S3
> **TL;DR:** Nachfolge-Video zur $8-Chip-Geschichte ([[8-dollar-chip-llm-tinyml.md]]): Ein 45M-Parameter-Modell (14 MB, von Cactus Compute) läuft offline auf einem ~$10 ESP32-S3. Anders als das Vorgänger-Video, das sich laut Needle-2-Video selbst als "gimmick, kein echtes LLM" einordnet, macht Needle 2 **Tool-Calling statt bloßem Chatten**: Das Modell steuert per natürlicher Sprache z.B. eine LED.
> ⚠️ **Metadata-only (Stand 2026-08-23):** YouTube-Bot-Schutz blockierte Transkript/Beschreibung beim ersten Abruf (2026-08-21). Details aus öffentlich sichtbaren Metadaten/Beschreibung; nicht transkribiert. Offene Frage an die Gruppe.
## Quelle
| Quelle | Kanal | Datum | Status |
|--------|-------|-------|--------|
| [Video: „I Can't Believe This AI Model Fits in 14 Megabytes"](https://www.youtube.com/watch?v=M24yg6ZM7-I) | [Better Stack](https://www.youtube.com/@betterstack) | ~2026-08-17 | ⚠️ Metadata-only |
| [Vorgänger: „How This Tiny $8 Chip Runs an LLM With Almost No RAM"](https://www.youtube.com/watch?v=0qXVMt3pIjU) | Better Stack | ~2026-08-21 | ⚠️ Metadata-only |
## Kern-Fakten (Needle 2)
- **Modell:** 45M Parameter, **14 MB**, von **Cactus Compute**
- **Hardware:** offline auf einem **~$10 ESP32-S3** Mikrocontroller
- **Zweck:** **Tool-Calling statt Chatten** — steuert per natürlicher Sprache z.B. eine LED
- **Engine:** Custom-Inference-Engine
- **Tricks:**
- **Hadamard-Transform-Trick** + **Hashed Lookup-Tables**
- Training **von Anfang an auf 2-Bit-Präzision** (nicht nachträgliche Quantisierung)
- **Output:** liefert einen **Confidence-Score**
- **Verhalten:** **refuses** (verweigert) Out-of-Scope-Fragen
## Vergleich: ESP32-LLM v1 ($8-Chip) vs. Needle 2
| Aspekt | $8-Chip / v1 (0qXVMt3pIjU) | Needle 2 (M24yg6ZM7-I) |
|--------|------------------------------|------------------------|
| Parameter | 28,9M | 45M |
| Modellgröße | (nicht im Metadatum) | **14 MB** |
| Modell-Quelle | (eigenes Training auf TinyStories) | Cactus Compute |
| Hardware | ESP32-S3 (~$8), 512 KB SRAM + 16 MB Flash | ESP32-S3 (~$10) |
| Zweck | Chatbot (generativ, Little-Girl-Geschichte) | **Tool-Calling** (steuert LED) |
| Optimierung | Embedding-Tabelle in Flash (25M von 28,9M read-only), ~450 B/Layer in SRAM | Hadamard-Transform + Hashed Lookup-Tables, **2-Bit-Training von Anfang an** |
| Speed | ~9 tok/s | (nicht im Metadaten) |
| Robustheit | Driftet immer zur Trainingsgeschichte zurück; ein Prompt pro Flash | Confidence-Score, **Refusal-Verhalten** bei Out-of-Scope |
| Eigen-Einordnung (Video 2) | „gimmick, kein echtes LLM" | die "echte" / funktionsfähige Variante |
## Einordnung
Die Needle-2-Seite verschiebt die TinyML-Kante von „extrem kleiner Chatbot" zu **funktionalem Tool-Calling auf Mikrocontroller-Niveau**. Der entscheidende Architektur-Sprung ist das **2-Bit-Training von Grund auf** (statt nachträglicher Quantisierung) + Hadamard/Lookup-Tricks, um die Modellgewichtung auf Flash-basierte Mikrocontroller zu bringen. Damit wird lokale KI für **Embedded-/IoT-Einsatz** (Offline-Intent-Erkennung, Gerätesteuerung) praktischer — nicht mehr nur Proof-of-Concept, sondern steuerbarer Ausführungsknoten. Verwandte Hardware-Kante: [[edge-inference-als-cloud-alternative.md]] (obere/mittlere Kante) vs. diese untere TinyML-Kante.