--- created: 2026-08-23 updated: 2026-08-23 sources: - raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md related_raw: - raw/youtube/2026-08-21_8-dollar-chip-llm-no-ram.md tags: [concept, hardware, tinyml, microcontroller, esp32, edge-inference, tool-calling, quantization, 2-bit, local-ai, low-power] --- # Needle 2 — Tool-Calling-LLM in 14 MB auf einem $10-ESP32-S3 > **TL;DR:** Nachfolge-Video zur $8-Chip-Geschichte ([[8-dollar-chip-llm-tinyml.md]]): Ein 45M-Parameter-Modell (14 MB, von Cactus Compute) läuft offline auf einem ~$10 ESP32-S3. Anders als das Vorgänger-Video, das sich laut Needle-2-Video selbst als "gimmick, kein echtes LLM" einordnet, macht Needle 2 **Tool-Calling statt bloßem Chatten**: Das Modell steuert per natürlicher Sprache z.B. eine LED. > ⚠️ **Metadata-only (Stand 2026-08-23):** YouTube-Bot-Schutz blockierte Transkript/Beschreibung beim ersten Abruf (2026-08-21). Details aus öffentlich sichtbaren Metadaten/Beschreibung; nicht transkribiert. Offene Frage an die Gruppe. ## Quelle | Quelle | Kanal | Datum | Status | |--------|-------|-------|--------| | [Video: „I Can't Believe This AI Model Fits in 14 Megabytes"](https://www.youtube.com/watch?v=M24yg6ZM7-I) | [Better Stack](https://www.youtube.com/@betterstack) | ~2026-08-17 | ⚠️ Metadata-only | | [Vorgänger: „How This Tiny $8 Chip Runs an LLM With Almost No RAM"](https://www.youtube.com/watch?v=0qXVMt3pIjU) | Better Stack | ~2026-08-21 | ⚠️ Metadata-only | ## Kern-Fakten (Needle 2) - **Modell:** 45M Parameter, **14 MB**, von **Cactus Compute** - **Hardware:** offline auf einem **~$10 ESP32-S3** Mikrocontroller - **Zweck:** **Tool-Calling statt Chatten** — steuert per natürlicher Sprache z.B. eine LED - **Engine:** Custom-Inference-Engine - **Tricks:** - **Hadamard-Transform-Trick** + **Hashed Lookup-Tables** - Training **von Anfang an auf 2-Bit-Präzision** (nicht nachträgliche Quantisierung) - **Output:** liefert einen **Confidence-Score** - **Verhalten:** **refuses** (verweigert) Out-of-Scope-Fragen ## Vergleich: ESP32-LLM v1 ($8-Chip) vs. Needle 2 | Aspekt | $8-Chip / v1 (0qXVMt3pIjU) | Needle 2 (M24yg6ZM7-I) | |--------|------------------------------|------------------------| | Parameter | 28,9M | 45M | | Modellgröße | (nicht im Metadatum) | **14 MB** | | Modell-Quelle | (eigenes Training auf TinyStories) | Cactus Compute | | Hardware | ESP32-S3 (~$8), 512 KB SRAM + 16 MB Flash | ESP32-S3 (~$10) | | Zweck | Chatbot (generativ, Little-Girl-Geschichte) | **Tool-Calling** (steuert LED) | | Optimierung | Embedding-Tabelle in Flash (25M von 28,9M read-only), ~450 B/Layer in SRAM | Hadamard-Transform + Hashed Lookup-Tables, **2-Bit-Training von Anfang an** | | Speed | ~9 tok/s | (nicht im Metadaten) | | Robustheit | Driftet immer zur Trainingsgeschichte zurück; ein Prompt pro Flash | Confidence-Score, **Refusal-Verhalten** bei Out-of-Scope | | Eigen-Einordnung (Video 2) | „gimmick, kein echtes LLM" | die "echte" / funktionsfähige Variante | ## Einordnung Die Needle-2-Seite verschiebt die TinyML-Kante von „extrem kleiner Chatbot" zu **funktionalem Tool-Calling auf Mikrocontroller-Niveau**. Der entscheidende Architektur-Sprung ist das **2-Bit-Training von Grund auf** (statt nachträglicher Quantisierung) + Hadamard/Lookup-Tricks, um die Modellgewichtung auf Flash-basierte Mikrocontroller zu bringen. Damit wird lokale KI für **Embedded-/IoT-Einsatz** (Offline-Intent-Erkennung, Gerätesteuerung) praktischer — nicht mehr nur Proof-of-Concept, sondern steuerbarer Ausführungsknoten. Verwandte Hardware-Kante: [[edge-inference-als-cloud-alternative.md]] (obere/mittlere Kante) vs. diese untere TinyML-Kante.