knowledge-base/wiki/concepts/hardware/needle2-14mb-toolcalling-esp32.md

3.6 KiB

created updated sources related_raw tags
2026-08-23 2026-08-23
raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md
raw/youtube/2026-08-21_8-dollar-chip-llm-no-ram.md
concept
hardware
tinyml
microcontroller
esp32
edge-inference
tool-calling
quantization
2-bit
local-ai
low-power

Needle 2 — Tool-Calling-LLM in 14 MB auf einem $10-ESP32-S3

TL;DR: Nachfolge-Video zur $8-Chip-Geschichte (8-dollar-chip-llm-tinyml.md): Ein 45M-Parameter-Modell (14 MB, von Cactus Compute) läuft offline auf einem ~$10 ESP32-S3. Anders als das Vorgänger-Video, das sich laut Needle-2-Video selbst als "gimmick, kein echtes LLM" einordnet, macht Needle 2 Tool-Calling statt bloßem Chatten: Das Modell steuert per natürlicher Sprache z.B. eine LED.

⚠️ Metadata-only (Stand 2026-08-23): YouTube-Bot-Schutz blockierte Transkript/Beschreibung beim ersten Abruf (2026-08-21). Details aus öffentlich sichtbaren Metadaten/Beschreibung; nicht transkribiert. Offene Frage an die Gruppe.

Quelle

Quelle Kanal Datum Status
Video: „I Can't Believe This AI Model Fits in 14 Megabytes" Better Stack ~2026-08-17 ⚠️ Metadata-only
Vorgänger: „How This Tiny $8 Chip Runs an LLM With Almost No RAM" Better Stack ~2026-08-21 ⚠️ Metadata-only

Kern-Fakten (Needle 2)

  • Modell: 45M Parameter, 14 MB, von Cactus Compute
  • Hardware: offline auf einem ~$10 ESP32-S3 Mikrocontroller
  • Zweck: Tool-Calling statt Chatten — steuert per natürlicher Sprache z.B. eine LED
  • Engine: Custom-Inference-Engine
  • Tricks:
    • Hadamard-Transform-Trick + Hashed Lookup-Tables
    • Training von Anfang an auf 2-Bit-Präzision (nicht nachträgliche Quantisierung)
  • Output: liefert einen Confidence-Score
  • Verhalten: refuses (verweigert) Out-of-Scope-Fragen

Vergleich: ESP32-LLM v1 ($8-Chip) vs. Needle 2

Aspekt $8-Chip / v1 (0qXVMt3pIjU) Needle 2 (M24yg6ZM7-I)
Parameter 28,9M 45M
Modellgröße (nicht im Metadatum) 14 MB
Modell-Quelle (eigenes Training auf TinyStories) Cactus Compute
Hardware ESP32-S3 (~$8), 512 KB SRAM + 16 MB Flash ESP32-S3 (~$10)
Zweck Chatbot (generativ, Little-Girl-Geschichte) Tool-Calling (steuert LED)
Optimierung Embedding-Tabelle in Flash (25M von 28,9M read-only), ~450 B/Layer in SRAM Hadamard-Transform + Hashed Lookup-Tables, 2-Bit-Training von Anfang an
Speed ~9 tok/s (nicht im Metadaten)
Robustheit Driftet immer zur Trainingsgeschichte zurück; ein Prompt pro Flash Confidence-Score, Refusal-Verhalten bei Out-of-Scope
Eigen-Einordnung (Video 2) „gimmick, kein echtes LLM" die "echte" / funktionsfähige Variante

Einordnung

Die Needle-2-Seite verschiebt die TinyML-Kante von „extrem kleiner Chatbot" zu funktionalem Tool-Calling auf Mikrocontroller-Niveau. Der entscheidende Architektur-Sprung ist das 2-Bit-Training von Grund auf (statt nachträglicher Quantisierung) + Hadamard/Lookup-Tricks, um die Modellgewichtung auf Flash-basierte Mikrocontroller zu bringen. Damit wird lokale KI für Embedded-/IoT-Einsatz (Offline-Intent-Erkennung, Gerätesteuerung) praktischer — nicht mehr nur Proof-of-Concept, sondern steuerbarer Ausführungsknoten. Verwandte Hardware-Kante: edge-inference-als-cloud-alternative.md (obere/mittlere Kante) vs. diese untere TinyML-Kante.