knowledge-base/raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md

36 lines
1.8 KiB
Markdown

---
type: youtube
source_url: https://www.youtube.com/watch?v=M24yg6ZM7-I
retrieved: 2026-08-21
channel: "Better Stack"
duration_sec: 0
title: "I Can't Believe This AI Model Fits in 14 Megabytes (Needle 2)"
tags: [tinyml, microcontroller, edge-inference, esp32, quantization, tool-calling, local-ai]
---
# Needle 2 — AI-Modell in 14 MB auf einem $10-ESP32-S3
## Quelle
YouTube-Video auf dem Kanal **Better Stack** (Andres), geteilt von Netbits ⚡️ Stachelbanane (@NetLightning) im OME-Topic "Tips & Tricks" (2026-08-21, Nachfolger der Anfrage #11880 zum direkten Vergleich mit dem $8-Chip-Video). Upload ~2026-08-17. ⚠️ Metadata-only: YouTube-Bot-Schutz blockierte Transkript/Beschreibung beim Abruf; Details aus Beschreibung/öffentlich sichtbaren Metadaten.
## Kern-Fakten (aus Beschreibung/Metadaten, nicht transkribiert)
- **Modell:** 45M Parameter
- **Größe:** 14 MB Modell, von **Cactus Compute**
- **Hardware:** offline auf einem **$10 ESP32-S3** Mikrocontroller
- **Zweck:** **Tool-Calling statt Chatten** — das Modell steuert z.B. eine LED per natürlicher Sprache
- **Inference-Engine:** Custom-Engine
- **Tricks:**
- **Hadamard-Transform-Trick** + **Hashed Lookup-Tables**
- Training **von Anfang an auf 2-Bit-Präzision** (statt nachträgliche Quantisierung)
- **Output:** gibt einen **Confidence-Score** aus
- **Verhalten:** verweigert (refuses) Out-of-Scope-Fragen
## Einordnung (aus den beiden Video-Metadaten)
Video 2 (Needle 2) referenziert Video 1 ("How This Tiny $8 Chip Runs an LLM With Almost No RAM") explizit als "gimmick, kein echtes LLM" — das Needle-2-Video präsentiert sich als die echte/wetterführende Variante: Tool-Calling statt reines Chatten, 2-Bit-Training von Grund auf, Confidence-Scores, Refusal-Verhalten.
## Verweise
- Video: https://www.youtube.com/watch?v=M24yg6ZM7-I
- Kanal: Better Stack