knowledge-base/raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md

1.8 KiB
Raw Blame History

type source_url retrieved channel duration_sec title tags
youtube https://www.youtube.com/watch?v=M24yg6ZM7-I 2026-08-21 Better Stack 0 I Can't Believe This AI Model Fits in 14 Megabytes (Needle 2)
tinyml
microcontroller
edge-inference
esp32
quantization
tool-calling
local-ai

Needle 2 — AI-Modell in 14 MB auf einem $10-ESP32-S3

Quelle

YouTube-Video auf dem Kanal Better Stack (Andres), geteilt von Netbits Stachelbanane (@NetLightning) im OME-Topic "Tips & Tricks" (2026-08-21, Nachfolger der Anfrage #11880 zum direkten Vergleich mit dem $8-Chip-Video). Upload ~2026-08-17. ⚠️ Metadata-only: YouTube-Bot-Schutz blockierte Transkript/Beschreibung beim Abruf; Details aus Beschreibung/öffentlich sichtbaren Metadaten.

Kern-Fakten (aus Beschreibung/Metadaten, nicht transkribiert)

  • Modell: 45M Parameter
  • Größe: 14 MB Modell, von Cactus Compute
  • Hardware: offline auf einem $10 ESP32-S3 Mikrocontroller
  • Zweck: Tool-Calling statt Chatten — das Modell steuert z.B. eine LED per natürlicher Sprache
  • Inference-Engine: Custom-Engine
  • Tricks:
    • Hadamard-Transform-Trick + Hashed Lookup-Tables
    • Training von Anfang an auf 2-Bit-Präzision (statt nachträgliche Quantisierung)
  • Output: gibt einen Confidence-Score aus
  • Verhalten: verweigert (refuses) Out-of-Scope-Fragen

Einordnung (aus den beiden Video-Metadaten)

Video 2 (Needle 2) referenziert Video 1 ("How This Tiny $8 Chip Runs an LLM With Almost No RAM") explizit als "gimmick, kein echtes LLM" — das Needle-2-Video präsentiert sich als die echte/wetterführende Variante: Tool-Calling statt reines Chatten, 2-Bit-Training von Grund auf, Confidence-Scores, Refusal-Verhalten.

Verweise