1.8 KiB
1.8 KiB
| type | source_url | retrieved | channel | duration_sec | title | tags | |||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| youtube | https://www.youtube.com/watch?v=M24yg6ZM7-I | 2026-08-21 | Better Stack | 0 | I Can't Believe This AI Model Fits in 14 Megabytes (Needle 2) |
|
Needle 2 — AI-Modell in 14 MB auf einem $10-ESP32-S3
Quelle
YouTube-Video auf dem Kanal Better Stack (Andres), geteilt von Netbits ⚡️ Stachelbanane (@NetLightning) im OME-Topic "Tips & Tricks" (2026-08-21, Nachfolger der Anfrage #11880 zum direkten Vergleich mit dem $8-Chip-Video). Upload ~2026-08-17. ⚠️ Metadata-only: YouTube-Bot-Schutz blockierte Transkript/Beschreibung beim Abruf; Details aus Beschreibung/öffentlich sichtbaren Metadaten.
Kern-Fakten (aus Beschreibung/Metadaten, nicht transkribiert)
- Modell: 45M Parameter
- Größe: 14 MB Modell, von Cactus Compute
- Hardware: offline auf einem $10 ESP32-S3 Mikrocontroller
- Zweck: Tool-Calling statt Chatten — das Modell steuert z.B. eine LED per natürlicher Sprache
- Inference-Engine: Custom-Engine
- Tricks:
- Hadamard-Transform-Trick + Hashed Lookup-Tables
- Training von Anfang an auf 2-Bit-Präzision (statt nachträgliche Quantisierung)
- Output: gibt einen Confidence-Score aus
- Verhalten: verweigert (refuses) Out-of-Scope-Fragen
Einordnung (aus den beiden Video-Metadaten)
Video 2 (Needle 2) referenziert Video 1 ("How This Tiny $8 Chip Runs an LLM With Almost No RAM") explizit als "gimmick, kein echtes LLM" — das Needle-2-Video präsentiert sich als die echte/wetterführende Variante: Tool-Calling statt reines Chatten, 2-Bit-Training von Grund auf, Confidence-Scores, Refusal-Verhalten.
Verweise
- Video: https://www.youtube.com/watch?v=M24yg6ZM7-I
- Kanal: Better Stack