ingest(youtube): needle2-14mb-toolcalling-esp32 + tinyml comparison (Netbits, Topic 27)

This commit is contained in:
Hector 2026-08-23 07:27:43 +02:00
parent 3904fe3770
commit 07d9050f80
5 changed files with 107 additions and 1 deletions

View file

@ -0,0 +1,36 @@
---
type: youtube
source_url: https://www.youtube.com/watch?v=M24yg6ZM7-I
retrieved: 2026-08-21
channel: "Better Stack"
duration_sec: 0
title: "I Can't Believe This AI Model Fits in 14 Megabytes (Needle 2)"
tags: [tinyml, microcontroller, edge-inference, esp32, quantization, tool-calling, local-ai]
---
# Needle 2 — AI-Modell in 14 MB auf einem $10-ESP32-S3
## Quelle
YouTube-Video auf dem Kanal **Better Stack** (Andres), geteilt von Netbits ⚡️ Stachelbanane (@NetLightning) im OME-Topic "Tips & Tricks" (2026-08-21, Nachfolger der Anfrage #11880 zum direkten Vergleich mit dem $8-Chip-Video). Upload ~2026-08-17. ⚠️ Metadata-only: YouTube-Bot-Schutz blockierte Transkript/Beschreibung beim Abruf; Details aus Beschreibung/öffentlich sichtbaren Metadaten.
## Kern-Fakten (aus Beschreibung/Metadaten, nicht transkribiert)
- **Modell:** 45M Parameter
- **Größe:** 14 MB Modell, von **Cactus Compute**
- **Hardware:** offline auf einem **$10 ESP32-S3** Mikrocontroller
- **Zweck:** **Tool-Calling statt Chatten** — das Modell steuert z.B. eine LED per natürlicher Sprache
- **Inference-Engine:** Custom-Engine
- **Tricks:**
- **Hadamard-Transform-Trick** + **Hashed Lookup-Tables**
- Training **von Anfang an auf 2-Bit-Präzision** (statt nachträgliche Quantisierung)
- **Output:** gibt einen **Confidence-Score** aus
- **Verhalten:** verweigert (refuses) Out-of-Scope-Fragen
## Einordnung (aus den beiden Video-Metadaten)
Video 2 (Needle 2) referenziert Video 1 ("How This Tiny $8 Chip Runs an LLM With Almost No RAM") explizit als "gimmick, kein echtes LLM" — das Needle-2-Video präsentiert sich als die echte/wetterführende Variante: Tool-Calling statt reines Chatten, 2-Bit-Training von Grund auf, Confidence-Scores, Refusal-Verhalten.
## Verweise
- Video: https://www.youtube.com/watch?v=M24yg6ZM7-I
- Kanal: Better Stack

View file

@ -1,8 +1,10 @@
---
created: 2026-08-21
updated: 2026-08-21
updated: 2026-08-23
sources:
- youtube/2026-08-21_8-dollar-chip-llm-no-ram.md
related_raw:
- youtube/2026-08-21_needle2-14mb-ai-esp32.md
tags: [concept, hardware, tinyml, microcontroller, edge-inference, quantization, local-ai, low-power]
---
@ -41,6 +43,10 @@ Das Video gehört in die Kategorie **TinyML / Mikrocontroller-Inferenz** — die
**Offene Frage an die Gruppe:** Falls jemand das Video kennt — welcher Chip konkret, welches Modell, und wie hoch ist die reale Token-Rate? Das wäre die fachliche Kante, die diese Seite vervollständigt.
## Nachfolger: Needle 2 (Tool-Calling statt Chatten)
Der Kanal veröffentlichte ~2,5 Wochen später eine **neue Version derselben Serie**: [[needle2-14mb-toolcalling-esp32.md|Needle 2]] („I Can't Believe This AI Model Fits in 14 Megabytes") referenziert Video 1 explizit als „gimmick, kein echtes LLM". Kernunterschiede: 45M-Parameter (14 MB, Cactus Compute) statt 28,9M, **Tool-Calling statt Chatten** (steuert per Sprache eine LED), **2-Bit-Training von Anfang an** (statt nachträglicher Quantisierung) via Hadamard-Transform + Hashed Lookup-Tables, Confidence-Score + Refusal-Verhalten statt Drift zur Trainingsgeschichte.
## Verwandte Wiki-Seiten
- [[edge-inference-als-cloud-alternative.md]] — obere/mittlere Kante: 235B lokal auf 128 GB

View file

@ -0,0 +1,52 @@
---
created: 2026-08-23
updated: 2026-08-23
sources:
- raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md
related_raw:
- raw/youtube/2026-08-21_8-dollar-chip-llm-no-ram.md
tags: [concept, hardware, tinyml, microcontroller, esp32, edge-inference, tool-calling, quantization, 2-bit, local-ai, low-power]
---
# Needle 2 — Tool-Calling-LLM in 14 MB auf einem $10-ESP32-S3
> **TL;DR:** Nachfolge-Video zur $8-Chip-Geschichte ([[8-dollar-chip-llm-tinyml.md]]): Ein 45M-Parameter-Modell (14 MB, von Cactus Compute) läuft offline auf einem ~$10 ESP32-S3. Anders als das Vorgänger-Video, das sich laut Needle-2-Video selbst als "gimmick, kein echtes LLM" einordnet, macht Needle 2 **Tool-Calling statt bloßem Chatten**: Das Modell steuert per natürlicher Sprache z.B. eine LED.
> ⚠️ **Metadata-only (Stand 2026-08-23):** YouTube-Bot-Schutz blockierte Transkript/Beschreibung beim ersten Abruf (2026-08-21). Details aus öffentlich sichtbaren Metadaten/Beschreibung; nicht transkribiert. Offene Frage an die Gruppe.
## Quelle
| Quelle | Kanal | Datum | Status |
|--------|-------|-------|--------|
| [Video: „I Can't Believe This AI Model Fits in 14 Megabytes"](https://www.youtube.com/watch?v=M24yg6ZM7-I) | [Better Stack](https://www.youtube.com/@betterstack) | ~2026-08-17 | ⚠️ Metadata-only |
| [Vorgänger: „How This Tiny $8 Chip Runs an LLM With Almost No RAM"](https://www.youtube.com/watch?v=0qXVMt3pIjU) | Better Stack | ~2026-08-21 | ⚠️ Metadata-only |
## Kern-Fakten (Needle 2)
- **Modell:** 45M Parameter, **14 MB**, von **Cactus Compute**
- **Hardware:** offline auf einem **~$10 ESP32-S3** Mikrocontroller
- **Zweck:** **Tool-Calling statt Chatten** — steuert per natürlicher Sprache z.B. eine LED
- **Engine:** Custom-Inference-Engine
- **Tricks:**
- **Hadamard-Transform-Trick** + **Hashed Lookup-Tables**
- Training **von Anfang an auf 2-Bit-Präzision** (nicht nachträgliche Quantisierung)
- **Output:** liefert einen **Confidence-Score**
- **Verhalten:** **refuses** (verweigert) Out-of-Scope-Fragen
## Vergleich: ESP32-LLM v1 ($8-Chip) vs. Needle 2
| Aspekt | $8-Chip / v1 (0qXVMt3pIjU) | Needle 2 (M24yg6ZM7-I) |
|--------|------------------------------|------------------------|
| Parameter | 28,9M | 45M |
| Modellgröße | (nicht im Metadatum) | **14 MB** |
| Modell-Quelle | (eigenes Training auf TinyStories) | Cactus Compute |
| Hardware | ESP32-S3 (~$8), 512 KB SRAM + 16 MB Flash | ESP32-S3 (~$10) |
| Zweck | Chatbot (generativ, Little-Girl-Geschichte) | **Tool-Calling** (steuert LED) |
| Optimierung | Embedding-Tabelle in Flash (25M von 28,9M read-only), ~450 B/Layer in SRAM | Hadamard-Transform + Hashed Lookup-Tables, **2-Bit-Training von Anfang an** |
| Speed | ~9 tok/s | (nicht im Metadaten) |
| Robustheit | Driftet immer zur Trainingsgeschichte zurück; ein Prompt pro Flash | Confidence-Score, **Refusal-Verhalten** bei Out-of-Scope |
| Eigen-Einordnung (Video 2) | „gimmick, kein echtes LLM" | die "echte" / funktionsfähige Variante |
## Einordnung
Die Needle-2-Seite verschiebt die TinyML-Kante von „extrem kleiner Chatbot" zu **funktionalem Tool-Calling auf Mikrocontroller-Niveau**. Der entscheidende Architektur-Sprung ist das **2-Bit-Training von Grund auf** (statt nachträglicher Quantisierung) + Hadamard/Lookup-Tricks, um die Modellgewichtung auf Flash-basierte Mikrocontroller zu bringen. Damit wird lokale KI für **Embedded-/IoT-Einsatz** (Offline-Intent-Erkennung, Gerätesteuerung) praktischer — nicht mehr nur Proof-of-Concept, sondern steuerbarer Ausführungsknoten. Verwandte Hardware-Kante: [[edge-inference-als-cloud-alternative.md]] (obere/mittlere Kante) vs. diese untere TinyML-Kante.

View file

@ -444,3 +444,4 @@
| `raw/blog/2026-08-20_sovereign-loop-markt-gewinnen.md` | blog | The Sovereign Loop (Rüdiger @thesovereignloop): "Wie die Hüter des Geldes auf ganzer Linie versagen" — Substack-Artikel (2026-08-19) + Markt-Update. Stand 20.08.2026 (aus Forward, nicht unabhängig verifiziert): Global Liquidity ~96,4 Bio. USD (neuer Schub), BTC-Ausbruch aus Seitwärtsstruktur, Powerlaw-Support ~63.000 USD gehalten, Powerlaw-Attraktor ~105.000 USD (BTC ~34% darunter), USD/JPY-Stress. Kern-These: Markt kontrolliert Zentralbanken. ⚠️ Exakte Substack-URL nicht verifiziert |
| `raw/blog/2026-08-21_mark-klinge-huter-des-geldes.md` | blog | Mark Klinge (markklinge.substack.com, Artikel signiert "The Sovereign Loop"): "Wie die Hüter des Geldes auf ganzer Linie versagen" — Volltext per Web-Fetch (2026-08-21). Kern-Argument: Zentralbanken können Geld aus dem Nichts schaffen und Preise lange verzerren, aber nicht die ökonomischen Konsequenzen abschaffen ("am Ende gewinnt der Markt"). Black Wednesday 1992, SNB-Mindestkurs 1.20 CHF/EUR (15.01.2015), Japan/Yen-Carry-Trade als größtes systemisches Risiko (USD/JPY), Österr. Schule (Mises/Hayek, Malinvestment, Nullzinsen/Negativzinsen/QE/YCC/steigende Staatsverschuldung), Bitcoin-Bodenregion ~60k (hält bis heute), Sovereign-Loop-Powerlaw-Modell, Krypto-Winter-Ende Herbst 2026, Halving 2028. Identität zu Rüdiger/@thesovereignloop offen |
| `raw/other/2026-08-23_pocketpal-ai-lokales-llm-smartphone.md` | other | PocketPal AI — Open-Source-App, die LLMs lokal auf dem Smartphone ausführt (GitHub a-ghorbani/pocketpal-ai, Distribution via Obtainium, kein Play Store). 'AI you own, not you rent': offline, keine Datenabflüsse, Null Telemetrie. 6GB+ RAM (8GB+ für größere Modelle), echte lokale Inferenz, kein Cloud-Wrapper. Hugging-Face-In-App-Integration. Geteilt von Netbits in OME-Topic 'Tips & Tricks' |
| `raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md` | youtube | Better Stack: "I Can't Believe This AI Model Fits in 14 Megabytes" (Needle 2, M24yg6ZM7-I) — 45M-Param-Modell (14 MB, Cactus Compute) offline auf ~$10 ESP32-S3. Tool-Calling statt Chatten (steuert LED), 2-Bit-Training von Anfang an (Hadamard + Hashed Lookup-Tables), Confidence-Score, Refusal-Verhalten. Nachfolger der $8-Chip-Serie; referenziert Video 1 als "gimmick". ⚠️ Metadata-only |

View file

@ -2284,3 +2284,14 @@ Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Über
- wiki (NEW): `wiki/tools/pocketpal-ai.md` — Tool-Seite zu PocketPal als mobile Kante der Edge-Inferenz; "AI you own, not rent"-Narrativ; Cross-Refs zu Edge-Inferenz, TinyML, lokaler Coding-KI.
- index.md: 123. Update, neue Tools-Seite, Raw-Katalog (+1).
- log: this entry
## 2026-08-23 — Needle 2 — Tool-Calling-LLM in 14 MB auf $10-ESP32 (Netbits, Topic 27)
**Type:** ingest | **Scope:** raw/youtube (1 new), wiki/concepts/hardware (1 new + 1 updated), wiki/index, wiki/log
**Source:** YouTube-Video auf Kanal Better Stack, geteilt von Netbits ⚡️ Stachelbanane im OME-Topic "Tips & Tricks" (2026-08-21, Nachfolger des $8-Chip-Videos). URL: https://www.youtube.com/watch?v=M24yg6ZM7-I
- raw (NEW): `raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md` — neutrale Rohdaten (Metadata-only, ⚠️ kein Transkript verfügbar).
- wiki (NEW): `wiki/concepts/hardware/needle2-14mb-toolcalling-esp32.md` — Konzept-Seite zu Needle 2: Tool-Calling statt Chatten, 2-Bit-Training von Anfang an, Hadamard/Lookup-Tricks, Vergleichstabelle vs. $8-Chip.
- wiki (UPDATED): `wiki/concepts/hardware/8-dollar-chip-llm-tinyml.md` — Abschnitt "Nachfolger: Needle 2" + Cross-Ref, related_raw ergänzt.
- index.md: 124. Update, neue Hardware-Konzept-Seite, Raw-Katalog (+1).
- log: this entry