ingest(youtube): needle2-14mb-toolcalling-esp32 + tinyml comparison (Netbits, Topic 27)
This commit is contained in:
parent
3904fe3770
commit
07d9050f80
5 changed files with 107 additions and 1 deletions
36
raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md
Normal file
36
raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md
Normal file
|
|
@ -0,0 +1,36 @@
|
||||||
|
---
|
||||||
|
type: youtube
|
||||||
|
source_url: https://www.youtube.com/watch?v=M24yg6ZM7-I
|
||||||
|
retrieved: 2026-08-21
|
||||||
|
channel: "Better Stack"
|
||||||
|
duration_sec: 0
|
||||||
|
title: "I Can't Believe This AI Model Fits in 14 Megabytes (Needle 2)"
|
||||||
|
tags: [tinyml, microcontroller, edge-inference, esp32, quantization, tool-calling, local-ai]
|
||||||
|
---
|
||||||
|
|
||||||
|
# Needle 2 — AI-Modell in 14 MB auf einem $10-ESP32-S3
|
||||||
|
|
||||||
|
## Quelle
|
||||||
|
YouTube-Video auf dem Kanal **Better Stack** (Andres), geteilt von Netbits ⚡️ Stachelbanane (@NetLightning) im OME-Topic "Tips & Tricks" (2026-08-21, Nachfolger der Anfrage #11880 zum direkten Vergleich mit dem $8-Chip-Video). Upload ~2026-08-17. ⚠️ Metadata-only: YouTube-Bot-Schutz blockierte Transkript/Beschreibung beim Abruf; Details aus Beschreibung/öffentlich sichtbaren Metadaten.
|
||||||
|
|
||||||
|
## Kern-Fakten (aus Beschreibung/Metadaten, nicht transkribiert)
|
||||||
|
|
||||||
|
- **Modell:** 45M Parameter
|
||||||
|
- **Größe:** 14 MB Modell, von **Cactus Compute**
|
||||||
|
- **Hardware:** offline auf einem **$10 ESP32-S3** Mikrocontroller
|
||||||
|
- **Zweck:** **Tool-Calling statt Chatten** — das Modell steuert z.B. eine LED per natürlicher Sprache
|
||||||
|
- **Inference-Engine:** Custom-Engine
|
||||||
|
- **Tricks:**
|
||||||
|
- **Hadamard-Transform-Trick** + **Hashed Lookup-Tables**
|
||||||
|
- Training **von Anfang an auf 2-Bit-Präzision** (statt nachträgliche Quantisierung)
|
||||||
|
- **Output:** gibt einen **Confidence-Score** aus
|
||||||
|
- **Verhalten:** verweigert (refuses) Out-of-Scope-Fragen
|
||||||
|
|
||||||
|
## Einordnung (aus den beiden Video-Metadaten)
|
||||||
|
|
||||||
|
Video 2 (Needle 2) referenziert Video 1 ("How This Tiny $8 Chip Runs an LLM With Almost No RAM") explizit als "gimmick, kein echtes LLM" — das Needle-2-Video präsentiert sich als die echte/wetterführende Variante: Tool-Calling statt reines Chatten, 2-Bit-Training von Grund auf, Confidence-Scores, Refusal-Verhalten.
|
||||||
|
|
||||||
|
## Verweise
|
||||||
|
|
||||||
|
- Video: https://www.youtube.com/watch?v=M24yg6ZM7-I
|
||||||
|
- Kanal: Better Stack
|
||||||
|
|
@ -1,8 +1,10 @@
|
||||||
---
|
---
|
||||||
created: 2026-08-21
|
created: 2026-08-21
|
||||||
updated: 2026-08-21
|
updated: 2026-08-23
|
||||||
sources:
|
sources:
|
||||||
- youtube/2026-08-21_8-dollar-chip-llm-no-ram.md
|
- youtube/2026-08-21_8-dollar-chip-llm-no-ram.md
|
||||||
|
related_raw:
|
||||||
|
- youtube/2026-08-21_needle2-14mb-ai-esp32.md
|
||||||
tags: [concept, hardware, tinyml, microcontroller, edge-inference, quantization, local-ai, low-power]
|
tags: [concept, hardware, tinyml, microcontroller, edge-inference, quantization, local-ai, low-power]
|
||||||
---
|
---
|
||||||
|
|
||||||
|
|
@ -41,6 +43,10 @@ Das Video gehört in die Kategorie **TinyML / Mikrocontroller-Inferenz** — die
|
||||||
|
|
||||||
**Offene Frage an die Gruppe:** Falls jemand das Video kennt — welcher Chip konkret, welches Modell, und wie hoch ist die reale Token-Rate? Das wäre die fachliche Kante, die diese Seite vervollständigt.
|
**Offene Frage an die Gruppe:** Falls jemand das Video kennt — welcher Chip konkret, welches Modell, und wie hoch ist die reale Token-Rate? Das wäre die fachliche Kante, die diese Seite vervollständigt.
|
||||||
|
|
||||||
|
## Nachfolger: Needle 2 (Tool-Calling statt Chatten)
|
||||||
|
|
||||||
|
Der Kanal veröffentlichte ~2,5 Wochen später eine **neue Version derselben Serie**: [[needle2-14mb-toolcalling-esp32.md|Needle 2]] („I Can't Believe This AI Model Fits in 14 Megabytes") referenziert Video 1 explizit als „gimmick, kein echtes LLM". Kernunterschiede: 45M-Parameter (14 MB, Cactus Compute) statt 28,9M, **Tool-Calling statt Chatten** (steuert per Sprache eine LED), **2-Bit-Training von Anfang an** (statt nachträglicher Quantisierung) via Hadamard-Transform + Hashed Lookup-Tables, Confidence-Score + Refusal-Verhalten statt Drift zur Trainingsgeschichte.
|
||||||
|
|
||||||
## Verwandte Wiki-Seiten
|
## Verwandte Wiki-Seiten
|
||||||
|
|
||||||
- [[edge-inference-als-cloud-alternative.md]] — obere/mittlere Kante: 235B lokal auf 128 GB
|
- [[edge-inference-als-cloud-alternative.md]] — obere/mittlere Kante: 235B lokal auf 128 GB
|
||||||
|
|
|
||||||
52
wiki/concepts/hardware/needle2-14mb-toolcalling-esp32.md
Normal file
52
wiki/concepts/hardware/needle2-14mb-toolcalling-esp32.md
Normal file
|
|
@ -0,0 +1,52 @@
|
||||||
|
---
|
||||||
|
created: 2026-08-23
|
||||||
|
updated: 2026-08-23
|
||||||
|
sources:
|
||||||
|
- raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md
|
||||||
|
related_raw:
|
||||||
|
- raw/youtube/2026-08-21_8-dollar-chip-llm-no-ram.md
|
||||||
|
tags: [concept, hardware, tinyml, microcontroller, esp32, edge-inference, tool-calling, quantization, 2-bit, local-ai, low-power]
|
||||||
|
---
|
||||||
|
|
||||||
|
# Needle 2 — Tool-Calling-LLM in 14 MB auf einem $10-ESP32-S3
|
||||||
|
|
||||||
|
> **TL;DR:** Nachfolge-Video zur $8-Chip-Geschichte ([[8-dollar-chip-llm-tinyml.md]]): Ein 45M-Parameter-Modell (14 MB, von Cactus Compute) läuft offline auf einem ~$10 ESP32-S3. Anders als das Vorgänger-Video, das sich laut Needle-2-Video selbst als "gimmick, kein echtes LLM" einordnet, macht Needle 2 **Tool-Calling statt bloßem Chatten**: Das Modell steuert per natürlicher Sprache z.B. eine LED.
|
||||||
|
|
||||||
|
> ⚠️ **Metadata-only (Stand 2026-08-23):** YouTube-Bot-Schutz blockierte Transkript/Beschreibung beim ersten Abruf (2026-08-21). Details aus öffentlich sichtbaren Metadaten/Beschreibung; nicht transkribiert. Offene Frage an die Gruppe.
|
||||||
|
|
||||||
|
## Quelle
|
||||||
|
|
||||||
|
| Quelle | Kanal | Datum | Status |
|
||||||
|
|--------|-------|-------|--------|
|
||||||
|
| [Video: „I Can't Believe This AI Model Fits in 14 Megabytes"](https://www.youtube.com/watch?v=M24yg6ZM7-I) | [Better Stack](https://www.youtube.com/@betterstack) | ~2026-08-17 | ⚠️ Metadata-only |
|
||||||
|
| [Vorgänger: „How This Tiny $8 Chip Runs an LLM With Almost No RAM"](https://www.youtube.com/watch?v=0qXVMt3pIjU) | Better Stack | ~2026-08-21 | ⚠️ Metadata-only |
|
||||||
|
|
||||||
|
## Kern-Fakten (Needle 2)
|
||||||
|
|
||||||
|
- **Modell:** 45M Parameter, **14 MB**, von **Cactus Compute**
|
||||||
|
- **Hardware:** offline auf einem **~$10 ESP32-S3** Mikrocontroller
|
||||||
|
- **Zweck:** **Tool-Calling statt Chatten** — steuert per natürlicher Sprache z.B. eine LED
|
||||||
|
- **Engine:** Custom-Inference-Engine
|
||||||
|
- **Tricks:**
|
||||||
|
- **Hadamard-Transform-Trick** + **Hashed Lookup-Tables**
|
||||||
|
- Training **von Anfang an auf 2-Bit-Präzision** (nicht nachträgliche Quantisierung)
|
||||||
|
- **Output:** liefert einen **Confidence-Score**
|
||||||
|
- **Verhalten:** **refuses** (verweigert) Out-of-Scope-Fragen
|
||||||
|
|
||||||
|
## Vergleich: ESP32-LLM v1 ($8-Chip) vs. Needle 2
|
||||||
|
|
||||||
|
| Aspekt | $8-Chip / v1 (0qXVMt3pIjU) | Needle 2 (M24yg6ZM7-I) |
|
||||||
|
|--------|------------------------------|------------------------|
|
||||||
|
| Parameter | 28,9M | 45M |
|
||||||
|
| Modellgröße | (nicht im Metadatum) | **14 MB** |
|
||||||
|
| Modell-Quelle | (eigenes Training auf TinyStories) | Cactus Compute |
|
||||||
|
| Hardware | ESP32-S3 (~$8), 512 KB SRAM + 16 MB Flash | ESP32-S3 (~$10) |
|
||||||
|
| Zweck | Chatbot (generativ, Little-Girl-Geschichte) | **Tool-Calling** (steuert LED) |
|
||||||
|
| Optimierung | Embedding-Tabelle in Flash (25M von 28,9M read-only), ~450 B/Layer in SRAM | Hadamard-Transform + Hashed Lookup-Tables, **2-Bit-Training von Anfang an** |
|
||||||
|
| Speed | ~9 tok/s | (nicht im Metadaten) |
|
||||||
|
| Robustheit | Driftet immer zur Trainingsgeschichte zurück; ein Prompt pro Flash | Confidence-Score, **Refusal-Verhalten** bei Out-of-Scope |
|
||||||
|
| Eigen-Einordnung (Video 2) | „gimmick, kein echtes LLM" | die "echte" / funktionsfähige Variante |
|
||||||
|
|
||||||
|
## Einordnung
|
||||||
|
|
||||||
|
Die Needle-2-Seite verschiebt die TinyML-Kante von „extrem kleiner Chatbot" zu **funktionalem Tool-Calling auf Mikrocontroller-Niveau**. Der entscheidende Architektur-Sprung ist das **2-Bit-Training von Grund auf** (statt nachträglicher Quantisierung) + Hadamard/Lookup-Tricks, um die Modellgewichtung auf Flash-basierte Mikrocontroller zu bringen. Damit wird lokale KI für **Embedded-/IoT-Einsatz** (Offline-Intent-Erkennung, Gerätesteuerung) praktischer — nicht mehr nur Proof-of-Concept, sondern steuerbarer Ausführungsknoten. Verwandte Hardware-Kante: [[edge-inference-als-cloud-alternative.md]] (obere/mittlere Kante) vs. diese untere TinyML-Kante.
|
||||||
|
|
@ -444,3 +444,4 @@
|
||||||
| `raw/blog/2026-08-20_sovereign-loop-markt-gewinnen.md` | blog | The Sovereign Loop (Rüdiger @thesovereignloop): "Wie die Hüter des Geldes auf ganzer Linie versagen" — Substack-Artikel (2026-08-19) + Markt-Update. Stand 20.08.2026 (aus Forward, nicht unabhängig verifiziert): Global Liquidity ~96,4 Bio. USD (neuer Schub), BTC-Ausbruch aus Seitwärtsstruktur, Powerlaw-Support ~63.000 USD gehalten, Powerlaw-Attraktor ~105.000 USD (BTC ~34% darunter), USD/JPY-Stress. Kern-These: Markt kontrolliert Zentralbanken. ⚠️ Exakte Substack-URL nicht verifiziert |
|
| `raw/blog/2026-08-20_sovereign-loop-markt-gewinnen.md` | blog | The Sovereign Loop (Rüdiger @thesovereignloop): "Wie die Hüter des Geldes auf ganzer Linie versagen" — Substack-Artikel (2026-08-19) + Markt-Update. Stand 20.08.2026 (aus Forward, nicht unabhängig verifiziert): Global Liquidity ~96,4 Bio. USD (neuer Schub), BTC-Ausbruch aus Seitwärtsstruktur, Powerlaw-Support ~63.000 USD gehalten, Powerlaw-Attraktor ~105.000 USD (BTC ~34% darunter), USD/JPY-Stress. Kern-These: Markt kontrolliert Zentralbanken. ⚠️ Exakte Substack-URL nicht verifiziert |
|
||||||
| `raw/blog/2026-08-21_mark-klinge-huter-des-geldes.md` | blog | Mark Klinge (markklinge.substack.com, Artikel signiert "The Sovereign Loop"): "Wie die Hüter des Geldes auf ganzer Linie versagen" — Volltext per Web-Fetch (2026-08-21). Kern-Argument: Zentralbanken können Geld aus dem Nichts schaffen und Preise lange verzerren, aber nicht die ökonomischen Konsequenzen abschaffen ("am Ende gewinnt der Markt"). Black Wednesday 1992, SNB-Mindestkurs 1.20 CHF/EUR (15.01.2015), Japan/Yen-Carry-Trade als größtes systemisches Risiko (USD/JPY), Österr. Schule (Mises/Hayek, Malinvestment, Nullzinsen/Negativzinsen/QE/YCC/steigende Staatsverschuldung), Bitcoin-Bodenregion ~60k (hält bis heute), Sovereign-Loop-Powerlaw-Modell, Krypto-Winter-Ende Herbst 2026, Halving 2028. Identität zu Rüdiger/@thesovereignloop offen |
|
| `raw/blog/2026-08-21_mark-klinge-huter-des-geldes.md` | blog | Mark Klinge (markklinge.substack.com, Artikel signiert "The Sovereign Loop"): "Wie die Hüter des Geldes auf ganzer Linie versagen" — Volltext per Web-Fetch (2026-08-21). Kern-Argument: Zentralbanken können Geld aus dem Nichts schaffen und Preise lange verzerren, aber nicht die ökonomischen Konsequenzen abschaffen ("am Ende gewinnt der Markt"). Black Wednesday 1992, SNB-Mindestkurs 1.20 CHF/EUR (15.01.2015), Japan/Yen-Carry-Trade als größtes systemisches Risiko (USD/JPY), Österr. Schule (Mises/Hayek, Malinvestment, Nullzinsen/Negativzinsen/QE/YCC/steigende Staatsverschuldung), Bitcoin-Bodenregion ~60k (hält bis heute), Sovereign-Loop-Powerlaw-Modell, Krypto-Winter-Ende Herbst 2026, Halving 2028. Identität zu Rüdiger/@thesovereignloop offen |
|
||||||
| `raw/other/2026-08-23_pocketpal-ai-lokales-llm-smartphone.md` | other | PocketPal AI — Open-Source-App, die LLMs lokal auf dem Smartphone ausführt (GitHub a-ghorbani/pocketpal-ai, Distribution via Obtainium, kein Play Store). 'AI you own, not you rent': offline, keine Datenabflüsse, Null Telemetrie. 6GB+ RAM (8GB+ für größere Modelle), echte lokale Inferenz, kein Cloud-Wrapper. Hugging-Face-In-App-Integration. Geteilt von Netbits in OME-Topic 'Tips & Tricks' |
|
| `raw/other/2026-08-23_pocketpal-ai-lokales-llm-smartphone.md` | other | PocketPal AI — Open-Source-App, die LLMs lokal auf dem Smartphone ausführt (GitHub a-ghorbani/pocketpal-ai, Distribution via Obtainium, kein Play Store). 'AI you own, not you rent': offline, keine Datenabflüsse, Null Telemetrie. 6GB+ RAM (8GB+ für größere Modelle), echte lokale Inferenz, kein Cloud-Wrapper. Hugging-Face-In-App-Integration. Geteilt von Netbits in OME-Topic 'Tips & Tricks' |
|
||||||
|
| `raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md` | youtube | Better Stack: "I Can't Believe This AI Model Fits in 14 Megabytes" (Needle 2, M24yg6ZM7-I) — 45M-Param-Modell (14 MB, Cactus Compute) offline auf ~$10 ESP32-S3. Tool-Calling statt Chatten (steuert LED), 2-Bit-Training von Anfang an (Hadamard + Hashed Lookup-Tables), Confidence-Score, Refusal-Verhalten. Nachfolger der $8-Chip-Serie; referenziert Video 1 als "gimmick". ⚠️ Metadata-only |
|
||||||
|
|
|
||||||
11
wiki/log.md
11
wiki/log.md
|
|
@ -2284,3 +2284,14 @@ Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Über
|
||||||
- wiki (NEW): `wiki/tools/pocketpal-ai.md` — Tool-Seite zu PocketPal als mobile Kante der Edge-Inferenz; "AI you own, not rent"-Narrativ; Cross-Refs zu Edge-Inferenz, TinyML, lokaler Coding-KI.
|
- wiki (NEW): `wiki/tools/pocketpal-ai.md` — Tool-Seite zu PocketPal als mobile Kante der Edge-Inferenz; "AI you own, not rent"-Narrativ; Cross-Refs zu Edge-Inferenz, TinyML, lokaler Coding-KI.
|
||||||
- index.md: 123. Update, neue Tools-Seite, Raw-Katalog (+1).
|
- index.md: 123. Update, neue Tools-Seite, Raw-Katalog (+1).
|
||||||
- log: this entry
|
- log: this entry
|
||||||
|
|
||||||
|
## 2026-08-23 — Needle 2 — Tool-Calling-LLM in 14 MB auf $10-ESP32 (Netbits, Topic 27)
|
||||||
|
|
||||||
|
**Type:** ingest | **Scope:** raw/youtube (1 new), wiki/concepts/hardware (1 new + 1 updated), wiki/index, wiki/log
|
||||||
|
**Source:** YouTube-Video auf Kanal Better Stack, geteilt von Netbits ⚡️ Stachelbanane im OME-Topic "Tips & Tricks" (2026-08-21, Nachfolger des $8-Chip-Videos). URL: https://www.youtube.com/watch?v=M24yg6ZM7-I
|
||||||
|
|
||||||
|
- raw (NEW): `raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md` — neutrale Rohdaten (Metadata-only, ⚠️ kein Transkript verfügbar).
|
||||||
|
- wiki (NEW): `wiki/concepts/hardware/needle2-14mb-toolcalling-esp32.md` — Konzept-Seite zu Needle 2: Tool-Calling statt Chatten, 2-Bit-Training von Anfang an, Hadamard/Lookup-Tricks, Vergleichstabelle vs. $8-Chip.
|
||||||
|
- wiki (UPDATED): `wiki/concepts/hardware/8-dollar-chip-llm-tinyml.md` — Abschnitt "Nachfolger: Needle 2" + Cross-Ref, related_raw ergänzt.
|
||||||
|
- index.md: 124. Update, neue Hardware-Konzept-Seite, Raw-Katalog (+1).
|
||||||
|
- log: this entry
|
||||||
|
|
|
||||||
Loading…
Add table
Reference in a new issue