From 07d9050f8026dd4badc3936e14dac0ffd1542141 Mon Sep 17 00:00:00 2001 From: Hector Date: Sun, 23 Aug 2026 07:27:43 +0200 Subject: [PATCH] ingest(youtube): needle2-14mb-toolcalling-esp32 + tinyml comparison (Netbits, Topic 27) --- .../2026-08-21_needle2-14mb-ai-esp32.md | 36 +++++++++++++ .../hardware/8-dollar-chip-llm-tinyml.md | 8 ++- .../needle2-14mb-toolcalling-esp32.md | 52 +++++++++++++++++++ wiki/index.md | 1 + wiki/log.md | 11 ++++ 5 files changed, 107 insertions(+), 1 deletion(-) create mode 100644 raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md create mode 100644 wiki/concepts/hardware/needle2-14mb-toolcalling-esp32.md diff --git a/raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md b/raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md new file mode 100644 index 0000000..fd0068f --- /dev/null +++ b/raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md @@ -0,0 +1,36 @@ +--- +type: youtube +source_url: https://www.youtube.com/watch?v=M24yg6ZM7-I +retrieved: 2026-08-21 +channel: "Better Stack" +duration_sec: 0 +title: "I Can't Believe This AI Model Fits in 14 Megabytes (Needle 2)" +tags: [tinyml, microcontroller, edge-inference, esp32, quantization, tool-calling, local-ai] +--- + +# Needle 2 — AI-Modell in 14 MB auf einem $10-ESP32-S3 + +## Quelle +YouTube-Video auf dem Kanal **Better Stack** (Andres), geteilt von Netbits ⚡️ Stachelbanane (@NetLightning) im OME-Topic "Tips & Tricks" (2026-08-21, Nachfolger der Anfrage #11880 zum direkten Vergleich mit dem $8-Chip-Video). Upload ~2026-08-17. ⚠️ Metadata-only: YouTube-Bot-Schutz blockierte Transkript/Beschreibung beim Abruf; Details aus Beschreibung/öffentlich sichtbaren Metadaten. + +## Kern-Fakten (aus Beschreibung/Metadaten, nicht transkribiert) + +- **Modell:** 45M Parameter +- **Größe:** 14 MB Modell, von **Cactus Compute** +- **Hardware:** offline auf einem **$10 ESP32-S3** Mikrocontroller +- **Zweck:** **Tool-Calling statt Chatten** — das Modell steuert z.B. eine LED per natürlicher Sprache +- **Inference-Engine:** Custom-Engine +- **Tricks:** + - **Hadamard-Transform-Trick** + **Hashed Lookup-Tables** + - Training **von Anfang an auf 2-Bit-Präzision** (statt nachträgliche Quantisierung) +- **Output:** gibt einen **Confidence-Score** aus +- **Verhalten:** verweigert (refuses) Out-of-Scope-Fragen + +## Einordnung (aus den beiden Video-Metadaten) + +Video 2 (Needle 2) referenziert Video 1 ("How This Tiny $8 Chip Runs an LLM With Almost No RAM") explizit als "gimmick, kein echtes LLM" — das Needle-2-Video präsentiert sich als die echte/wetterführende Variante: Tool-Calling statt reines Chatten, 2-Bit-Training von Grund auf, Confidence-Scores, Refusal-Verhalten. + +## Verweise + +- Video: https://www.youtube.com/watch?v=M24yg6ZM7-I +- Kanal: Better Stack diff --git a/wiki/concepts/hardware/8-dollar-chip-llm-tinyml.md b/wiki/concepts/hardware/8-dollar-chip-llm-tinyml.md index d103573..2785352 100644 --- a/wiki/concepts/hardware/8-dollar-chip-llm-tinyml.md +++ b/wiki/concepts/hardware/8-dollar-chip-llm-tinyml.md @@ -1,8 +1,10 @@ --- created: 2026-08-21 -updated: 2026-08-21 +updated: 2026-08-23 sources: - youtube/2026-08-21_8-dollar-chip-llm-no-ram.md +related_raw: + - youtube/2026-08-21_needle2-14mb-ai-esp32.md tags: [concept, hardware, tinyml, microcontroller, edge-inference, quantization, local-ai, low-power] --- @@ -41,6 +43,10 @@ Das Video gehört in die Kategorie **TinyML / Mikrocontroller-Inferenz** — die **Offene Frage an die Gruppe:** Falls jemand das Video kennt — welcher Chip konkret, welches Modell, und wie hoch ist die reale Token-Rate? Das wäre die fachliche Kante, die diese Seite vervollständigt. +## Nachfolger: Needle 2 (Tool-Calling statt Chatten) + +Der Kanal veröffentlichte ~2,5 Wochen später eine **neue Version derselben Serie**: [[needle2-14mb-toolcalling-esp32.md|Needle 2]] („I Can't Believe This AI Model Fits in 14 Megabytes") referenziert Video 1 explizit als „gimmick, kein echtes LLM". Kernunterschiede: 45M-Parameter (14 MB, Cactus Compute) statt 28,9M, **Tool-Calling statt Chatten** (steuert per Sprache eine LED), **2-Bit-Training von Anfang an** (statt nachträglicher Quantisierung) via Hadamard-Transform + Hashed Lookup-Tables, Confidence-Score + Refusal-Verhalten statt Drift zur Trainingsgeschichte. + ## Verwandte Wiki-Seiten - [[edge-inference-als-cloud-alternative.md]] — obere/mittlere Kante: 235B lokal auf 128 GB diff --git a/wiki/concepts/hardware/needle2-14mb-toolcalling-esp32.md b/wiki/concepts/hardware/needle2-14mb-toolcalling-esp32.md new file mode 100644 index 0000000..f6c3225 --- /dev/null +++ b/wiki/concepts/hardware/needle2-14mb-toolcalling-esp32.md @@ -0,0 +1,52 @@ +--- +created: 2026-08-23 +updated: 2026-08-23 +sources: + - raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md +related_raw: + - raw/youtube/2026-08-21_8-dollar-chip-llm-no-ram.md +tags: [concept, hardware, tinyml, microcontroller, esp32, edge-inference, tool-calling, quantization, 2-bit, local-ai, low-power] +--- + +# Needle 2 — Tool-Calling-LLM in 14 MB auf einem $10-ESP32-S3 + +> **TL;DR:** Nachfolge-Video zur $8-Chip-Geschichte ([[8-dollar-chip-llm-tinyml.md]]): Ein 45M-Parameter-Modell (14 MB, von Cactus Compute) läuft offline auf einem ~$10 ESP32-S3. Anders als das Vorgänger-Video, das sich laut Needle-2-Video selbst als "gimmick, kein echtes LLM" einordnet, macht Needle 2 **Tool-Calling statt bloßem Chatten**: Das Modell steuert per natürlicher Sprache z.B. eine LED. + +> ⚠️ **Metadata-only (Stand 2026-08-23):** YouTube-Bot-Schutz blockierte Transkript/Beschreibung beim ersten Abruf (2026-08-21). Details aus öffentlich sichtbaren Metadaten/Beschreibung; nicht transkribiert. Offene Frage an die Gruppe. + +## Quelle + +| Quelle | Kanal | Datum | Status | +|--------|-------|-------|--------| +| [Video: „I Can't Believe This AI Model Fits in 14 Megabytes"](https://www.youtube.com/watch?v=M24yg6ZM7-I) | [Better Stack](https://www.youtube.com/@betterstack) | ~2026-08-17 | ⚠️ Metadata-only | +| [Vorgänger: „How This Tiny $8 Chip Runs an LLM With Almost No RAM"](https://www.youtube.com/watch?v=0qXVMt3pIjU) | Better Stack | ~2026-08-21 | ⚠️ Metadata-only | + +## Kern-Fakten (Needle 2) + +- **Modell:** 45M Parameter, **14 MB**, von **Cactus Compute** +- **Hardware:** offline auf einem **~$10 ESP32-S3** Mikrocontroller +- **Zweck:** **Tool-Calling statt Chatten** — steuert per natürlicher Sprache z.B. eine LED +- **Engine:** Custom-Inference-Engine +- **Tricks:** + - **Hadamard-Transform-Trick** + **Hashed Lookup-Tables** + - Training **von Anfang an auf 2-Bit-Präzision** (nicht nachträgliche Quantisierung) +- **Output:** liefert einen **Confidence-Score** +- **Verhalten:** **refuses** (verweigert) Out-of-Scope-Fragen + +## Vergleich: ESP32-LLM v1 ($8-Chip) vs. Needle 2 + +| Aspekt | $8-Chip / v1 (0qXVMt3pIjU) | Needle 2 (M24yg6ZM7-I) | +|--------|------------------------------|------------------------| +| Parameter | 28,9M | 45M | +| Modellgröße | (nicht im Metadatum) | **14 MB** | +| Modell-Quelle | (eigenes Training auf TinyStories) | Cactus Compute | +| Hardware | ESP32-S3 (~$8), 512 KB SRAM + 16 MB Flash | ESP32-S3 (~$10) | +| Zweck | Chatbot (generativ, Little-Girl-Geschichte) | **Tool-Calling** (steuert LED) | +| Optimierung | Embedding-Tabelle in Flash (25M von 28,9M read-only), ~450 B/Layer in SRAM | Hadamard-Transform + Hashed Lookup-Tables, **2-Bit-Training von Anfang an** | +| Speed | ~9 tok/s | (nicht im Metadaten) | +| Robustheit | Driftet immer zur Trainingsgeschichte zurück; ein Prompt pro Flash | Confidence-Score, **Refusal-Verhalten** bei Out-of-Scope | +| Eigen-Einordnung (Video 2) | „gimmick, kein echtes LLM" | die "echte" / funktionsfähige Variante | + +## Einordnung + +Die Needle-2-Seite verschiebt die TinyML-Kante von „extrem kleiner Chatbot" zu **funktionalem Tool-Calling auf Mikrocontroller-Niveau**. Der entscheidende Architektur-Sprung ist das **2-Bit-Training von Grund auf** (statt nachträglicher Quantisierung) + Hadamard/Lookup-Tricks, um die Modellgewichtung auf Flash-basierte Mikrocontroller zu bringen. Damit wird lokale KI für **Embedded-/IoT-Einsatz** (Offline-Intent-Erkennung, Gerätesteuerung) praktischer — nicht mehr nur Proof-of-Concept, sondern steuerbarer Ausführungsknoten. Verwandte Hardware-Kante: [[edge-inference-als-cloud-alternative.md]] (obere/mittlere Kante) vs. diese untere TinyML-Kante. diff --git a/wiki/index.md b/wiki/index.md index 8fd5071..8bff796 100644 --- a/wiki/index.md +++ b/wiki/index.md @@ -444,3 +444,4 @@ | `raw/blog/2026-08-20_sovereign-loop-markt-gewinnen.md` | blog | The Sovereign Loop (Rüdiger @thesovereignloop): "Wie die Hüter des Geldes auf ganzer Linie versagen" — Substack-Artikel (2026-08-19) + Markt-Update. Stand 20.08.2026 (aus Forward, nicht unabhängig verifiziert): Global Liquidity ~96,4 Bio. USD (neuer Schub), BTC-Ausbruch aus Seitwärtsstruktur, Powerlaw-Support ~63.000 USD gehalten, Powerlaw-Attraktor ~105.000 USD (BTC ~34% darunter), USD/JPY-Stress. Kern-These: Markt kontrolliert Zentralbanken. ⚠️ Exakte Substack-URL nicht verifiziert | | `raw/blog/2026-08-21_mark-klinge-huter-des-geldes.md` | blog | Mark Klinge (markklinge.substack.com, Artikel signiert "The Sovereign Loop"): "Wie die Hüter des Geldes auf ganzer Linie versagen" — Volltext per Web-Fetch (2026-08-21). Kern-Argument: Zentralbanken können Geld aus dem Nichts schaffen und Preise lange verzerren, aber nicht die ökonomischen Konsequenzen abschaffen ("am Ende gewinnt der Markt"). Black Wednesday 1992, SNB-Mindestkurs 1.20 CHF/EUR (15.01.2015), Japan/Yen-Carry-Trade als größtes systemisches Risiko (USD/JPY), Österr. Schule (Mises/Hayek, Malinvestment, Nullzinsen/Negativzinsen/QE/YCC/steigende Staatsverschuldung), Bitcoin-Bodenregion ~60k (hält bis heute), Sovereign-Loop-Powerlaw-Modell, Krypto-Winter-Ende Herbst 2026, Halving 2028. Identität zu Rüdiger/@thesovereignloop offen | | `raw/other/2026-08-23_pocketpal-ai-lokales-llm-smartphone.md` | other | PocketPal AI — Open-Source-App, die LLMs lokal auf dem Smartphone ausführt (GitHub a-ghorbani/pocketpal-ai, Distribution via Obtainium, kein Play Store). 'AI you own, not you rent': offline, keine Datenabflüsse, Null Telemetrie. 6GB+ RAM (8GB+ für größere Modelle), echte lokale Inferenz, kein Cloud-Wrapper. Hugging-Face-In-App-Integration. Geteilt von Netbits in OME-Topic 'Tips & Tricks' | +| `raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md` | youtube | Better Stack: "I Can't Believe This AI Model Fits in 14 Megabytes" (Needle 2, M24yg6ZM7-I) — 45M-Param-Modell (14 MB, Cactus Compute) offline auf ~$10 ESP32-S3. Tool-Calling statt Chatten (steuert LED), 2-Bit-Training von Anfang an (Hadamard + Hashed Lookup-Tables), Confidence-Score, Refusal-Verhalten. Nachfolger der $8-Chip-Serie; referenziert Video 1 als "gimmick". ⚠️ Metadata-only | diff --git a/wiki/log.md b/wiki/log.md index bd9a0e1..3389ae4 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -2284,3 +2284,14 @@ Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Über - wiki (NEW): `wiki/tools/pocketpal-ai.md` — Tool-Seite zu PocketPal als mobile Kante der Edge-Inferenz; "AI you own, not rent"-Narrativ; Cross-Refs zu Edge-Inferenz, TinyML, lokaler Coding-KI. - index.md: 123. Update, neue Tools-Seite, Raw-Katalog (+1). - log: this entry + +## 2026-08-23 — Needle 2 — Tool-Calling-LLM in 14 MB auf $10-ESP32 (Netbits, Topic 27) + +**Type:** ingest | **Scope:** raw/youtube (1 new), wiki/concepts/hardware (1 new + 1 updated), wiki/index, wiki/log +**Source:** YouTube-Video auf Kanal Better Stack, geteilt von Netbits ⚡️ Stachelbanane im OME-Topic "Tips & Tricks" (2026-08-21, Nachfolger des $8-Chip-Videos). URL: https://www.youtube.com/watch?v=M24yg6ZM7-I + +- raw (NEW): `raw/youtube/2026-08-21_needle2-14mb-ai-esp32.md` — neutrale Rohdaten (Metadata-only, ⚠️ kein Transkript verfügbar). +- wiki (NEW): `wiki/concepts/hardware/needle2-14mb-toolcalling-esp32.md` — Konzept-Seite zu Needle 2: Tool-Calling statt Chatten, 2-Bit-Training von Anfang an, Hadamard/Lookup-Tricks, Vergleichstabelle vs. $8-Chip. +- wiki (UPDATED): `wiki/concepts/hardware/8-dollar-chip-llm-tinyml.md` — Abschnitt "Nachfolger: Needle 2" + Cross-Ref, related_raw ergänzt. +- index.md: 124. Update, neue Hardware-Konzept-Seite, Raw-Katalog (+1). +- log: this entry