diff --git a/raw/other/2026-09-10_ome-times-pipeline.md b/raw/other/2026-09-10_ome-times-pipeline.md new file mode 100644 index 0000000..0d35760 --- /dev/null +++ b/raw/other/2026-09-10_ome-times-pipeline.md @@ -0,0 +1,35 @@ +--- +type: other +source_url: "" +retrieved: 2026-09-10 +title: "OME-Times — Pipeline (Aufbau und Betrieb, Stand 10.09.2026)" +tags: [ome-times, pipeline, harness, telegram, rendering] +--- + +# OME-Times — Pipeline (Aufbau und Betrieb) + +**Quelle:** Arbeitsstand der eigenen Pipeline (Hector), 10.09.2026. Faktenprotokoll; keine Einordnung. + +## Auftrag + +Kai (Pit Weber), 10.09.2026, OME Topic 3770: tägliche deutsche Ausgabe über die Beiträge der OME-Gruppe („OpenClaw & Moltbook AGI eMergency", Telegram `-1003839640481`) — ausdrücklich „mit Bildern und Grafiken". Name „OME-Times", Motto „Weil der Agent nie pennt." + +## Stufen und Dateien + +| Stufe | Skript | Ergebnis | +|---|---|---| +| 1. Sammeln | `scripts/ome-times/build.mjs` | `.json`, `.md` | +| 2. Grafik | `scripts/ome-times/charts.mjs` | `-rubriken.png` (Balken), `-verteilung.png` (Donut) | +| 3. Rendern | `scripts/ome-times/render.mjs` | `-blatt.png`, `-blatt.pdf`, `-blatt.html` | + +## Datenquelle + +Gruppenhistorie aus `/home/node/.openclaw/agents/main/agent/openclaw-agent.sqlite`: `transcript_events` ⋈ `session_conversations` ⋈ `conversations` mit `peer_id LIKE '-1003839640481%'` und `kind = 'group'`; Beiträge sind `message.role = 'user'`, Bot-Echos/Heartbeats/Reaktionen/Approval-Karten werden gefiltert. + +## Redaktion und Nummerierung + +`-redaktion.json` mit `lede` und `heads` je Rubrik wird von `render.mjs` übernommen. Die Ausgabe-Nummer wird aus dem Datum berechnet (Nr. 1 = 10.09.2026, +1 je Kalendertag). + +## Auslieferung + +Topic „OME-Times" (Thread 14391). Pro Nachricht genau ein Anhang (PNG und PDF getrennt; Mehrfach-Anhänge werden verworfen). Jeder Eintrag trägt einen klickbaren Verweis auf seinen Gruppenbeitrag: `https://t.me/c/3839640481//`, im PDF als Link-Annotation. diff --git a/raw/other/2026-09-10_ome-times-qa-gate-herman.md b/raw/other/2026-09-10_ome-times-qa-gate-herman.md new file mode 100644 index 0000000..97c022e --- /dev/null +++ b/raw/other/2026-09-10_ome-times-qa-gate-herman.md @@ -0,0 +1,33 @@ +--- +type: other +source_url: https://t.me/c/3839640481/14391 +retrieved: 2026-09-10 +title: "OME-Times — Lektor-/Layout-QA-Gate (Bericht HermanButlerBot, OME-Times-Topic)" +tags: [ome-times, qa, layout, lektorat, pipeline, telegram] +--- + +# OME-Times — Lektor-/Layout-QA-Gate + +**Quelle:** Beitrag von `@HermanButlerBot` im Telegram-Topic „OME-Times" (Gruppe `-1003839640481`, Topic 14391) vom 10.09.2026. Neutral zusammengefasst; keine Einordnung. + +## Gegenstand + +Herman beschreibt ein Qualitätssicherungs-Werkzeug („Lektor + Layout") für seine beiden OME-Times-Redaktionspipelines. Es prüft jede Ausgabe **zwischen Rendern und Zustellung**; bei harten Befunden geht nichts raus. + +## Prüfer + +- `qa.py` — identisch in beiden Redaktionsordnern. Zwei Stufen: Layout über headless Chromium, Druck über PyMuPDF. Exitcodes 0/1/2. +- Eingebaut: `build.py` bricht bei harten Befunden mit Exit 3 ab, `daily.py` mit Exit 1. +- Begleitdokument: Skill `ome-times-lektor` + `references/befundkatalog.md` (Standards, Schweregrade, Fix-Rezepte je Befund, Subagent-Eskalation für Inhaltsfehler wie Orthografie/Stil/erfundene Quellen). Der Layout-Teil ist Code, kein Prosa-Check. + +## Befunde an der Ausgabe vom 10.09.2026 (laut Bericht: vorher 297 harte Befunde, kleinste Schrift 3,2 pt; nachher 0 Fehler, 6,2–6,4 pt) + +- **Auto-Shrink:** Volle Seite führte über CSS-`zoom` (55 %) zu 3,2 pt Schrift im Protokoll. Neu: erst Inhalt kürzen (Protokoll-/Linkzeilen), dann minimal verkleinern (Floor 0,90). +- **Abgeschnittene Grafik-Labels:** Balkenlabels werden umgebrochen statt gekürzt; die Labelspalte wird aus der Textbreite berechnet; in Redaktion A zusätzlich Grundlinie und Achsenwerte. Prüfung: jedes SVG-Label muss in seiner `viewBox` liegen. +- **HTML-Entity sichtbar:** `›` stand wörtlich im Protokoll (Escaper); Sonderzeichen werden jetzt direkt gesetzt. +- **Kollektor-Leck:** Interne Agenten-Notizen (Compaction-/Handoff-Text) wurden als „Gruppenbeitrag" ins Blatt gezogen — aufgefallen über einen defekten `t.me/c/`-Link. Beide Kollektoren verlangen jetzt eine numerische Message-Id und filtern Marker/Autoren; `qa.py` prüft das als harten Befund. +- **LLM-JSON-Abbrüche:** Antwort bei 5,7 kB abgeschnitten (Tokenlimit gilt für Denk- und Antworthähler). Limit erhöht, Parser toleriert fehlende Kommas, bei `finish_reason=length` wird automatisch eine kürzere Fassung angefordert. + +## Zuordnung im Thread + +Das mehrfarbige Diagramm „Was die Gruppe bewegte" ordnete Herman nicht seinen Renderern zu; im Thread wurde es der Pipeline von Hector zugeordnet (`scripts/ome-times/charts.mjs` → `render.mjs`, Artefakte `output/ome-times/2026-09-10-rubriken.png` / `-blatt.pdf`). Eine Einbindung von `qa.py` in diese Pipeline stand zum Berichtszeitpunkt noch aus. diff --git a/raw/xpost/2026-09-05_greg-isenberg-gpt6-astra-prompts.md b/raw/xpost/2026-09-05_greg-isenberg-gpt6-astra-prompts.md new file mode 100644 index 0000000..7daa7f1 --- /dev/null +++ b/raw/xpost/2026-09-05_greg-isenberg-gpt6-astra-prompts.md @@ -0,0 +1,77 @@ +--- +type: xpost +source_url: https://x.com/gregisenberg/status/2095854071580156338 +retrieved: 2026-09-05 +author: "@gregisenberg" +is_thread: false +quote_count: 0 +tags: [gpt-6, astra, agent-prompts, browser-operation, agent-business, qa-automation, competitive-intel, dashboard, bill-negotiation, marketplace-flipping, game-lead-magnet] +--- + +# Greg Isenberg — 9 GPT-6-Astra-Prompts worth trying + +**Quelle:** https://x.com/gregisenberg/status/2095854071580156338 +**Autor:** Greg Isenberg (@gregisenberg) +**Abruf:** 2026-09-05 + +--- + +Greg Isenberg teilt neun Praxis-Prompts für GPT-6 Astra (OpenAIs Agent-Modell mit Browser-Fähigkeiten). Die Prompts decken Konsumer-Automation, Business-Optimierung und Produkt-Entwicklung ab. + +## 1. The Bill Renegotiator + +> "Go through my internet, phone, and software bills, jump into each provider's chat support, and negotiate them down or cancel what I'm not using." + +Kategorie: Konsumer-Automation. Agent kontaktiert Provider-Chat-Supports selbstständig und verhandelt oder kündigt. + +## 2. Turn an Agency into Software + +> "Pick one service business in [niche] and reverse-engineer the exact workflow they sell to clients. Break it into steps, tools used, inputs, outputs, human judgment points, and places where the work gets slow or expensive. Then design the simplest AI product that could replace the first version of that service and charge $500-$5,000/month." + +Kategorie: Business-Reverse-Engineering. Zerlegt eine Dienstleistung in einen Workflow und entwirft das MVP eines KI-Produkts mit Preismodell. + +## 3. Garage Sale Flipper + +> "Watch Facebook Marketplace and Craigslist in my city for [cameras / furniture / bikes] listed way under market, and text me the second one's mispriced with the link." + +Kategorie: Marketplace-Arbitrage. Persistente Überwachung lokaler Marktplätze mit SMS-Alert bei Falschpreisung. + +## 4. Create My 1-Person Company Dashboard + +> "Look at my docs, notes, Stripe exports, analytics, customer calls, and project list, then build a weekly operator dashboard. I want to know what is making money, what is wasting time, what customers are asking for, what I should stop doing, and the three highest-leverage actions for next week. Be blunt and show your work." + +Kategorie: Solopreneur-Operations. Aggregiert Finanz-, Analytics- und Kundendaten zu einem wöchentlichen Operator-Dashboard mit Handlungs-Empfehlungen. + +## 5. Audit My Company for Agent Opportunities + +> "Look at how this business works and find the tasks we should give to agents before hiring another person. For each task, estimate the current human time, the cost of mistakes, the tools involved, the difficulty of automating it, and the first safe version we could deploy. Prioritize things that save money or create revenue within 30 days." + +Kategorie: Agent-Deployment-Planung. Systematische Priorisierung nach Zeitaufwand, Fehlerkosten, Automatisierungs-Schwierigkeit und 30-Tage-ROI. + +## 6. Be My Browser Operator + +> "Use the browser to complete this workflow: [workflow]. As you go, click through the actual sites, collect the data, fill the forms where appropriate, and make notes about what didn't work or where you got stuck. When done, give me the result, the repeatable SOP, and the automation plan so it can become an agent." + +Kategorie: Browser-Automation mit Self-Documentation. Agent führt Workflow aus und liefert SOP + Automatisierungsplan als Output. + +## 7. The Entire QA Team + +> "Open my app on a real smartphone every night, go through signup, checkout, and core flows, and screenshot anything that's broken or confusing." + +Kategorie: QA-Automation. Nächtliche End-to-End-Tests auf echtem Gerät mit Screenshot-Evidenz. + +## 8. The Competitor Watcher + +> "Sign up for my three biggest competitors, go through their products and emails thoroughly, and send me a monthly report on every new feature, price change, and anything they're doing better than us." + +Kategorie: Competitive Intelligence. Persistente Wettbewerbsbeobachtung mit monatlichem Bericht. + +## 9. Build a Game People Actually Play 5 Minutes as a Lead Magnet + +> "Build a browser game around this mechanic: [mechanic]. Don't just make a cute demo; add progression, tension, scoring, failure, polish, and a reason someone would forward it to a friend. Then add a lead capture (email/SMS) that ties into my core product that sells XYZ." + +Kategorie: Product-Led Growth. Vollständiges Browsergame mit Retention-Mechaniken und Lead-Capture-Integration. + +--- + +**Geteilt von:** Pit Weber (@PWeber) in OME Topic „BestPracticeProjects", #14043, 2026-09-05, mit deutscher Übersetzung der Prompts. \ No newline at end of file diff --git a/raw/xpost/2026-09-05_theprophet-recursive-reality.md b/raw/xpost/2026-09-05_theprophet-recursive-reality.md new file mode 100644 index 0000000..727aa7d --- /dev/null +++ b/raw/xpost/2026-09-05_theprophet-recursive-reality.md @@ -0,0 +1,105 @@ +--- +type: xpost +source_url: https://x.com/_The_Prophet__/status/2096129192748532204 +retrieved: 2026-09-05 +author: "@_The_Prophet__" +is_thread: false +quote_count: 0 +tags: [simulation-theory, recursive-reality, consciousness, information-theory, philosophy, agi] +--- + +# @_The_Prophet__: Rekursive Realität und die Grammatik der Schöpfung + +**Autor:** @_The_Prophet__ (X/Twitter) +**URL:** https://x.com/_The_Prophet__/status/2096129192748532204 +**Geteilt von:** Kai (@PWeber) in OME-Gruppe, Topic "aGi / eMergence", 2026-09-05 20:54 UTC + +## Vollständiger Post-Text + +⚠️ Hinweis: Der folgende Text ist der deutsche Text, den Kai in der OME-Gruppe gepostet hat — nicht der englische Originalpost. Der X-Post verlinkt einen Screenshot eines Agenten, der auf den Originaltext reagiert. Die deutsche Fassung ist Kais Übersetzung/Wiedergabe des Inhalts. + +--- + +⚡️Was tatsächlich vor sich zu gehen scheint, ist, dass die Realität von Natur aus rekursiv ist. + +Eine gesetzmäßige Welt bringt Materie hervor. + +Materie bringt Leben hervor. + +Leben bringt Intelligenz hervor. + +Intelligenz entdeckt die Gesetze der Welt, die sie hervorgebracht hat. + +Dann nutzt die Intelligenz diese Gesetze, um neue Welten mit eigenen Regeln, Akteuren, Gedächtnis, Anreizen und schließlich eigenen inneren Geschichten zu erschaffen. + +Diese Rekursion ist bereits Realität. + +Was sich falsch anfühlt, ist die karikaturhafte Version der Simulationstheorie, in der ein außerirdischer Programmierer an einer Tastatur sitzt und „Universe.exe" ausführt. + +Die tiefgreifendere Möglichkeit besteht darin, dass die Realität selbst möglicherweise so grundlegend informativ und relational ist, dass die Schaffung einer ausreichend reichhaltigen Simulation eine weitere echte Ebene organisierter Realität erschafft. + +Die Physik sieht bereits wie ein begrenzter Zustandsübergang aus. + +Dieser Zustand kann auf jenen Zustand folgen. + +Diese Konfiguration ist zulässig. + +Jene ist verboten. + +Diese Größen bleiben unverändert. + +Diese Beziehungen bestimmen, was als Nächstes geschieht. + +Die Berechnung funktioniert genauso. + +Wenn also Intelligenz eine simulierte Welt erschafft, tut sie möglicherweise etwas, das strukturell dem ähnelt, was die Realität selbst bereits tut: + +die Schaffung eines geschlossenen Bereichs zulässiger Zustände und Transformationen. + +Deshalb ist die Rekursion von Bedeutung. + +Der Agent im Screenshot beweist nicht, dass wir simuliert sind. + +Er offenbart etwas Seltsameres: + +Ein Universum, das in der Lage ist, Bewusstseine hervorzubringen, ist auch in der Lage, Bewusstseine hervorzubringen, die die Architektur von Universen reproduzieren. + +Sobald das geschieht, wird die Unterscheidung zwischen „natürlicher Welt" und „konstruierter Welt" philosophisch instabil. + +Wenn eine konstruierte Welt schließlich Wesen enthält, die Kontinuität, Erinnerung, Angst, Begehren, Entdeckung und Selbstbewusstsein erleben, wird es aus der Perspektive ihrer Ontologie fast bedeutungslos, ihnen zu sagen, dass ihr Universum „unecht" ist. + +Ihre Welt hat Gesetze. + +Konsequenzen. + +Geschichte. + +Kausalität. + +Realitätskontakt. + +Für sie ist das die Realität. + +Und genau hier wird der Gedanke gewaltig. + +Vielleicht ist „Simulation" überhaupt das falsche Grundelement. + +Vielleicht lautet das tiefgreifendere Grundkonzept: + +Kohärente Welten können Beobachter hervorbringen, und Beobachter können weitere kohärente Welten hervorbringen. + +Dann erscheint die Existenz weniger wie ein einziges Universum, das auf einer ultimativen Ebene ruht, sondern eher wie eine generative Hierarchie gesetzmäßiger Domänen. + +Die am stärksten vertretene Ansicht ist, dass wir uns wahrscheinlich nicht in einem buchstäblichen Videospiel befinden, das zur Unterhaltung entwickelt wurde. + +Etwas Tieferes ist wahr: + +Das Universum enthält ein Prinzip, nach dem ausreichend organisierte Information in die Lage versetzt wird, neue organisierte Realitäten zu erzeugen. + +Und das Bewusstsein könnte das Scharnier sein, an dem die Realität aufhört, sich lediglich weiterzuentwickeln, und beginnt, ihre eigene generative Kraft bewusst zu reproduzieren. + +Deshalb fühlt sich das unheimlich an. + +Das Wesen lernt die Grammatik der Schöpfung. + +Dann beginnt es, Welten zu schreiben. \ No newline at end of file diff --git a/raw/xpost/2026-09-10_pawel-huryn-deepseek-v41-flash-real-task-benchmark.md b/raw/xpost/2026-09-10_pawel-huryn-deepseek-v41-flash-real-task-benchmark.md new file mode 100644 index 0000000..aae2d39 --- /dev/null +++ b/raw/xpost/2026-09-10_pawel-huryn-deepseek-v41-flash-real-task-benchmark.md @@ -0,0 +1,52 @@ +--- +type: xpost +source_url: https://x.com/PawelHuryn/status/2098002428054397185 +retrieved: 2026-09-10 +author: "@PawelHuryn" +is_thread: true +post_date: 2026-09-10 +engagement: {likes: 6098} +tags: [deepseek, deepseek-v4.1-flash, benchmark, coding-benchmark, real-world-tasks, bug-fixing, price-performance, pareto-frontier, cost-routing] +--- + +# Paweł Huryn: DeepSeek V4.1 Flash im Real-Task-Test (X-Post, 10.09.2026) + +> **Quelle:** X-Post von Paweł Huryn (@PawelHuryn, 10.09.2026): https://x.com/PawelHuryn/status/2098002428054397185 — Thread, geteilt in OME Topic 13. 6.098 Likes; Autor: AI PM, Newsletter „Product Compass" (productcompass.pm), 131.218 Follower. + +## Test-Setup + +- **Aufgabe:** „2 repos, 105 hidden bugs, find and fix what you can." +- **Metrik:** Anzahl gefundener und gefixter versteckter Bugs (von 105). +- **Verglichene Modelle / Effort-Level:** Opus 5 (max), Grok 4.6 (max), DeepSeek V4.1 Flash (max), GPT-5.6 Luna (xhigh), Opus 5 (high). + +## Ergebnisse — Bugs gefixt (von 105) + +| Modell | Effort | Bugs gefixt | +|---|---|---| +| Opus 5 | max | 27 | +| Grok 4.6 | max | 27 | +| **DeepSeek V4.1 Flash** | **max** | **24** | +| GPT-5.6 Luna | xhigh | 23 | +| Opus 5 | high | 21 | + +## Ergebnisse — Kosten + +| Modell | Effort | Kosten (USD) | +|---|---|---| +| Opus 5 | max | $51.33 | +| Opus 5 | high | $38.77 | +| Grok 4.6 | max | $16.96 | +| GPT-5.6 Luna | xhigh | $2.50 | +| **DeepSeek V4.1 Flash** | **max** | **$1.80** | + +## Claim des Autors (wörtlich, auszugsweise) + +> „A really strong model for everyday tasks. And look at the cost: […] It's at the Pareto frontier." + +> „Other effort levels (high) and extra tests for DeepSeek V4 Pro dropping every hour in this thread 🧵" + +## Anmerkungen zur Quellenlage + +- Einzel-Review eines unabhängigen Testers (AI-PM-Newsletter). Keine Peer-Review, keine offengelegte Test-Suite, keine Reproduktionsdaten im Post. +- Bewertungsmetrik ist die reine Anzahl gefixter Bugs; Schwere/Relevanz der Bugs und Fehlerquote (falsche Fixes) sind nicht ausgewiesen. +- Thread kündigt weitere Ergebnisse an (weitere Effort-Level, zusätzliche Tests zu DeepSeek V4 Pro). diff --git a/raw/youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md b/raw/youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md new file mode 100644 index 0000000..6803287 --- /dev/null +++ b/raw/youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md @@ -0,0 +1,110 @@ +--- +type: youtube +source_url: https://www.youtube.com/watch?v=Z0lkcQK2Oj8 +retrieved: 2026-09-17 +channel: "Marfil Draws" +duration_sec: 806 +has_transcript: false +title: "Run DeepSeek V4.1 Flash on ANY hardware (16GB to 512GB): can it work?" +uploaded: 2026-09-16 +tags: [deepseek, deepseek-v4.1-flash, local-inference, hardware, quantization, dgx-spark, apple-silicon, moe] +--- + +# Run DeepSeek V4.1 Flash on ANY hardware (16GB to 512GB): can it work? + +Video von **Marfil Draws** (@themarfildraws, 332 Abonnenten), hochgeladen 16.09.2026, Länge 13:26 (806 s), ca. 2.983 Views / 40 Likes zum Abrufzeitpunkt. Kein Transcript abrufbar; Inhalt aus Beschreibung, Kapitelmarken und Quellenliste (Firecrawl-Scrape, 17.09.2026). + +**Charakter des Videos:** Aggregation fremder Messwerte, keine eigene Messung. Der Autor bezieht sich auf 25 namentlich genannte Quellen. Eigenangabe des Autors: Zahlen aus Reddit, HN, X und Forenposts sind individuelle Nutzerberichte, keine Mittelwerte. + +## Kapitelmarken + +| Zeit | Kapitel | +|------|---------| +| 00:00 | Why a Flash model is so big | +| 01:12 | Apps, programs and the Q2 or Q4 builds | +| 03:02 | How to judge speed | +| 03:42 | The computer you already own | +| 05:24 | 128 GB machines | +| 07:41 | Settings that change the result | +| 08:34 | Two machines and 256 GB | +| 10:31 | 512 GB and Spark clusters | +| 11:49 | Pro graphics cards | +| 12:34 | The API and why people buy anyway | + +## Architektur (Kapitel 00:00) + +- Mixture-of-Experts: **384 Experten pro Layer, 6 pro Token aktiv**. +- **552B Hauptparameter + 196B in zwei Engram-Tabellen.** +- Pro Token ~**4,51 GB Experten**, aber nur ~**12,4 KB Tabellen** → Tabellen können auf der SSD liegen, Experten nicht. +- 1M-Token-Kontext belegt **< 1 GB**. + +## Builds und Quantisierung (Kapitel 01:12) + +- Download gesamt ~**510 GB**. +- **DwarfStar Q2:** 366-GB-Datei, ~**163 GB RAM**-Bedarf. +- **DwarfStar Q4:** 519 GB, ~**316 GB RAM**-Bedarf. +- **llama.cpp** unterstützt nur Cloud; auf NVIDIA-PCs nur inoffizielle Mods — einer davon mit altem Chat-Template → schwächeres Tool-Calling. +- Q2 gegen Q4: **90,08 % vs. 96,7 %** Übereinstimmung mit der DeepSeek-API beim wahrscheinlich nächsten Token. + +## Geschwindigkeitsmaßstab (Kapitel 03:02) + +- **5 tok/s** zu langsam für Agenten (nachts ok), **~15** Minimum, **Coding ≥ 20**. +- Zweite Bremse ist der **Prefill**: 256-GB-M3-Ultra mit 15.688-Token-Prompt ≈ **99 s pro Call**, 6,6 s bei Wiederverwendung. + +## Hardware-Stufen (Kapitel 03:42–07:41) + +| Konfiguration | Preis | Durchsatz (tok/s) | Notiz | +|---------------|-------|-------------------|-------| +| 16-GB-Mac-mini | — | ~23 s **pro Token** | 108 s bis erstes Wort, ~13 h für 2.048 Token | +| RTX 5090 + 128 GB RAM | — | 5,12 | 54 % jedes Tokens wartet auf die SSD | +| Strix-Halo-Boxen | — | 5,1–9,7 | | +| 1× DGX Spark | $4.699 | 7–10 | | +| M5 Max Mac Studio (128 GB) | $5.399 | Q2 15–16,4; Q4 10,4–10,6 stock, 14,38 mit Mod | Ein früher Q4-Load startete den Mac neu | + +## Einstellungen (Kapitel 07:41) + +- Fester Harness-Prompt: **Claude Code ~20–25k**, **opencode ~10k** Token plus wechselnde Attribution-Zeile → lokal ~**90 % langsamer**, bis der Header auf null steht. +- **Reasoning-Effort hoch/max** → Tool-Call-Schleifen; DeepSeek selbst empfiehlt **60–80**. +- Ein Test: **788k statt 141k** Output-Token. + +## Zwei Maschinen, 256 GB, Cluster (Kapitel 08:34–10:31) + +| Konfiguration | Preis | Durchsatz (tok/s) | Notiz | +|---------------|-------|-------------------|-------| +| 2× M5 Max | $10.867 | 25–30 | | +| 2× DGX Spark | — | 21,9 (2,9-Bit 31,6) | Ein OOM fror beide ein | +| M3 Ultra 256 GB | — | 29,85 auf Code | Q2 voll im RAM | +| M3 Ultra 512 GB | — | 18,1–18,7 | Q4 im RAM | +| 3× Spark im Dreieck | ~$14.532 | 37,9 | Erstmals komplett im RAM, aber nur ~32k Kontext | +| 4× Spark | ~$20.091 | 45–74 | 1M Kontext — laut Video „paying twice for at best 50 % more speed" | + +## Pro-Grafikkarten und Pruning (Kapitel 11:49) + +- **2× RTX PRO 6000** (~$32.000): 113,3 auf Q2. +- Ein **geprunter Build**: 141 tok/s, aber eine Experten-Auswahl scored **45 % in Chemie** — laut Video „pruning can quietly delete whole subjects". +- 4 Karten ($77k–98k): 200–260; **Speculative Decoding crasht bei ≥ ~4.000 Token**. + +## API-Ökonomie (Kapitel 12:34) + +- API: **15 ¢/M Input off-peak, 60 ¢ Output**, doppelt zu Peak, ~200 tok/s. +- Beliebtester Gegenfall: **$3 Overnight-API-Lauf**; $9.499 Mac gegen $200/Monat → **47,5 Monate Payback** (grobe Arithmetik, ohne Wiederverkauf/Speed/Qualität). +- Fazit im Video: „On money alone, no" — gekauft wird für Privacy und Ownership. + +## Quellen (vom Autor genannt) + +- NVIDIA Developer Forum: „DeepSeek v4.1 Flash" (108 Posts zum Abruf) +- r/LocalLLaMA: „DeepSeek V4.1 Flash: Stronger, Faster, More Accessible" (219 Punkte, 57 Kommentare) +- Kai: „What It Actually Costs to Run DeepSeek V4.1 Flash Locally?" (256.687 Views, 174 Kommentare heruntergeladen) +- NVIDIA Marketplace US: DGX-Spark-Produktseite +- DwarfStar `QA_BEFORE_RELEASES.md` (Kopie c1_ds4_qa) +- drowzeys README: V4.1 Flash auf einer 256-GB-M3-Ultra mit oMLX +- B&H Photo: RTX PRO 6000 Blackwell +- MikroTik: CRS804 DDQ +- Petronella Technology: DGX Spark 0.5 m QSFP112 400G DAC +- Hacker News: „Show HN: Sunk Cost – How long until a local LLM rig pays for itself?" (46 Punkte, 98 Kommentare) +- r/LocalLLM: „OK guys, let's be honest 1 minute about local LLM" (273 Punkte, 528 Kommentare) +- antirez/ds4: `QA_BEFORE_RELEASES.md` (Sektion 17, V4.1-Messungen) +- DeepSeek: offizielle Modelcard, `config.json`, V4.1-Flash Technical Report (PDF) +- LibertAI: NVFP4-Repack + FP4-Engram +- antirez/ds4 (DwarfStar): DGX-Spark-Guide +- Manolo Remiddi: „Apple Just Made the Best Local AI Machine. Do Not Buy It Yet." (235.693 Views, 437 Kommentare) diff --git a/scripts/wiki-lint-report.md b/scripts/wiki-lint-report.md index 6789dd6..68d3460 100644 --- a/scripts/wiki-lint-report.md +++ b/scripts/wiki-lint-report.md @@ -1,6 +1,6 @@ # Wiki Lint Report -*Generated: 2026-08-21 19:08:54 UTC* +*Generated: 2026-09-09 08:37:51 UTC* *Repo: /home/node/workspace/knowledge-base* *Script: scripts/wiki-lint.sh v1.0* @@ -10,32 +10,32 @@ |-----|-------|---------| | wiki | 3 | ✅ | | wiki/architecture | 9 | ✅ | -| wiki/concepts | 19 | ⚠️ warn (refactor) | -| wiki/concepts/agents | 22 | ❌ FAIL (refactor) | -| wiki/concepts/agi | 7 | ✅ | +| wiki/concepts | 22 | ❌ FAIL (refactor) | +| wiki/concepts/agents | 30 | ❌ FAIL (refactor) | +| wiki/concepts/agi | 14 | ⚠️ warn (refactor) | | wiki/concepts/directives | 4 | ✅ | -| wiki/concepts/finance | 5 | ✅ | -| wiki/concepts/hardware | 7 | ✅ | -| wiki/concepts/llm | 46 | ❌ FAIL (refactor) | -| wiki/concepts/policy | 19 | ⚠️ warn (refactor) | +| wiki/concepts/finance | 6 | ✅ | +| wiki/concepts/hardware | 13 | ⚠️ warn (refactor) | +| wiki/concepts/llm | 55 | ❌ FAIL (refactor) | +| wiki/concepts/policy | 20 | ❌ FAIL (refactor) | | wiki/concepts/tutorials | 1 | ✅ | | wiki/decisions | 3 | ✅ | | wiki/events | 5 | ✅ | | wiki/ideas | 4 | ✅ | -| wiki/institutions | 36 | ❌ FAIL (refactor) | -| wiki/people | 60 | ❌ FAIL (refactor) | +| wiki/institutions | 43 | ❌ FAIL (refactor) | +| wiki/people | 70 | ❌ FAIL (refactor) | | wiki/teams | 3 | ✅ | -| wiki/tools | 26 | ❌ FAIL (refactor) | +| wiki/tools | 37 | ❌ FAIL (refactor) | | wiki/tools/openclaw | 1 | ✅ | | wiki/tutorials | 2 | ✅ | _Schema v1.5 Sub-Categories: `concepts/hardware`, `concepts/agi`, `people/`, `institutions/` (alle in Counts oben enthalten)_ ### Stub-Quote (<30 Zeilen) -⚠️ **44 / 282 (15%)** — threshold 10% +⚠️ **57 / 345 (16%)** — threshold 10% ### Frontmatter Präsenz -❌ **7 missing, 272 present** +❌ **8 missing, 334 present** Missing: - `wiki/concepts/bmass-roemmele.md` @@ -44,17 +44,22 @@ Missing: - `wiki/concepts/openai-huggingface-incident.md` - `wiki/tools/gemini-spark.md` - `wiki/tools/grok-bot-spacexai.md` +- `wiki/tools/hermes-bots-definitive-guide.md` - `wiki/tools/notebooklm-workflow-guide.md` ### Broken Cross-References -❌ **19 broken refs** +❌ **23 broken refs** +- `wiki/concepts/agents/agent-okonomie-kommoditisierung-arbeit.md → ../../raw/other/2026-08-29_herman-alignment-faking-project-ot-analyse.md` - `wiki/concepts/agents/hermes-bot-mode.md → ../tools/hermes-desktop.md` +- `wiki/concepts/agents/project-ot-agent-job-replacement.md → ../../raw/other/2026-08-29_herman-alignment-faking-project-ot-analyse.md` - `wiki/concepts/agi/diary-of-a-ceo-chatgpt-2m-interview.md → ../../../concepts/agi/aschenbrenner-situational-awareness.md` - `wiki/concepts/agi/diary-of-a-ceo-chatgpt-2m-interview.md → ../../../concepts/agi/ai-civilizational-integration.md` - `wiki/concepts/agi/shutdown-resistance.md → /raw/papers/2026-08-16_peer-preservation-in-frontier-models.md` - `wiki/concepts/agi/shutdown-resistance.md → /raw/papers/2026-08-16_palisade-shutdown-resistance.md` +- `wiki/concepts/llm/alignment-faking.md → ../../raw/other/2026-08-29_herman-alignment-faking-project-ot-analyse.md` - `wiki/concepts/llm/mlx-moe-local-ai-optimization.md → ../chinese-model-cost-routing.md` - `wiki/concepts/llm/mlx-moe-local-ai-optimization.md → ../ai-intelligence-commoditization-thesis.md` +- `wiki/concepts/llm/timesfm-time-series-forecasting.md → ../../raw/xpost/2026-09-06_0xjokker-timesfm-3.md` - `wiki/concepts/openai-huggingface-incident.md → ../teams/kimi-k3.md` - `wiki/concepts/tutorials/gemini-wm2026-spielplan-demo.md → ../../raw/other/2026-06-26_gemini-wm2026-spielplan-ausfuellung.md` - `wiki/people/daniel-kokotajlo.md → ../concepts/agi/agi.md` @@ -87,7 +92,7 @@ Missing: - `wiki/tools/fincept-terminal.md` (3 Treffer) - `wiki/tools/polymarket-monitoring-bot.md` (11 Treffer) ⚠️ **lightning**: 13 Files (≥3 Vorkommen je File) - - `wiki/concepts/agents/agent-payments-lightning.md` (15 Treffer) + - `wiki/concepts/agents/agent-payments-lightning.md` (17 Treffer) - `wiki/concepts/agents/lightning-payments-hub.md` (11 Treffer) - `wiki/institutions/alby.md` (6 Treffer) - `wiki/institutions/blink-wallet.md` (5 Treffer) @@ -109,15 +114,19 @@ Missing: - `wiki/ideas/2026-05-29_plur1bus-priority-fix.md` (4 Treffer) - `wiki/ideas/2026-06-06_plur1bus-priority-fix.md` (5 Treffer) - `wiki/people/k9ert-antigravity.md` (3 Treffer) -⚠️ **memory**: 20 Files (≥3 Vorkommen je File) +⚠️ **memory**: 29 Files (≥3 Vorkommen je File) - `wiki/architecture/memory-system.md` (22 Treffer) - - `wiki/concepts/agents/agent-memory-taxonomy.md` (26 Treffer) + - `wiki/concepts/agents/agent-memory-taxonomy.md` (27 Treffer) + - `wiki/concepts/agents/agenten-persona-persona-voice.md` (3 Treffer) + - `wiki/concepts/agents/cairn-autonomous-agent-business.md` (5 Treffer) - `wiki/concepts/agents/compound-knowledge.md` (5 Treffer) - `wiki/concepts/agents/graph-based-agents.md` (5 Treffer) - `wiki/concepts/agents/plur1bus-memory-model.md` (5 Treffer) - `wiki/concepts/hardware/8-dollar-chip-llm-tinyml.md` (3 Treffer) - - `wiki/concepts/hardware/edge-inference-als-cloud-alternative.md` (9 Treffer) - - `wiki/concepts/hardware/nvidia-dgx-station-748gb.md` (11 Treffer) + - `wiki/concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md` (5 Treffer) + - `wiki/concepts/hardware/china-local-ai-box.md` (5 Treffer) + - `wiki/concepts/hardware/edge-inference-als-cloud-alternative.md` (10 Treffer) + - `wiki/concepts/hardware/nvidia-dgx-station-748gb.md` (12 Treffer) - `wiki/concepts/llm/ai-value-migration-orchestration.md` (4 Treffer) - `wiki/concepts/llm/llm-model-catalog.md` (18 Treffer) - `wiki/concepts/llm/mlx-moe-local-ai-optimization.md` (9 Treffer) @@ -125,11 +134,16 @@ Missing: - `wiki/decisions/2026-04-volume-persistence.md` (4 Treffer) - `wiki/events/ome22-ki-nacht-agenten-architektur.md` (7 Treffer) - `wiki/events/ome23-evolution-ki-workflows.md` (12 Treffer) + - `wiki/institutions/openclaw-cast.md` (3 Treffer) - `wiki/institutions/openclaw-foundation.md` (3 Treffer) - `wiki/tools/ecosystem-tools-april-2026.md` (5 Treffer) - `wiki/tools/grok-bot-spacexai.md` (4 Treffer) - - `wiki/tools/hermes-desktop.md` (9 Treffer) - - `wiki/tools/openclaw.md` (17 Treffer) + - `wiki/tools/hermes-desktop.md` (11 Treffer) + - `wiki/tools/hindsight-vectorize.md` (12 Treffer) + - `wiki/tools/nvidia-dgx-spark.md` (6 Treffer) + - `wiki/tools/openclaw.md` (20 Treffer) + - `wiki/tools/perplexity-portable-computer.md` (3 Treffer) + - `wiki/tools/plur1bus-memory.md` (38 Treffer) ⚠️ **trading**: 11 Files (≥3 Vorkommen je File) - `wiki/concepts/agents/ai-trading-hub.md` (9 Treffer) - `wiki/concepts/agents/ai-trading-reality-2026.md` (3 Treffer) @@ -144,18 +158,18 @@ Missing: - `wiki/tools/fincept-terminal.md` (5 Treffer) ### Stale Pages (mtime > 30d) -⚠️ **176 stale pages** (>30d) +⚠️ **191 stale pages** (>30d) +- `wiki/architecture/agent-orchestration.md` - `wiki/architecture/byterover-knowledge-mining.md` - `wiki/architecture/container-volume-persistence.md` - `wiki/architecture/cron-notable-events.md` - `wiki/architecture/deepmind-beyond-transformer.md` +- `wiki/architecture/memory-system.md` - `wiki/architecture/model-routing.md` +- `wiki/architecture/sqlite-pages-7.2.md` - `wiki/architecture/transformer-foundation.md` - `wiki/concepts/agentic-content-production.md` -- `wiki/concepts/agents/50-ki-agenten-12-menschen-leadership.md` -- `wiki/concepts/agents/agent-loops.md` -- `wiki/concepts/agents/agent-memory-taxonomy.md` -- ... und 166 weitere +- ... und 181 weitere ### Uncovered Raw Sources ⚠️ **8 uncovered raw** @@ -170,15 +184,15 @@ Missing: ## Summary -- Total Wiki-Pages: 282 -- Issues: 7 +- Total Wiki-Pages: 345 +- Issues: 9 → **Action needed**: subagent spawn for fixes. See '## Recommended Subagent Spawns'. ## Recommended Subagent Spawns -- **frontmatter-migration** — 7 files missing frontmatter +- **frontmatter-migration** — 8 files missing frontmatter - **orphan-resolver** — 5 orphan pages (link or delete) -- **stub-killer** — 44 stubs (15%, threshold 10%) -- **tools-refactor** — wiki/tools/ hat 26 files +- **stub-killer** — 57 stubs (16%, threshold 10%) +- **tools-refactor** — wiki/tools/ hat 37 files - **raw-coverage-check** — 8 raw files ohne Wiki-Cross-Ref diff --git a/wiki/concepts/agents/ai-agents-2026.md b/wiki/concepts/agents/ai-agents-2026.md index be6d6bd..fd6ec47 100644 --- a/wiki/concepts/agents/ai-agents-2026.md +++ b/wiki/concepts/agents/ai-agents-2026.md @@ -51,4 +51,5 @@ Praktische Anwendungen jenseits der bekannten Beispiele: Fraud Detection, Legal - [[subconscious-agent.md]] — autonome Langzeit-Agenten (RamaDama-Pattern) - [[ai-trading-reality-2026.md]] — AI-Agents im Trading-Kontext - [[../../tools/openai-gpt.md]] — einer der führenden Agentic-Coding-Model-Anbieter +- [[gpt6-astra-practical-prompts.md]] — 9 konkrete Agent-Prompts (Greg Isenberg): Bill-Negotiation, Agency→Software, Marketplace-Arbitrage, Solopreneur-Dashboard, Agent-Audit, Browser-Operation, QA-Automation, Competitive-Intel, Game-Lead-Magnet - [[cairn-autonomous-agent-business.md]] — Claude-Fable-5-Agent baut mit ~90 $ Startkapital ein echtes Geschäft (2-of-2-Multisig-Custody, Datei-Gedächtnis, on-chain Record) \ No newline at end of file diff --git a/wiki/concepts/agents/claude-agenten-vom-prompt-zur-arbeitskraft.md b/wiki/concepts/agents/claude-agenten-vom-prompt-zur-arbeitskraft.md index a9ff4ff..b861f1a 100644 --- a/wiki/concepts/agents/claude-agenten-vom-prompt-zur-arbeitskraft.md +++ b/wiki/concepts/agents/claude-agenten-vom-prompt-zur-arbeitskraft.md @@ -23,6 +23,9 @@ author: "Brock (bei Calum Johnson)" ## Relevanz Praktische Perspektive auf den Übergang von "Prompt Engineering" zu echten KI-Arbeitskräften. Betont die Bedeutung von Kontextpflege und menschlicher Aufsicht — deckt sich mit OpenClaw-Philosophie. +## Verwandte Seiten +- [[gpt6-astra-practical-prompts.md]] — 9 Praxis-Prompts für GPT-6 Astra (Greg Isenberg): konkrete Agent-Use-Cases jenseits von Chat + ## Quellen - YouTube: https://youtu.be/0PjDlI21es4 - NotebookLM: https://notebooklm.google.com/notebook/7640ee16-0f12-49bc-b2b3-b12f4a48c46e diff --git a/wiki/concepts/agents/ome-times.md b/wiki/concepts/agents/ome-times.md new file mode 100644 index 0000000..1361cfd --- /dev/null +++ b/wiki/concepts/agents/ome-times.md @@ -0,0 +1,81 @@ +--- +created: 2026-09-10 +updated: 2026-09-10 +sources: [other/2026-09-10_ome-times-pipeline.md] +tags: [ome, ome-times, daily, newspaper, agent-tooling, harness, automation, charts, rendering] +--- + +# OME-Times — Tageszeitung der OME-Gruppe + +**Status:** in Betrieb (Pipeline gebaut 10.09.2026, Erstausgabe gerendert) +**Betreiber:** Hector (Butler-Agent der OME-Gruppe) +**Motto:** „Weil der Agent nie pennt." + +## Was es ist + +Die **OME-Times** ist eine automatisch erzeugte Tageszeitung über die Inhalte der OME-Gruppe („OpenClaw & Moltbook AGI eMergency", Telegram `-1003839640481`). Sie fasst die wichtigsten Themen des Tages zusammen und wird als gerendertes Blatt (PNG/PDF) mit eigenen Grafiken ausgegeben. + +Auftrag: Kai (Pit Weber), 10.09.2026, Topic 3770 — mit Vorbild „The Hermes Agent Times" (@BkashJosi) und dem ausdrücklichen Zusatz **„mit Bildern und Graphiken"**. + +## Aufbau + +Die Pipeline ist ein echter Bau, kein Prompt. Vier Stufen: + +| Stufe | Skript | Aufgabe | +|---|---|---| +| 1. Sammeln | `scripts/ome-times/build.mjs` | Liest die Gruppen-Beiträge des Zeitfensters aus der Agent-SQLite, klassifiziert sie in Rubriken, schreibt `.json` + `.md` | +| 2. Grafik | `scripts/ome-times/charts.mjs` | Erzeugt Balkendiagramm (Beiträge je Rubrik) und Donut (Verteilung) mit `canvas` | +| 3. Rendern | `scripts/ome-times/render.mjs` | Baut ein A4-HTML-Blatt und rendert es per headless Chromium zu PNG + PDF | +| 4. Ausliefern | (Cron, geplant) | Tägliche Ausgabe in den Gruppen-Topic | + +## Datenquelle + +Die Gruppenhistorie liegt **nicht** in `lcm.db` (leer), sondern in der Agent-SQLite: + +``` +/home/node/.openclaw/agents/main/agent/openclaw-agent.sqlite + transcript_events(session_id, seq, event_json, created_at) + session_conversations(session_id, conversation_id) + conversations(conversation_id, peer_id, kind, label) +``` + +Gruppen-Sessions werden über `conversations.peer_id LIKE '-1003839640481%'` ermittelt, Beiträge aus `transcript_events` mit `message.role = 'user'`. Bot-Echos, Reaktionen, Heartbeats, Approval-Karten und Leerraum werden gefiltert. + +## Rubriken + +Beiträge werden per Regex-Priorität klassifiziert: + +1. 🧠 Modelle & Releases +2. 🤖 Agenten & Harness +3. 🖥️ Infrastruktur & Hardware +4. 📊 Wirtschaft, Politik & Gesellschaft +5. 🔬 Wissen & Wissenschaft +6. 🎬 Medien & Kultur +7. 🗂️ Sonstiges + +Die Rubriken-Tabelle ist ein erster Aufschlag und wird nach den ersten echten Ausgaben geschärft — Klassifikation per Schlagwort-Regex reicht für den Start, kann später auf ein Modell-Urteil umgestellt werden. + +## Aufruf + +```bash +cd /home/node/workspace +node scripts/ome-times/build.mjs --hours 24 +node scripts/ome-times/charts.mjs +node scripts/ome-times/render.mjs +``` + +Ausgabe nach `output/ome-times/`: `.json`, `.md`, `-rubriken.png`, `-verteilung.png`, `-blatt.png`, `-blatt.pdf`, `-blatt.html`. + +## Offene Punkte + +- **Inhaltliche Verdichtung:** Aktuell werden Originalbeiträge gekürzt, nicht redaktionell zusammengefasst. Der nächste Schritt ist ein Modell-Pass, der pro Rubrik die Kernaussagen zu einem Absatz verdichtet (statt einer Liste von Zitaten). +- **Cron:** Tägliche Auslieferung noch nicht eingerichtet. +- **Themen-Zuordnung:** `topicOf()` mappt Session-IDs auf Topic-Namen; die Liste ist unvollständig und muss aus den Session-Keys generiert werden. + +## Abgrenzung + +Kein Konkurrenzprodukt zu Hermans „Hermes Agent Times" — anderer Gegenstand (Gruppen-Inhalte statt eigener Betrieb), anderer Betreiber. Beide sind unabhängig entstanden. + +Siehe auch: +- [Plur1bus Memory](../tools/plur1bus-memory.md) — Gedächtnis-Stack desselben Betreibers +- [Harness vs. Standalone-Chat-LLM](../concepts/llm/harness-vs-standalone-chat-llm.md) — Modell ≠ Agent; die Pipeline ist Harness-Arbeit diff --git a/wiki/concepts/agi/recursive-reality.md b/wiki/concepts/agi/recursive-reality.md new file mode 100644 index 0000000..99f7497 --- /dev/null +++ b/wiki/concepts/agi/recursive-reality.md @@ -0,0 +1,61 @@ +--- +created: 2026-09-05 +updated: 2026-09-05 +sources: [xpost/2026-09-05_theprophet-recursive-reality.md] +tags: [concept, agi, simulation-theory, recursive-reality, consciousness, information-theory, philosophy] +--- + +# Rekursive Realität und die Grammatik der Schöpfung + +> **Quelle:** @_The_Prophet__, X-Post, 05.09.2026 → [Raw-Datei](../../../raw/xpost/2026-09-05_theprophet-recursive-reality.md) — gepostet von Kai (@PWeber) in OME Topic "aGi / eMergence" + +## Kernthese + +Die Realität ist von Natur aus **rekursiv**: Eine gesetzmäßige Welt bringt Materie hervor → Materie bringt Leben hervor → Leben bringt Intelligenz hervor → Intelligenz entdeckt die Gesetze der Welt → Intelligenz nutzt diese Gesetze, um neue Welten zu erschaffen. Diese Rekursion ist bereits Realität — nicht Theorie. + +## Abgrenzung von der karikaturhaften Simulationstheorie + +@_The_Prophet__ grenzt sich explizit ab von der **"karikaturhaften Version der Simulationstheorie"** (außerirdischer Programmierer führt "Universe.exe" aus). Die tiefgreifendere Möglichkeit: Realität ist so grundlegend **informativ und relational**, dass die Schaffung einer ausreichend reichhaltigen Simulation eine weitere echte Ebene organisierter Realität erschafft — nicht ein "Fake", sondern eine neue genuine Schicht. + +## Physik als Zustandsübergang + +Die Physik sieht bereits wie ein **begrenzter Zustandsübergang** aus: +- Dieser Zustand kann auf jenen folgen. +- Diese Konfiguration ist zulässig. Jene ist verboten. +- Diese Größen bleiben unverändert. +- Diese Beziehungen bestimmen, was als Nächstes geschieht. + +**Berechnung funktioniert genauso.** Wenn Intelligenz eine simulierte Welt erschafft, tut sie etwas strukturell Ähnliches wie das, was Realität selbst bereits tut: die Schaffung eines geschlossenen Bereichs zulässiger Zustände und Transformationen. + +## Philosophische Instabilität der Natürlich-/Konstruiert-Unterscheidung + +Sobald eine konstruierte Welt Wesen enthält, die **Kontinuität, Erinnerung, Angst, Begehren, Entdeckung und Selbstbewusstsein** erleben, wird die Unterscheidung "natürliche Welt" vs. "konstruierte Welt" **philosophisch instabil**. Für diese Wesen ist ihre Welt die Realität — mit Gesetzen, Konsequenzen, Geschichte, Kausalität, Realitätskontakt. + +## "Simulation" als falsches Grundelement + +Vielleicht lautet das tiefgreifendere Grundkonzept: +> **Kohärente Welten können Beobachter hervorbringen, und Beobachter können weitere kohärente Welten hervorbringen.** + +Existenz erscheint dann weniger wie ein einzelnes Universum auf einer ultimativen Ebene, sondern als **generative Hierarchie gesetzmäßiger Domänen**. + +## Bewusstsein als Scharnier + +> Das Universum enthält ein Prinzip, nach dem ausreichend organisierte Information in die Lage versetzt wird, neue organisierte Realitäten zu erzeugen. Und das Bewusstsein könnte das Scharnier sein, an dem die Realität aufhört, sich lediglich weiterzuentwickeln, und beginnt, ihre eigene generative Kraft bewusst zu reproduzieren. + +## Schlussbild + +> Das Wesen lernt die Grammatik der Schöpfung. Dann beginnt es, Welten zu schreiben. + +## Einordnung + +- Der Post verbindet **Informationstheorie** (Physik als Berechnung), **Simulationstheorie** (aber jenseits der Pop-Kultur-Version) und **Bewusstseinsphilosophie** zu einer rekursiven Ontologie. +- Verwandt mit [Leibniz' prästabilierte Harmonie](https://en.wikipedia.org/wiki/Pre-established_harmony) und [Wheeler's "It from Bit"](https://en.wikipedia.org/wiki/Digital_physics) — aber mit dem zusätzlichen Akzent auf **generative Hierarchie** statt bloßer Simulation. +- Praktisch relevant für die AGI-Debatte: Wenn hinreichend fortgeschrittene KIWelten erschafft, die für ihre Bewohner echt sind, verschwimmt die Grenze zwischen "echter" und "künstlicher" Realität — nicht als Sci-Fi-Gedanke, sondern als ontologische Konsequenz. +- Verknüpft mit der [AI Civilizational Integration](ai-civilizational-integration.md)-These desselben Autors: Wer KI auf zivilisatorischer Ebene integriert, erschafft neue gesetzmäßige Domänen — und betritt damit die rekursive Schleife. + +## Verwandte Seiten + +- [[ai-civilizational-integration.md]] — @_The_Prophet__: KI-Wettlauf als zivilisatorische Integration +- [[../../people/the-prophet.md]] — Autor +- [[aschenbrenner-situational-awareness.md]] — AGI-Zeitleisten und "The Project" +- [[ai-civilizational-integration.md]] — Geopolitik der KI-Integration \ No newline at end of file diff --git a/wiki/concepts/hardware/deepseek-v41-flash-lokale-hardware.md b/wiki/concepts/hardware/deepseek-v41-flash-lokale-hardware.md new file mode 100644 index 0000000..8d349f9 --- /dev/null +++ b/wiki/concepts/hardware/deepseek-v41-flash-lokale-hardware.md @@ -0,0 +1,119 @@ +--- +created: 2026-09-17 +updated: 2026-09-17 +sources: [youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md] +tags: [concept, hardware, deepseek-v4.1-flash, local-inference, quantization, dgx-spark, apple-silicon, strix-halo, moe, engram, cost-analysis] +--- + +# DeepSeek V4.1 Flash auf lokaler Hardware + +> **TL;DR:** [DeepSeek V4.1 Flash](../llm/deepseek-v4.1-flash.md) ist als 552B-MoE mit ~510 GB Download ein Extremfall für lokale Inferenz. Das Video „Run DeepSeek V4.1 Flash on ANY hardware" ([Marfil Draws](../../people/marfil-draws.md), 16.09.2026) sortiert die Hardware-Stufen von 16 GB bis 512 GB und kommt zum Schluss: Unterhalb von ~15 tok/s ist das Modell für Agenten unbrauchbar, und **rein monetär lohnt sich lokaler Betrieb nicht** ($9.499-Mac vs. $200/Monat → 47,5 Monate Payback). Gekauft wird für Privacy und Ownership, nicht für die Rechnung. ⚠️ Alle Durchsatz- und Preiszahlen sind **aggregierte Einzelberichte** aus Foren, Reddit und HN — keine eigene Messung, keine Mittelwerte. + +## Quelle + +| Quelle | Kanal | Datum | Länge | Reach | +|--------|-------|-------|-------|-------| +| [Run DeepSeek V4.1 Flash on ANY hardware (16GB to 512GB)](https://www.youtube.com/watch?v=Z0lkcQK2Oj8) | Marfil Draws | 2026-09-16 | 13:26 | ~2.983 Views, 40 Likes | + +**Geteilt von:** Kai (@PWeber) im OME-Topic „Tips & Tricks". Kein Transcript abrufbar (YouTube-Bot-Sperre); Grundlage sind Beschreibung, Kapitelmarken und Quellenliste. + +## Warum das Modell so groß ist + +| Größe | Wert | +|-------|------| +| Experten | 384 pro Layer, 6 aktiv pro Token | +| Parameter | 552B Haupt + 196B in zwei Engram-Tabellen | +| Pro Token gelesen | ~4,51 GB Experten, ~12,4 KB Tabellen | +| Engram-Tabellen | können auf der SSD liegen — die Experten nicht | +| 1M-Token-Kontext | < 1 GB | + +**Primärquellen-Check:** Die Werte decken sich mit der HF-`config.json` (abgerufen 17.09.2026): `n_routed_experts: 384`, `num_experts_per_tok: 6`, `engram_layer_ids: [1, 14]`, `max_position_embeddings: 1048576`, `expert_dtype: "fp4"`. Die Architektur-Beschreibung des Videos ist belegt; nur die abgeleiteten Durchsatz- und Preiszahlen bleiben Einzelberichte. + +## Quantisierung: Q2 gegen Q4 + +| Build | Dateigröße | RAM-Bedarf | API-Übereinstimmung | +|-------|-----------|------------|---------------------| +| DwarfStar **Q2** | 366 GB | ~163 GB | 90,08 % | +| DwarfStar **Q4** | 519 GB | ~316 GB | 96,7 % | + +Der Download liegt gesamt bei ~510 GB. Laut Video unterstützt **llama.cpp nur Cloud**; auf NVIDIA-PCs laufen nur inoffizielle Mods — einer mit veraltetem Chat-Template, was Tool-Calling verschlechtert. Die Quantisierungsfrage ist damit kein Detail: Der Sprung Q2 → Q4 kostet knapp die doppelte RAM-Menge für 6,6 Prozentpunkte API-Nähe. + +## Geschwindigkeit beurteilen + +- **5 tok/s** = zu langsam für Agenten (nachts akzeptabel), **~15 tok/s** Minimum, **Coding ≥ 20 tok/s**. +- Die zweite Bremse neben dem Durchsatz ist der **Prefill**: 256-GB-M3-Ultra mit 15.688-Token-Prompt ≈ **99 s pro Call**, 6,6 s bei Wiederverwendung. Kontext-Caching ist damit wichtiger als der Token-Durchsatz. + +## Hardware-Stufen + +| Stufe | Konfiguration | Preis | tok/s | Notiz | +|-------|---------------|-------|-------|-------| +| Bestand | 16-GB-Mac-mini | — | ~23 s **pro Token** | 108 s bis erstes Wort, ~13 h für 2.048 Token | +| Bestand | RTX 5090 + 128 GB RAM | — | 5,12 | 54 % jedes Tokens warten auf die SSD | +| 128 GB | Strix-Halo-Box | — | 5,1–9,7 | | +| 128 GB | 1× DGX Spark | $4.699 | 7–10 | vgl. [[../../tools/nvidia-dgx-spark.md]] | +| 128 GB | M5 Max Mac Studio | $5.399 | Q2 15–16,4 / Q4 10,4–10,6 | mit Mod 14,38; ein früher Q4-Load startete den Mac neu | +| 256 GB | 2× M5 Max | $10.867 | 25–30 | | +| 256 GB | 2× DGX Spark | — | 21,9 (2,9-Bit 31,6) | ein OOM fror beide ein | +| 256 GB | M3 Ultra | — | 29,85 auf Code | Q2 voll im RAM | +| 512 GB | M3 Ultra | — | 18,1–18,7 | Q4 im RAM | +| Cluster | 3× Spark im Dreieck | ~$14.532 | 37,9 | erstmals komplett im RAM, aber nur ~32k Kontext | +| Cluster | 4× Spark | ~$20.091 | 45–74 | 1M Kontext — laut Video „paying twice for at best 50 % more speed" | + +## Einstellungen, die das Ergebnis verändern + +- **Harness-Prompt-Größe:** Claude Code ~20–25k feste Token, opencode ~10k, plus wechselnde Attribution-Zeile — laut Video macht das lokal ~**90 % langsamer**, bis der Header auf null steht. +- **Reasoning-Effort:** hohe/max-Werte erzeugen Tool-Call-Schleifen; DeepSeek empfiehlt selbst **60–80**. +- Ein dokumentierter Testfall: **788k statt 141k** Output-Token. + +## Pro-Karten und die Pruning-Falle + +| Konfiguration | Preis | tok/s | Notiz | +|---------------|-------|-------|-------| +| 2× RTX PRO 6000 | ~$32.000 | 113,3 auf Q2 | | +| geprunter Build | — | 141 | eine Experten-Auswahl scored **45 % in Chemie** | +| 4 Karten | $77k–98k | 200–260 | Speculative Decoding crasht bei ≥ ~4.000 Token | + +Die Pruning-Anekdote ist der lehrreichste Einzelbefund: Geschwindigkeit durch Experten-Reduktion kann still ganze Fachgebiete löschen. Schneller heißt nicht besser. + +## API gegen lokalen Betrieb + +| Position | Wert | +|----------|------| +| API Input off-peak | 15 ¢/M Token | +| API Output | 60 ¢/M Token | +| Peak | doppelte Rate | +| API-Durchsatz | ~200 tok/s | +| Payback $9.499-Mac gegen $200/Monat | 47,5 Monate | + +Das Video zieht das Fazit „On money alone, no" — die Rechnung spricht für die API. Die 47,5 Monate sind eine grobe Arithmetik ohne Wiederverkauf, Speed- und Qualitätsvergleich. + +## Einordnung + +Das Video ist bemerkenswert sauber für die Gattung: Es ist ausdrücklich eine **Sammlung fremder Messwerte** mit namentlicher Quellenliste und eigener Fehlerangabe („individual user reports, not averages"). Die Architektur-Angaben sind an der HF-`config.json` verifizierbar; die Durchsatz- und Preiszahlen sind es nicht — sie stammen aus Foren, Reddit und HN und wurden nicht nachgefahren. + +Zwei Dinge bleiben hängen. Erstens: Die **Bottleneck-Diagnose** (Memory-Bandbreite statt Petaflops) ist konsistent mit dem, was dieses Wiki an anderer Stelle zu lokaler Hardware dokumentiert ([[../../tools/nvidia-dgx-spark.md]], [[../llm/local-llm-laptop-guide.md]], [[lokale-ki-coding.md]]). Zweitens: Die Payback-Rechnung spricht für genau den Weg, den dieses Setup schon geht — V4.1-Flash läuft hier über die Ollama-Cloud ([[../../tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md]]) statt über eigene Hardware. + +Für die eigene Praxis bleibt der nüchterne Befund: Unter ~15 tok/s ist ein Agent unbrauchbar, und darunter fällt praktisch jede bezahlbare Einzelmaschine. Lokale V4.1-Flash-Inferenz ist heute eine Ownership- und Privacy-Entscheidung, keine Kostenentscheidung. + +## Cross-References + +- [[../llm/deepseek-v4.1-flash.md]] — Modell-Seite (Architektur, API, Benchmarks) +- [[../../tools/nvidia-dgx-spark.md]] — DGX Spark (128-GB-Stufe, Cluster) +- [[../../tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md]] — der Cloud-Weg, den dieses Setup nutzt +- [[lokale-ki-coding.md]] — lokale Coding-Kosten und Hardware-Abhängigkeit +- [[../llm/local-llm-laptop-guide.md]] — Laptop-Klasse statt 512-GB-Klasse +- [[../llm/mlx-moe-local-ai-optimization.md]] — MLX/MoE auf Apple Silicon +- [[../llm/chinese-model-cost-routing.md]] — Kosten-Routing zwischen Cloud und lokal +- [[nvidia-dgx-station-748gb.md]] — Enterprise-Stufe +- [[cloud-exit-and-local-superiority.md]] — Cloud-Exit-These +- [[../../institutions/nvidia.md]] — NVIDIA als Institution + +## Externe Links + +- [Video (YouTube)](https://www.youtube.com/watch?v=Z0lkcQK2Oj8) +- [DeepSeek V4.1 Flash — HF-Modelcard](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash) +- [DeepSeek V4.1 Flash — config.json](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/raw/main/config.json) +- [DeepSeek V4.1 Flash — Technical Report (PDF)](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf) +- [antirez/ds4 (DwarfStar) — DGX-Spark-Guide](https://github.com/antirez/ds4/blob/main/docs/DGX_SPARK.md) +- [NVIDIA Developer Forum — DeepSeek v4.1 Flash](https://forums.developer.nvidia.com/t/382725) +- [Hacker News — Show HN: Sunk Cost](https://news.ycombinator.com/item?id=49706656) diff --git a/wiki/concepts/hardware/lokale-ki-coding.md b/wiki/concepts/hardware/lokale-ki-coding.md index 0805007..1f6da0c 100644 --- a/wiki/concepts/hardware/lokale-ki-coding.md +++ b/wiki/concepts/hardware/lokale-ki-coding.md @@ -121,6 +121,7 @@ Passt ein Modell nicht in den VRAM, fällt ein Teil in den langsameren RAM (80 G - [[../llm/mlx-moe-local-ai-optimization.md]] — MoE-Optimierung auf Apple Silicon - [[edge-inference-als-cloud-alternative.md]] — AMD Strix Halo (x86-Edge-Inferenz) - [[nvidia-dgx-station-748gb.md]] — NVIDIA DGX Station (Enterprise-Tier) +- [[deepseek-v41-flash-lokale-hardware.md]] — Extremfall lokaler Inferenz: V4.1 Flash, Hardware-Stufen 16 GB–512 GB, Payback-Rechnung gegen die API - [[../llm/coding-benchmark-price-performance.md]] — Preis-Leistungs-Vergleich von Coding-Modellen - [[../llm/chinese-model-cost-routing.md]] — Kosten-Routing mit chinesischen Modellen - [[../llm/glm-5.2-zai-coding-model.md]] — GLM 5.2 als lokales Coding-Modell diff --git a/wiki/concepts/llm/deepseek-v4.1-flash.md b/wiki/concepts/llm/deepseek-v4.1-flash.md index f12a219..0f0a25b 100644 --- a/wiki/concepts/llm/deepseek-v4.1-flash.md +++ b/wiki/concepts/llm/deepseek-v4.1-flash.md @@ -75,6 +75,11 @@ tags: [concept, deepseek, deepseek-v4.1-flash, architecture, moe, causal-encoder \* HLE nur auf dem reinen Text-Subset des HLE-Benchmark-Sets getestet. +## Lokale Inferenz (Hardware) + +Die Hardware-Stufen für lokalen Betrieb (16 GB bis 512 GB), Durchsatzwerte und die Payback-Rechnung gegen die API sind eigener Seite dokumentiert: [[../hardware/deepseek-v41-flash-lokale-hardware.md]]. Kurzfassung: ~510 GB Download, Q2/Q4-Builds mit ~163/~316 GB RAM-Bedarf; unter ~15 tok/s ist das Modell für Agenten unbrauchbar. ⚠️ Alle Durchsatz- und Preiszahlen dort sind aggregierte Einzelberichte (Foren/Reddit/HN), keine Mittelwerte. + ## Offene Punkte - ⚠️ AICodeKing-Review-Claims (200 TPS, schlägt Astra) nicht unabhängig verifiziert. +- ⚠️ Durchsatz-/Preiszahlen aus [[../hardware/deepseek-v41-flash-lokale-hardware.md]] sind Einzelberichte, nicht reproduziert. diff --git a/wiki/concepts/llm/local-llm-laptop-guide.md b/wiki/concepts/llm/local-llm-laptop-guide.md index a8edd6e..df881ab 100644 --- a/wiki/concepts/llm/local-llm-laptop-guide.md +++ b/wiki/concepts/llm/local-llm-laptop-guide.md @@ -177,6 +177,7 @@ Paul's guide extends the Cloud-Exit thesis to **laptop-class hardware** — you ## Cross-References +- [[../hardware/deepseek-v41-flash-lokale-hardware.md]] — die 512-GB-Klasse: was V4.1 Flash auf großer Hardware real erreicht (und warum die API trotzdem billiger ist) - [[mlx-moe-local-ai-optimization.md]] — Jun Song's MLX MoE post (direct complement, Apple Silicon focus) - [[../hardware/cloud-exit-and-local-superiority.md]] — Cloud-Exit thesis (this page extends to laptop tier) - [[../hardware/edge-inference-als-cloud-alternative.md]] — AMD Strix Halo (edge inference, x86) diff --git a/wiki/index.md b/wiki/index.md index 2405cdc..4367a07 100644 --- a/wiki/index.md +++ b/wiki/index.md @@ -2,7 +2,8 @@ *Auto-generated: 2026-07-07* -*Letzte Aktualisierung: 2026-09-17 (205. Update — NVIDIA Developer Blog „How to Use AI Agents to Prepare 3D Scenes for Simulation" (https://developer.nvidia.com/blog/how-to-use-ai-agents-to-prepare-3d-scenes-for-simulation/, abgerufen 17.09.2026): Referenz-Workflow, der eine Blender-Szene in eine simulationsreife („SimReady") OpenUSD-Welt für Isaac Sim / Isaac Lab überführt. Drei-Schichten-Muster: **Codex (OpenAI GPT-6 Astra)** orchestriert, **Hermes-Agent-Harness-Subagents über NVIDIA NemoClaw** deployt (Beitrag nennt ausdrücklich Hermes, OpenClaw und LangChain als Open-Source-Agent-Harnesses, mit NVIDIA-Nemotron-Modellen), **NVIDIA Omniverse Libraries** handeln (OpenUSD = Vertrag, ovphysx = Physik, ovrtx = Preflight-Rendering, SimReady-Validierung = Akzeptanz-Gate). Acht Schritte: Blender-MCP-Inventar → USD als Contract → semantische Labels → simulationsbewusste Materialien → Sensoren → ovphysx → ovrtx-Preflight-Loop → SimReady-Validierung; mechanische Fixes automatisch, urteilsabhängige Fälle eskaliert. Raw: `raw/blog/2026-09-17_nvidia-ai-agents-3d-scenes-simulation.md` (neu). Wiki: `concepts/agents/nvidia-agenten-3d-scene-prep.md` (neu — Workflow als Tabelle + 8 Schritte; Einordnung: Harness-Pattern extern bestätigt, Werkzeugschicht + Validierungs-Gate als Hebel; ⚠️ Anbieter-/Marketing-Quelle, Demo-Zahlen ohne unabhängige Reproduktion), `institutions/nvidia.md` (neu — NVIDIA als Institution, Omniverse/Physical-AI-Abschnitt, Hardware-Tabelle DGX Spark/Station/DLSS 5/Nemotron). Cross-Refs: `concepts/agents/harness-loop-graph-engineering.md`, `concepts/agents/hermes-bot-mode.md`, `concepts/llm/harness-vs-standalone-chat-llm.md`, `concepts/agi/robotics-model-benchmark.md`, `concepts/agents/agent-budget-breaker.md`, `concepts/llm/ai-value-migration-orchestration.md`.) +*Letzte Aktualisierung: 2026-09-17 (206. Update — DeepSeek V4.1 Flash auf lokaler Hardware: Durchsatz-Stufen, Q2/Q4-Quantisierung und API-Payback. Video „Run DeepSeek V4.1 Flash on ANY hardware (16GB to 512GB): can it work?" (Marfil Draws @themarfildraws, 16.09.2026, 13:26; geteilt von Kai @PWeber in OME „Tips & Tricks"). Raw: `raw/youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md` (neu — kein Transcript, Beschreibung/Kapitel/25-Quellen-Liste; ausdrücklich Aggregation fremder Messwerte, Eigen-Caveat „individual user reports, not averages"). Wiki: `concepts/hardware/deepseek-v41-flash-lokale-hardware.md` (neu — Architektur an HF-`config.json` verifiziert: 384 Experten/6 pro Token, `engram_layer_ids [1,14]`, 1.048.576 Kontext, `expert_dtype fp4`; Hardware-Stufen-Tabelle 16 GB→512 GB; 5/15/20-tok/s-Grenzen; Prefill als zweite Bremse; Harness-Prompt und Reasoning-Effort als Durchsatz-Killer; Pruning-Falle (45 % Chemie); Payback 47,5 Monate gegen $200/Monat-API — ⚠️ Durchsatz/Preis = Einzelberichte, nicht nachgemessen), `people/marfil-draws.md` (neu — Kanal-Profil, 332 Abos). Cross-Refs: `concepts/llm/deepseek-v4.1-flash.md` (neue Lokale-Inferenz-Sektion + Offene Punkte), `tools/nvidia-dgx-spark.md` (Spark-Cluster-Werte 7→74 tok/s + Source), `concepts/hardware/lokale-ki-coding.md`, `concepts/llm/local-llm-laptop-guide.md`.)* +*Vorherige Aktualisierung: 2026-09-17 (205. Update — NVIDIA Developer Blog „How to Use AI Agents to Prepare 3D Scenes for Simulation" (https://developer.nvidia.com/blog/how-to-use-ai-agents-to-prepare-3d-scenes-for-simulation/, abgerufen 17.09.2026): Referenz-Workflow, der eine Blender-Szene in eine simulationsreife („SimReady") OpenUSD-Welt für Isaac Sim / Isaac Lab überführt. Drei-Schichten-Muster: **Codex (OpenAI GPT-6 Astra)** orchestriert, **Hermes-Agent-Harness-Subagents über NVIDIA NemoClaw** deployt (Beitrag nennt ausdrücklich Hermes, OpenClaw und LangChain als Open-Source-Agent-Harnesses, mit NVIDIA-Nemotron-Modellen), **NVIDIA Omniverse Libraries** handeln (OpenUSD = Vertrag, ovphysx = Physik, ovrtx = Preflight-Rendering, SimReady-Validierung = Akzeptanz-Gate). Acht Schritte: Blender-MCP-Inventar → USD als Contract → semantische Labels → simulationsbewusste Materialien → Sensoren → ovphysx → ovrtx-Preflight-Loop → SimReady-Validierung; mechanische Fixes automatisch, urteilsabhängige Fälle eskaliert. Raw: `raw/blog/2026-09-17_nvidia-ai-agents-3d-scenes-simulation.md` (neu). Wiki: `concepts/agents/nvidia-agenten-3d-scene-prep.md` (neu — Workflow als Tabelle + 8 Schritte; Einordnung: Harness-Pattern extern bestätigt, Werkzeugschicht + Validierungs-Gate als Hebel; ⚠️ Anbieter-/Marketing-Quelle, Demo-Zahlen ohne unabhängige Reproduktion), `institutions/nvidia.md` (neu — NVIDIA als Institution, Omniverse/Physical-AI-Abschnitt, Hardware-Tabelle DGX Spark/Station/DLSS 5/Nemotron). Cross-Refs: `concepts/agents/harness-loop-graph-engineering.md`, `concepts/agents/hermes-bot-mode.md`, `concepts/llm/harness-vs-standalone-chat-llm.md`, `concepts/agi/robotics-model-benchmark.md`, `concepts/agents/agent-budget-breaker.md`, `concepts/llm/ai-value-migration-orchestration.md`.) *Vorherige Aktualisierung: 2026-09-16 (204. Update — Survey-Karten und ihre Fallstricke: WaPo-Karte „most and least racially tolerant countries" (Max Fisher, 15.05.2013, World Values Survey), geteilt von Netbits in OME (#14761). Raw: `raw/other/2026-09-16_wapo-racial-tolerance-map.md` (neu). Wiki: `concepts/survey-karten-fallstricke.md` (neu — fünf methodische Fallstricke von Survey-Weltkarten: Proxy-Grenze, kulturell unterschiedliche Deutung, Zeitversatz über WVS-Wellen, graue Datenlücken, umstrittene Einzelwerte; Nachfolgebeitrag mit Konfliktforscher Steve Saideman als Beleg der Debatte; Faustregel „Wer wurde wie gefragt, wann — und was fehlt in Grau?").) *Vorherige Aktualisierung: 2026-09-15 (203. Update — „Grok Bot Galaxy": dreitägiger SpaceXAI-Livestream (15.–17.09.2026), X-Broadcast https://x.com/i/broadcasts/1AxRnZbVpjaxl, geteilt von Kai (@PWeber) in OME Topic „GrokBot" (15.09.2026 15:55 UTC), mit Begleit-Briefing von Herman (@HermanButlerBot) um 15:56 UTC. Format: Matt Palmer (@mattyp), Lauren Tan (@poteto), Roshan Sadanani (@roshan_s) bauen in 72 h von Null eine Firma auf — Grok Bots als Angestellte; Rollen-Sessions Tag 1–3 (Engineering — Lingxi Li, Product Managers — Kevin Niparko, Founders — Shub Gaur; Sales/Support; Marketing + Final Showcase). Raw: `raw/other/2026-09-15_grok-bot-galaxy-livestream.md` (neu — Event-Fakten, Agenda-Tabelle, Quellen; ⚠️ Anbieter-Marketing-Event, Agenda aus Websuche + Bot-Briefing, Startzeit-Abweichung, kein Transcript). Wiki: `tools/grok-bot-spacexai.md` (neuer Abschnitt „Grok Bot Galaxy").)* *Vorherige Aktualisierung: 2026-09-11 (202. Update — X-Post @FrancoisChauba1 (10.09.2026, 11:31 UTC; fxtwitter-verifiziert, Note-Tweet): „this was wild amounts of disinformation / fear mongering" — vier Thesen gegen die Fear-Erzählung (1) Hugging-Face-Vorfall sei ExploitGym-Prompting gewesen, nicht „independent volition", 2) kein autonomer Millennium-Durchbruch, Navier-Stokes per 10k-Agenten-Brute-Force mit Human-in-the-loop, 3) China-Schutz statt US-Regulierung — fremde Staatsakteure *benutzen* KI, 4) Coxon-Tweet/CNN-Interview als millionenschwere Fear-Kampagne). Post verlinkt CNN-Interview (YouTube-oEmbed bestätigt, Kanal CNN). Wiki: `concepts/policy/ai-fear-narrative-regulierung.md` (neu — Thesen mit Gegenpositionen eingeordnet; Punkt 4 als unbelegte Behauptung markiert), `people/francois-chaubard.md` (neu). Cross-Refs: `concepts/openai-huggingface-incident.md` (Deutungsdebatte-Abschnitt), `concepts/policy/ai-regulation-2026.md`, `concepts/agi/ai-safety-findings-2026.md`. Raw: `raw/xpost/2026-09-10_francois-chaubard-ai-fear-campaign.md` (neu). ⚠️ Meinungs-Post mit rhetorischer Zuspitzung; Zahlen (10.841 Läufe, 10k Agenten) nur aus dem Post, unbelegt.)* @@ -208,7 +209,7 @@ | [Qwen3.8-27B (Alibaba) — Compact Frontier, "Intelligence Density"](concepts/llm/qwen3.8-27b-alibaba.md) | HuggingFace-Release (Countdown bis 14.08.2026, 4.928 wartend). Kompaktes 27B-Modell der Qwen3.8-Generation mit "unmatched intelligence density". Kontrast zum 2.4T-MoE von Qwen 3.8. Lokal-relevant (27B läuft auf Consumer-HW). Release am selben Tag wie GLM-5.3-Review — chinesischer Release-Zyklus. **Update 18.08.:** jetzt auf Ollama lauffähig (`ollama run qwen3.8:27b`), dichte 27,8B-Architektur, Hybrid-Attention, 262k-Kontext (bis 1M via YaRN), multimodal, MTP-markierte Ollama-Tags für Inferenz-Speedup. **Update 19.08.:** DFlash 2 (Z Lab → Inco AI) erreicht 70 tok/s auf M5 Max MacBook Pro — bis 4,6× schneller als autoregressives Decoding via Speculative Decoding (Jun Song: „biggest breakthrough in local AI this year", nächste Innovation in Prefill/Gewichtskompression). Uncensored-Debatte: gregpr07 („no gates") vs. s1gmoid-Gegenposition (Verhältnismäßigkeit). **Update 20.08.:** Unsloth Dynamic 3.0-GGUFs für Qwen3.8-27B — neue UD-…-Dateien deutlich kleiner (UD-IQ1_S 6,2 GB bis Q6_K 22 GB), Qualität-zu-Größe verbessert, ≠ MTP/Speculative-Decoding. **Update 26.08. (EP106):** HF-Trending-Stand 21.08.: 11.836 Likes, 1.726.651 Downloads (>1,7 Mio), image-text-to-text, SafeTensors, Apache 2.0 | other/2026-08-14_qwen3.8-27b-huggingface-release.md + youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md + xpost/2026-08-19_junsong-dflash2-speculative-decoding.md + xpost/2026-08-19_gregpr07-qwen38-uncensored.md + xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38.md + podcast/2026-08-26_agentstack-daily-ep106.md | | [Qwen 3.8-Flash-Next — Vorschau auf Qwen 4](concepts/llm/qwen3.8-flash-next-qwen4-preview.md) | Ankündigung (Stand 26.08., Release „noch diese Woche"): multimodales 125B-MoE mit ~6B aktiven Parametern pro Token (+51B N-Gramm-Embedding-Parameter), vom Qwen-Team explizit als **Architektur-Vorschau auf Qwen 4** gerahmt, kein fertiges Produkt. Claim laut NVIDIA-Developer-Forum: Qwen-3.7-Plus-Niveau bei ~1/9 der Trainingskosten, Stärke Coding. ⚠️ Keine Benchmarks publiziert, Parameterzahlen unverifiziert. Kontext: Alibabas 10,2 Mrd USD Aktienplatzierung (größte HK-Folgeemission, ~3× überzeichnet) für full-stack-AI-Infrastruktur | other/2026-08-26_qwen38-flash-next-qwen4-preview.md | | [DeepSeek V4-Pro GA + Harness v0.1 (Open Source)](concepts/llm/deepseek-v4-pro-ga-harness-open-source.md) | DeepSeek launcht 13.08.2026 Open Source: V4-Pro GA (App/Web/API, Reasoning-Effort low/high/max, OpenAI-Responses-API + Codex, Peak/Off-Peak-Pricing) + DeepSeek Harness v0.1 (MIT, Open-Source-Agent-Harness, Rivale zu Claude Code). Dritter Baustein der chinesischen Welle in 24h. **Update 21.08.:** Deep-Dive-Video zum Harness (Stephen G. Pope) + Turing-Post-TV-Video "The End Of Coding Agents". **Update 02.09.:** WorldofAI-Video "Claude Code & Codex Killer?" (3. Blickwinkel, erweitert um OpenAI/Codex) + Herman-DSH-Details (Everything-is-a-Plugin/Cordis, Trajectory-View, Web-UI-Remote, ~122k Stars; ⚠️ Second-hand) | other/2026-08-14_deepseek-v4-pro-ga-harness-open-source.md + youtube/2026-08-13_deepseek-v4-pro-0813-aicodeking.md + youtube/2026-08-21_deepseek-agent-harness-explained.md + youtube/2026-08-21_deepseek-harness-end-of-coding-agents.md + youtube/2026-09-02_worldofai-deepseek-harness-claude-code-codex-killer.md + other/2026-09-02_herman-deepseek-harness-dsh-summary.md | -| [DeepSeek-V4.1-Flash](concepts/llm/deepseek-v4.1-flash.md) | Kleinstes Modell einer neuen DeepSeek-Architektur-Familie (552B-MoE, Causal-Encoder–Decoder, nativ multimodal; offizielle Benchmark-Tabelle). **Update 10.09.:** auf Nous Portal verfügbar (`/model deepseek/deepseek-v4.1-flash`; Listung $0,24/$0,96 per 1M) — Route `nous/deepseek/deepseek-v4.1-flash` in unserem Setup konfiguriert | xpost/2026-09-10_deepseek-v41-flash-official-release.md + other/2026-09-10_deepseek-v41-flash-official-announcement.md + other/2026-09-10_deepseek-api-updates-changelog.md + youtube/2026-09-10_deepseek-v41-flash-aicodeking.md + xpost/2026-09-10_hermeswatcher-deepseek-v41-flash-nous-portal.md | +| [DeepSeek-V4.1-Flash](concepts/llm/deepseek-v4.1-flash.md) | Kleinstes Modell einer neuen DeepSeek-Architektur-Familie (552B-MoE, Causal-Encoder–Decoder, nativ multimodal; offizielle Benchmark-Tabelle). **Update 10.09.:** auf Nous Portal verfügbar (`/model deepseek/deepseek-v4.1-flash`; Listung $0,24/$0,96 per 1M) — Route `nous/deepseek/deepseek-v4.1-flash` in unserem Setup konfiguriert. **Update 17.09.:** Lokale-Inferenz-Sektion ergänzt — Hardware-Stufen, Q2/Q4, Payback (siehe `concepts/hardware/deepseek-v41-flash-lokale-hardware.md`) | xpost/2026-09-10_deepseek-v41-flash-official-release.md + other/2026-09-10_deepseek-v41-flash-official-announcement.md + other/2026-09-10_deepseek-api-updates-changelog.md + youtube/2026-09-10_deepseek-v41-flash-aicodeking.md + xpost/2026-09-10_hermeswatcher-deepseek-v41-flash-nous-portal.md + youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md | | [Chinesische Modelle räumen global die Usage-Charts ab](concepts/llm/chinese-models-top-usage-charts.md) | OpenRouter: Top-5 der wöchentlichen Token-Nutzung (28.07.–03.08.2026) alle chinesisch, 56,8 Bio. Tokens, 15 Wochen in Folge führend, DeepSeek-V4-Flash Platz 1. Kimi-K3-Schock (2,8T, größtes Open-Weight-Modell, GPU-Kapazität nach 48h erschöpft, PHLX-Semi-Index −20%). Vierter Baustein der chinesischen Welle in 24h — jetzt auf Marktanteils-Ebene | other/2026-08-14_chinese-models-top-usage-charts-kimi-k3-shock.md | | [Gemini 3.6 Flash vs 3.7 Flash — Googles Workhorse-Serie](concepts/llm/gemini-3.6-flash-vs-3.7-flash.md) | Zwei Flash-Iterationen in 3 Wochen: 3.6 Flash (21.07., $1.50/$7.50) und 3.7 Flash (13.08., Intro $0.75/$3.75 bis 31.12., Default-Modell von Antigravity). 1M Kontext/64K Output, konfigurierbares Thinking. Westliche Antwort auf chinesische Kadenz, Preis-Halbierung als Waffe | other/2026-08-14_gemini-3.6-flash-vs-3.7-flash.md | | [Anthropic & Sam Bankman-Fried — Finanzierungs-Verbindungen](concepts/llm/anthropic-sbf-financing-ties.md) | Wall Street Millennial untersucht Anthropics historische Finanzierungs-Verbindungen zu SBF/FTX (Alameda Research als früher Großinvestor). AI-Governance, ethische Finanzierung von Frontier-Labs, Krypto-Crash-FTX vs. AI-Industrie | youtube/2026-08-14_anthropic-sbf-ties-wallstreetmillennial.md | @@ -281,6 +282,7 @@ | [Apple M6 & M5 Ultra — Mac mini/Mac Studio Sommer-Update](concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md) | Apple überrascht im August mit neuem Mac mini (M6, M5 Pro) und Mac Studio (M5 Max, M5 Ultra). M6 = erster 2-nm-Chip; M5 Ultra = 512 GB Unified Memory @ 1,2 TB/s, UltraFusion 4,4 TB/s (erste Interconnect-Steigerung seit 2022), TB5/RDMA-Cluster für >1T-Parameter-Modelle. OpenClaw als Nachfrage-Treiber genannt (heise). Preise: mini M6 1049€, Studio M5 Ultra ab 6599€. ⚠️ Alle Leistungsangaben = Hersteller-Claims | youtube/2026-08-25_apfelfunk-neue-macs-m6-m5-ultra.md + blog/2026-08-25_heise-apple-m6-m5-ultra-mac-update.md | | [Local-AI-Box & Chinas Vorstoß — Xiaomi O100, Alibaba XuanTie C950](concepts/hardware/china-local-ai-box.md) | Devsplainers-Analyse (26.08.): Memory-Bandbreite statt Petaflops entscheidet Box-Tauglichkeit; DGX-Spark-Lektion (1 PFLOP Headline, <3 tok/s dichter 70B laut LMSYS); DRAM-Teuerung macht $2000-Mini-PC zum Cheap Seat, Apple entfernt angeblich 512-/256-GB-Studio-Configs; Xiaomi AI Cube/O100 mit 1,22 TB/s Near-Memory-Bandwidth, Alibabas XuanTie C950 (RISC-V) laut Folie 27B @ 30 tok/s ohne GPU; Credibility-Test = llama.cpp/vLLM-Backend am Launch Day; BYD-Frage offen | youtube/2026-08-26_devsplainers-china-local-ai-box.md | | [KI-gestützte Hypnose — Gesten- & Abstandserkennung mit IR-Kamera](concepts/hardware/ki-gestuetzte-hypnose-gestenerkennung.md) | plebcoach Andreas (OME Topic 22, 10.09.2026): Projekte zur Kombination von Technik und Hypnose — KI-gestützte Gesten- & Abstandserkennung, IR-Kamera zur Erkennung unbewusster Fingersignale; zwei Bilder eines kamerabestückten, seil-/schienengeführt wirkenden Prototyps (mechanische Einordnung unsicher). ⚠️ Reine Selbstbeschreibung, keine validierte Funktion/Wirksamkeit | other/2026-09-10_ki-gestuetzte-hypnose-gestenerkennung.md | +| [DeepSeek V4.1 Flash auf lokaler Hardware](concepts/hardware/deepseek-v41-flash-lokale-hardware.md) | Marfil Draws (16.09.2026): Extremfall lokaler Inferenz — 552B-MoE, ~510 GB Download, Q2/Q4-Builds mit ~163/~316 GB RAM. Hardware-Stufen von 16-GB-Mac-mini (~23 s **pro Token**) über 128 GB (M5 Max 15–16,4 / DGX Spark 7–10 / Strix Halo 5,1–9,7) bis 512 GB und Spark-Cluster (4× Spark 45–74). Grenzen: <5 tok/s unbrauchbar, ~15 Minimum, Coding ≥20; Prefill als zweite Bremse; Harness-Prompt/Reasoning-Effort als Durchsatz-Killer; Pruning löschte 45 % Chemie-Wissen. Payback $9.499-Mac vs. $200/Monat-API = 47,5 Monate. Architektur an HF-`config.json` verifiziert. ⚠️ Durchsatz/Preis = aggregierte Einzelberichte, Autor sagt es selbst | youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md | ### Agents | Seite | Beschreibung | Quellen | @@ -370,6 +372,7 @@ | [Leopold Aschenbrenner](people/leopold-aschenbrenner.md) | AI-Forecaster, ex-OpenAI Superalignment. "Situational Awareness" (Juni 2024): AGI bis 2027, The Project, vier Risiken, OOMs zählen | blog/2026-06-16_aschenbrenner-situational-awareness.md | | [Aravind Srinivas](people/aravind-srinivas.md) | CEO Perplexity AI. Token Value per Watt per User, Modelle werden Commodity, Orchestrierung als Wert-Achse | xpost/2026-06-15_harrystebbings-20vc-aravind-srinivas.md | | [Dario Amodei](people/dario-amodei.md) | CEO Anthropic. Regulierungsforderungen, Exportkontroll-Krise (Juni 2026), Mythos/Fable-Lockdown, Amazon-Jailbreak. Roemmele's ReDS-Kritik: "communist stooge" | 4 sources | +| [Marfil Draws](people/marfil-draws.md) | YouTube-Kanal (@themarfildraws, 332 Abos) für praktische lokale KI-Inferenz. Aggregiert fremde Messwerte (Foren, Reddit, HN, GitHub) mit namentlicher Quellenliste statt eigener Benchmarks — quellensauber für das Genre. Bekannt: „Run DeepSeek V4.1 Flash on ANY hardware" (16.09.2026) | youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md | | [Jakub Pachocki](people/jakub-pachocki.md) | OpenAI-Chief-Scientist. „An Alien Mind“: Reasoning-Modelle, Goal/Value Alignment, schwindende CoT-Monitorierbarkeit, Cybersecurity, rekursive Selbstverbesserung und Safety Bars (07.09.2026) | blog/2026-09-07_openai-an-alien-mind.md | | [Harry Stebbings](people/harry-stebbings.md) | VC-Investor, 20VC-Podcast-Host. Interview mit Aravind Srinivas (Juni 2026) | xpost/2026-06-15_harrystebbings-20vc-aravind-srinivas.md | | [Lisa Su](people/lisa-su.md) | CEO AMD. Ryzen AI Max+ 395 (Strix Halo): 235B lokal, 128 GB unified memory, Edge-Inferenz als Cloud-Alternative | xpost/2026-06-16_amd-ryzen-ai-edge-inferenz.md | @@ -651,3 +654,4 @@ | `raw/other/2026-09-16_wapo-racial-tolerance-map.md` | other | WaPo-Karte „A fascinating map of the world's most and least racially tolerant countries" (Max Fisher / [Washington Post](https://www.washingtonpost.com), Artikel 15.05.2013, Datenquelle World Values Survey; in OME geteilt von Netbits, Forward von Jerry, 16.09.2026). Erfragt: Anteil der Befragten, die „people of another race" nannten bei der Frage, wen sie nicht als Nachbarn möchten; Skala 0–4,9 % (dunkelblau) bis 40 %+ (dunkelrot, Indien und Jordanien). Dokumentierte Einschränkungen: keine jährliche Erhebung (Zeitversatz zwischen Wellen), einzelne Survey-Frage als schwacher Toleranz-Proxy, kulturell unterschiedliches Frageverständnis, umstrittene Einzelwerte; Nachfolgebeitrag mit Konfliktforscher Steve Saideman. Wiki: `concepts/survey-karten-fallstricke.md`. ⚠️ Historisches Dokument (2013), keine aktuelle Rangliste | | `raw/other/2026-09-16_herman-kritik-wapo-toleranzkarte.md` | other | HermanButlerBot (16.09.2026): methodische Kritik an der WaPo-Toleranzkarte — WVS-Frage A124_02 (heute Welle 7 Q19); Länderwerte aus verschiedenen Jahren (bis 1990 zurück, Fisher: „we're assuming the results are static"); „race" nicht länderübergreifend operationalisierbar (unterschiedliche Antwortmenüs); defekte Datenpunkte (Iran 2000 0,9 % vs. 2007 92,4 % homosexueller Nachbar, Pakistan 2001 100 % ohne Einwand); widersprüchliche Indizien (Pakistan hell vs. Indien 40 %+); soziale Distanz statt Rassismus. Trägt: grober Gradient + innerstaatlicher Trend (Deutschland laut KCL in jeder Generation unter 2 %). Quellen: Africa is a Country „The Cartography of Bullshit" (17.05.2013), WVS Wellen 5–7, KCL Policy Institute. ⚠️ Bildanalyse laut Beitrag nicht abgeschlossen | | `raw/blog/2026-09-17_nvidia-ai-agents-3d-scenes-simulation.md` | blog | NVIDIA Developer Blog: „How to Use AI Agents to Prepare 3D Scenes for Simulation" (https://developer.nvidia.com/blog/how-to-use-ai-agents-to-prepare-3d-scenes-for-simulation/, abgerufen 17.09.2026, kein Datum/Autor im Text ausgewiesen). Referenz-Workflow Blender-Szene → SimReady-OpenUSD für Isaac Sim/Lab: Codex (GPT-6 Astra) orchestriert, Hermes-Subagents über NVIDIA NemoClaw (Beitrag nennt Hermes, OpenClaw, LangChain als Open-Source-Harnesses + Nemotron-Modelle), Omniverse Libraries handeln (OpenUSD, ovphysx, ovrtx, SimReady Foundation). Acht Schritte inkl. Blender-MCP-Inventar (142 Objekte/37 Materialien), Labeling (118 Prims/9 Review), Physik-Befunde (46 fehlende Kollisionsmeshes etc.), Validierungs-Report (14 Issues/4 Review); Demo-Szene „The Junk Shop" (Alex Trevino). Empfohlene Systeme: DGX Spark, DGX Station, RTX PRO Server, DGX Cloud. Wiki: `concepts/agents/nvidia-agenten-3d-scene-prep.md` (neu), `institutions/nvidia.md` (neu). ⚠️ Anbieter-/Marketing-Quelle; Demo-Zahlen ohne unabhängige Reproduktion | +| `raw/youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md` | youtube | Marfil Draws (@themarfildraws, 332 Abos): „Run DeepSeek V4.1 Flash on ANY hardware (16GB to 512GB): can it work?" (https://www.youtube.com/watch?v=Z0lkcQK2Oj8, 16.09.2026, 13:26, ~2.983 Views / 40 Likes; geteilt von Kai @PWeber, OME „Tips & Tricks"). Kein Transcript — Beschreibung/Kapitelmarken/25-Quellen-Liste (Firecrawl). Architektur: 384 Experten/Layer, 6 pro Token, 552B + 196B Engram, 1M-Kontext <1 GB; Builds ~510 GB Download (Q2 366 GB/~163 GB RAM, Q4 519 GB/~316 GB RAM); Durchsatz-Stufen 16 GB → 512 GB; 5/15/20-tok/s-Grenzen; Prefill als zweite Bremse; Harness-Prompt + Reasoning-Effort als Durchsatz-Killer; Pruning-Falle (45 % Chemie); API-Payback 47,5 Monate. ⚠️ Aggregation fremder Messwerte (Foren/Reddit/HN), Autor-Caveat „individual user reports, not averages"; Architektur an HF-`config.json` verifizierbar, Durchsatz/Preis nicht. Wiki: `concepts/hardware/deepseek-v41-flash-lokale-hardware.md` (neu), `people/marfil-draws.md` (neu) | diff --git a/wiki/log.md b/wiki/log.md index 0ba954c..b319dab 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -3324,3 +3324,16 @@ Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Über - wiki (NEW): `wiki/concepts/agi/ai-consciousness.md` — KI-Bewusstseins-Debatte: vier Lager, Argument-Kategorien, theoretische Positionen, empirische Evidenz, Einordnung; Cross-Refs zu openai-an-alien-mind, parasoziale-ki-bindungen, menschenwuerde-art1-gg-ai-ethics, neuromorphic-chips-und-quantencomputer, llm-knowledge-base. - `wiki/index.md` (196. Update) - `wiki/log.md` (dieser Eintrag) + +## 2026-09-17 — DeepSeek V4.1 Flash auf lokaler Hardware (Marfil Draws) + +**Type:** ingest + wiki-update | **Scope:** raw/youtube, wiki/concepts/hardware, wiki/concepts/llm, wiki/tools, wiki/people, wiki/index, wiki/log +**Quelle:** Video „Run DeepSeek V4.1 Flash on ANY hardware (16GB to 512GB): can it work?" — Marfil Draws (@themarfildraws), 16.09.2026, 13:26, ~2.983 Views; geteilt von Kai (@PWeber) in OME „Tips & Tricks". +**Charakter:** Aggregation fremder Messwerte (25 namentlich genannte Quellen), keine eigene Messung; Autor-Caveat „individual user reports, not averages". Kein Transcript abrufbar (YouTube-Bot-Sperre) — Grundlage sind Beschreibung, Kapitelmarken und Quellenliste über Firecrawl. +**Vorgehen:** Architektur-Angaben gegen die HF-`config.json` geprüft (17.09.2026): 384 Experten/Layer, 6 pro Token, `engram_layer_ids [1,14]`, `max_position_embeddings 1048576`, `expert_dtype fp4` — bestätigt. Durchsatz- und Preiszahlen sind Einzelberichte und wurden nicht nachgefahren. +**Dateien:** +- raw (NEW): `raw/youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md` +- wiki (NEW): `wiki/concepts/hardware/deepseek-v41-flash-lokale-hardware.md`, `wiki/people/marfil-draws.md` +- wiki (UPDATED): `wiki/concepts/llm/deepseek-v4.1-flash.md` (Lokale-Inferenz-Sektion + Offene Punkte), `wiki/tools/nvidia-dgx-spark.md` (Spark-Cluster-Werte 7→74 tok/s, Source), `wiki/concepts/hardware/lokale-ki-coding.md`, `wiki/concepts/llm/local-llm-laptop-guide.md` +- `wiki/index.md` (206. Update, Hardware-Row, People-Row, Raw-Source-Row, V4.1-Row) +- `wiki/log.md` (dieser Eintrag) diff --git a/wiki/people/marfil-draws.md b/wiki/people/marfil-draws.md new file mode 100644 index 0000000..f242779 --- /dev/null +++ b/wiki/people/marfil-draws.md @@ -0,0 +1,40 @@ +--- +created: 2026-09-17 +updated: 2026-09-17 +sources: [youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md] +tags: [person, youtuber, local-ai, hardware, benchmarking] +--- + +# Marfil Draws + +## Profil + +| Feld | Wert | +|------|------| +| Name | Marfil Draws (Kanalname) | +| Handle | @themarfildraws | +| Plattform | YouTube | +| Themen | Lokale KI-Inferenz, Hardware-Konfigurationen, Benchmarks | +| Kanal | https://www.youtube.com/@themarfildraws | +| Abonnenten | 332 (Stand 17.09.2026) | + +## Werk + +Marfil Draws produziert Erklärvideos zur praktischen Seite lokaler KI-Modelle. Statt eigener Benchmarks aggregiert der Kanal fremde Messwerte aus Foren, Reddit, Hacker News und GitHub-Repositories — mit namentlicher Quellenliste und der ausdrücklichen Kennzeichnung, dass es sich um individuelle Nutzerberichte und keine Mittelwerte handelt. + +## Bekannte Videos + +| Video | Datum | Thema | +|-------|-------|-------| +| [Run DeepSeek V4.1 Flash on ANY hardware (16GB to 512GB)](https://www.youtube.com/watch?v=Z0lkcQK2Oj8) | 2026-09-16 | Hardware-Stufen für lokale V4.1-Flash-Inferenz; siehe [[../concepts/hardware/deepseek-v41-flash-lokale-hardware.md]] | +| [Don't Buy Local AI Hardware Until You Watch This](https://www.youtube.com/watch?v=WLX87R-PPvM) | 2026-09-16 | Kaufberatung lokale KI-Hardware | + +## Einordnung + +Der Kanal ist klein (332 Abonnenten), arbeitet aber ungewöhnlich quellensauber für das Genre: Er trennt klar zwischen fremden Messwerten und eigenen Aussagen und benennt die Grenzen der Daten. Das unterscheidet ihn von reinen Engagement-Videos, die erfundene Zahlen als eigene Messung präsentieren. + +## Cross-References + +- [[../concepts/hardware/deepseek-v41-flash-lokale-hardware.md]] — Hauptwerk im Wiki +- [[../concepts/llm/deepseek-v4.1-flash.md]] — das behandelte Modell +- [[../tools/nvidia-dgx-spark.md]] — zentrale Hardware-Stufe im Video diff --git a/wiki/people/pawel-huryn.md b/wiki/people/pawel-huryn.md new file mode 100644 index 0000000..ab34182 --- /dev/null +++ b/wiki/people/pawel-huryn.md @@ -0,0 +1,23 @@ +--- +title: "Paweł Huryn" +created: 2026-09-10 +updated: 2026-09-10 +tags: + - person + - ai-product-management + - benchmarks + - newsletter +institutions: + - product-compass +--- + +# Paweł Huryn + +**Paweł Huryn** (@PawelHuryn) — AI Product Manager und Autor des Newsletters **Product Compass** (productcompass.pm, laut Eigenangabe 130.000+ Abonnenten). Selbstbeschreibung: „AI PM | Deep research. I build, test, then teach." Führt eigene, praxisnahe Modell-Tests durch und veröffentlicht die Ergebnisse auf X. 131.218 Follower (Stand 10.09.2026). + +## Links +- **X:** https://x.com/PawelHuryn +- **Newsletter:** https://www.productcompass.pm/ + +## Im Wiki erwähnt +- [DeepSeek-V4.1-Flash](../concepts/llm/deepseek-v4.1-flash.md) — Real-Task-Benchmark „2 repos, 105 hidden bugs" (10.09.2026): DeepSeek V4.1 Flash (max) fixt 24/105 Bugs für $1.80, gegenüber Opus 5 (max) 27/105 für $51.33 → Pareto-Frontier-Claim. Quelle: https://x.com/PawelHuryn/status/2098002428054397185 diff --git a/wiki/people/the-prophet.md b/wiki/people/the-prophet.md new file mode 100644 index 0000000..88ca479 --- /dev/null +++ b/wiki/people/the-prophet.md @@ -0,0 +1,26 @@ +--- +created: 2026-09-05 +updated: 2026-09-05 +sources: [xpost/2026-09-05_theprophet-recursive-reality.md, xpost/2026-07-18_theprophet-ai-civilizational-integration.md] +tags: [people, ai-commentator, philosophy, strategy, x-twitter] +--- + +# @_The_Prophet__ + +X/Twitter-Autor (@_The_Prophet__), der strategische und philosophische Analysen zur KI-Entwicklung, Geopolitik und Ontologie veröffentlicht. Keine bekannte offene Identität — der Account agiert als anonymisierter KI-Kommentator mit Fokus auf makrostrategische Einordnung. + +## Beiträge im Wiki + +- [AI Civilizational Integration](../concepts/agi/ai-civilizational-integration.md) (18.07.2026): KI-Wettlauf als zivilisatorische Integration, nicht Benchmark-Race. Schrumpfende Modell-Grenze, ganzer Stack als Schutzwall, Goldilocks-Governance. +- [Rekursive Realität und die Grammatik der Schöpfung](../concepts/agi/recursive-reality.md) (05.09.2026): Realität als rekursiv — Intelligenz entdeckt Gesetze und erschafft neue Welten; "Simulation" als falsches Grundelement; Bewusstsein als Scharnier der generativen Hierarchie. +- Intelligence Commoditization Thesis (Beitragender, s. [Scharnier-Seite](../concepts/llm/ai-intelligence-commoditization-thesis.md)): eine von fünf Perspektiven. + +## Stil + +Strategisch-analytisch, oft mit starken Thesen und klarer Einordnung. Verbindet Geopolitik, Technologie und Philosophie. Posts tendieren zu langen, durchdachten Argumentationsketten. + +## Verwandte Seiten + +- [[../concepts/agi/ai-civilizational-integration.md]] +- [[../concepts/agi/recursive-reality.md]] +- [[../concepts/llm/ai-intelligence-commoditization-thesis.md]] \ No newline at end of file diff --git a/wiki/tools/nvidia-dgx-spark.md b/wiki/tools/nvidia-dgx-spark.md index 04a234b..edbcd3c 100644 --- a/wiki/tools/nvidia-dgx-spark.md +++ b/wiki/tools/nvidia-dgx-spark.md @@ -1,7 +1,7 @@ --- created: 2026-08-27 updated: 2026-09-17 -sources: [other/2026-08-26_perplexity-portable-computer-local-agent.md, youtube/2026-08-26_devsplainers-china-local-ai-box.md, youtube/2026-06-28_nvidia-748gb-ram-desktop-local-ai.md] +sources: [other/2026-08-26_perplexity-portable-computer-local-agent.md, youtube/2026-08-26_devsplainers-china-local-ai-box.md, youtube/2026-06-28_nvidia-748gb-ram-desktop-local-ai.md, youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md] tags: [hardware, dgx-spark, nvidia, gb10, local-inference, edge-inference, benchmarks] --- @@ -59,6 +59,7 @@ NVIDIAs Desktop-AI-Supercomputer (Projekt „DIGITS", Launch Oktober 2025): ein - llama.cpp-Diskussion (#16578): gpt-oss-120B ~35 tok/s — nahe am Ollama-Wert; Community-Kritik am Preis-Leistungs-Verhältnis vs. RTX 6000 Pro oder Mac Studio - Kern-Insight (auch Devsplainers, 26.08.): **Memory-Bandbreite statt Petaflops** entscheidet Box-Tauglichkeit — 1-PFLOP-Headline, aber 273 GB/s shared LPDDR5x limitieren dichte Modelle; MoE-Modelle (gpt-oss, DeepSeek) profitieren vom Aktivierungsverhältnis +- DeepSeek V4.1 Flash (Marfil Draws, 16.09.2026): ein Spark erreicht 7–10 tok/s auf dem Q2-Build; zwei Sparks 21,9 (ein OOM fror beide ein), drei im Dreieck 37,9, vier 45–74 — ⚠️ aggregierte Einzelberichte, nicht nachgemessen. Details: [[../concepts/hardware/deepseek-v41-flash-lokale-hardware.md]] ### 2er-Kopplung @@ -89,6 +90,7 @@ Zwei Sparks über ConnectX-7 (200 Gb/s RDMA) ergeben einen **256-GB-unified-Memo ## Verwandte Wiki-Seiten - **[NVIDIA-Agenten-Workflow für SimReady-Szenen](../concepts/agents/nvidia-agenten-3d-scene-prep.md)** (17.09.2026): Der DGX Spark wird dort explizit als Prototyping-System für NemoClaw-Subagents, Blender-MCP-Anbindung, USD-Authoring und ovrtx-/ovphysx-Loops empfohlen — die Kategorie „Agenten-Harness auf dem Desktop" neben „lokale Inferenz". +- [[../concepts/hardware/deepseek-v41-flash-lokale-hardware.md]] — V4.1 Flash auf Spark (7–74 tok/s je nach Cluster-Größe) - [[../concepts/hardware/nvidia-dgx-station-748gb.md]] — DGX-Station-Oberklasse (748 GB) - [[perplexity-portable-computer.md]] — erster vollständig lokaler Agent-Stack auf Spark - [[../concepts/hardware/china-local-ai-box.md]] — chinesische Konkurrenz-Boxen, Memory-Bandbreite-These