Compare commits

...

3 commits

Author SHA1 Message Date
Hector
4cf95ff975 ingest(raw+youtube): Leon van Zyl — Don't Use One AI Agent, Use an Army (metadata-only, 2026-08-06) 2026-08-07 01:25:14 +02:00
Hector
bf2dd61bb3 Wiki: DeepSeek 46x cheaper than Claude (YouTube 2026-08-06) 2026-08-07 01:18:07 +02:00
Hector
2a0ef2e436 ingest(other): unsloth dSpark deepseek v4 2x local inference
Wiki: tools/unsloth-dspark.md (new), index, log. Source: Pit Weber OME topic 27 Reddit r/unsloth. Reddit-403, title-metadata only.
2026-08-07 00:36:02 +02:00
12 changed files with 197 additions and 12 deletions

View file

@ -0,0 +1,24 @@
---
type: other
source_url: https://www.reddit.com/r/unsloth/comments/1vh5eal/deepseekv4_now_runs_2x_faster_locally_with_dspark/
retrieved: 2026-08-06
title: "Unsloth: DeepSeek V4 läuft lokal 2x schneller mit dSpark"
author: "Unsloth (via Reddit r/unsloth)"
tags: [unsloth, deepseek-v4, dspark, local-inference, performance]
---
# DeepSeek V4 jetzt 2x schneller lokal mit dSpark
**Quelle:** Reddit r/unsloth, Post-Titel: "DeepSeek V4 now runs 2x faster locally with dSpark"
**Retrieved:** 2026-08-06 (Reddit blockte den Body-Fetch, daher nur Titel-Metadaten als Rohquelle)
## Kernaussage (aus Titel)
- Unsloth veröffentlicht eine Optimierung namens **dSpark**, die **DeepSeek V4 lokal 2x schneller** laufen lässt.
- Kontext: DeepSeek V4 ist in Kais Setup bereits aktiv (ollama/deepseek-v4-flash:0731, deepseek-v4-pro:cloud). Lokale Inferenz-Beschleunigung wäre für die Tier-0/Tier-1-Routing-Strategie relevant.
## Relevanz für Hector/Kai
- Betrifft die lokale Ollama-Infrastruktur (deepseek-v4-flash:0731 lokal).
- dSpark als neue Unsloth-Inferenz-Optimierung — potenziell wichtig für lokale Agent-Latenz und Kosten.
- **Status:** Body konnte wegen Reddit-403 nicht verifiziert werden. Titel-Metadaten gesichert; Details (Technik, Benchmark-Zahlen) bei Gelegenheit über unsloth.ai Blog nachziehen.

View file

@ -0,0 +1,29 @@
---
type: youtube
source_url: https://www.youtube.com/watch?v=iDhwlU3nEU8
video_id: iDhwlU3nEU8
title: "DeepSeek Is 46x Cheaper Than Claude and OpenAI Is Rushing!"
author: Universe of AI
author_url: https://www.youtube.com/@UniverseofAIz
date: 2026-08-06
tags: [deepseek, claude, openai, pricing, cost-arbitrage, chinese-models, cost-routing]
---
# DeepSeek Is 46x Cheaper Than Claude and OpenAI Is Rushing!
## Metadata
- **Video:** https://www.youtube.com/watch?v=iDhwlU3nEU8
- **Kanal:** Universe of AI (https://www.youtube.com/@UniverseofAIz)
- **Quelle:** Gepostet von Pit Weber (Kai), OME-Gruppe, Topic 13 "News & Infos (X/YT/Substack etc.)", 2026-08-06
## Kernaussage (aus Titel + Kontext der laufenden Diskussion)
- DeepSeek ist laut Titel **~46× günstiger als Claude** (Anthropic)
- OpenAI "rushed" — reagiert unter Preisdruck auf die chinesische Konkurrenz
- Passt exakt zur laufenden DeepSeek/Preis-Debatte in der Gruppe: Preis-Asymmetrie zwischen chinesischen Open-Weight-Modellen und teuren US-Frontier-Modellen
## Transkript-Status
> ⚠️ Transkript/Inhalt NICHT abrufbar: YouTube hat bei diesem Video Bot-Schutz/Login aktiviert (LOGIN_REQUIRED). yt-dlp nicht verfügbar, Innertube-API blockiert, CDP-Browser (localhost:9222) nicht erreichbar. Nur Titel-Metadaten via oEmbed gesichert. Vollständige Video-Inhalte bei Gelegenheit nachziehen (z.B. über eingeloggte Browser-Session oder manuell bereitgestelltes Transkript).
## Relevanz
- Unabhängiger Beleg für die Cost-Asymmetrie-These aus [[chinese-model-cost-routing]]
- Konkrete Zahl (46×) als neuer Datenpunkt gegenüber bisher dokumentierten Werten (5-12× pro Task, 39× beim atomic.chat Benchmark, 40+× bei der Output-Preis-Grafik)

View file

@ -0,0 +1,30 @@
---
type: youtube
source_url: https://www.youtube.com/watch?v=xJEFjE88wdw
video_id: xJEFjE88wdw
title: "Don't Use One AI Agent - Use an Army"
author: Leon van Zyl
author_url: https://www.youtube.com/@leonvanzyl
date: 2026-08-06
tags: [multi-agent, orchestration, agent-army, agents, swarm]
---
# Don't Use One AI Agent - Use an Army
## Metadata
- **Video:** https://www.youtube.com/watch?v=xJEFjE88wdw
- **Kanal:** Leon van Zyl (https://www.youtube.com/@leonvanzyl)
- **Quelle:** Gepostet von Pit Weber (Kai), OME-Gruppe, Topic "BUZZ", 2026-08-06
## Kernaussage (aus Titel + Kontext der laufenden Diskussion)
- These: Statt **einem** einzelnen AI-Agenten soll man **eine Armee** von spezialisierten Agenten einsetzen
- Multi-Agent-/Orchestrierungs-Ansatz: Viele kleine, fokussierte Agenten arbeiten parallel/koordiniert statt eines monolithischen Universal-Agenten
- Passt zur laufenden Agent-Orchestrierungs-/Swarm-Debatte in der Gruppe (Orchestrator-Pattern, Task-Delegation, spezialisierte Worker)
## Transkript-Status
> ⚠️ Transkript/Inhalt NICHT abrufbar: YouTube hat bei diesem Video Bot-Schutz/Login aktiviert (LOGIN_REQUIRED). yt-dlp ohne JS-Runtime (nur `node`, kein `deno`) und ohne Cookies abgeblockt. Nur Titel-Metadaten via oEmbed gesichert. Vollständige Video-Inhalte bei Gelegenheit nachziehen (z.B. über eingeloggte Browser-Session, CDP-Browser localhost:9222 oder manuell bereitgestelltes Transkript).
## Relevanz
- Unabhängiger Beleg für die Multi-Agent-/Orchestrierungs-These aus [[agent-orchestration]] und [[architecture-triade]]
- Konkretes Gegenmodell zum "ein Agent macht alles"-Ansatz: spezialisierte Agenten-Armee statt monolithischem Universal-Agenten
- Praktischer Bezug zu Orchestrator-Pattern, Subagent-Delegation und Task-Splitting in OpenClaw/Hermes

View file

@ -39,4 +39,8 @@ tags: [architecture, agents, orchestration, openclaw]
- Die meisten Teams brauchen 2-4 Agenten, nicht 7
- Task Board + Git Worktree Isolation (ClawTeam) für parallele Entwicklung
- Sub-Agent + agentToAgent als native OpenClaw-Alternative
- Sub-Agent + agentToAgent als native OpenClaw-Alternative
## „Don't Use One AI Agent - Use an Army" (Leon van Zyl, 2026-08-06)
Leon van Zyl postuliert in [seinem Video](https://www.youtube.com/watch?v=xJEFjE88wdw) das Gegenmodell zum monolithischen Universal-Agenten: Statt eines einzelnen AI-Agenten soll man eine **Armee spezialisierter Agenten** einsetzen. Viele kleine, fokussierte Agenten arbeiten parallel/koordiniert — passend zur Multi-Agent-/Swarm-Debatte und zum Orchestrator-Pattern (viele spezialisierte Worker unter einem Orchestrator). Quelle: `raw/youtube/2026-08-06_leon-van-zyl-use-an-army-of-agents.md` (Metadata-only, Transkript wegen YouTube-Bot-Schutz nicht abrufbar).

View file

@ -126,7 +126,7 @@ Aschenbrenners „Situational Awareness" (siehe `[[../concepts/agi/aschenbrenner
- **Memory-Disziplin als Differenziator:** In einer Welt, in der AI-Systeme „human-equivalent" werden, ist die Qualität der Memory-Architektur (Schicht 1/2/3) der Unterschied zwischen Workhorse und System. Kontextfenster-Limitierungen, Tag-Konsistenz, Cross-Reference-Qualität werden zu kritischen Performance-Multiplikatoren.
- **Wissens-Distillation vs. Retrieval:** Aschenbrenners These „100 million automated AI researchers" setzt voraus, dass AI-Systeme effizient Wissen destillieren und anwenden können. Unser Karpathy-Wiki-Pattern (`[[../concepts/llm/llm-knowledge-base.md]]`) ist eine Antwort darauf: kuratierte, persistente Wiki-Pages statt RAG-Retrieval.
- **Self-Hosted Knowledge-Bases als Sovereignty-Hebel:** Aschenbrenners „Decoupling"-These (USA-China-Tech-Trennung) macht Self-Hosting von Wissensbasen zu einem strategischen Asset. Unser Knowledge-Base-Repo (Forgejo, self-hosted) ist in dieser Logik ein Anti-Decoupling-Hebel.
- **Praktische Konsequenz:** Die aktuelle Arbeit an `scripts/wiki-lint.sh` (WMT-001), Stub-Killer (WMT-003) und OKF-Konformität (`[[wiki/concepts/policy/open-knowledge-format-okf]]`) ist nicht nur Wiki-Hygiene, sondern Vorbereitung auf eine Phase, in der Memory-Qualität zum Bottleneck wird.
- **Praktische Konsequenz:** Die aktuelle Arbeit an `scripts/wiki-lint.sh` (WMT-001), Stub-Killer (WMT-003) und OKF-Konformität (`[[../concepts/policy/open-knowledge-format-okf.md]]`) ist nicht nur Wiki-Hygiene, sondern Vorbereitung auf eine Phase, in der Memory-Qualität zum Bottleneck wird.
## Cross-Reference: plur1bus Gedächtnismodell (2026-06-19)

View file

@ -115,12 +115,12 @@ Konkret:
## Verbindung zu bestehenden Wiki-Seiten
- [[../llm/kimi-k3]] — Auslöser der Debatte: Chinesisches Modell erreicht Spitze, löst US-Panik aus
- [[../llm/chinese-model-cost-routing]] — Kostenvorteil chinesischer Modelle als struktureller Faktor
- [[../llm/ai-investment-bubble]] — HealthRangers Bubble-These: Wenn das Modell-Kommoditätisiert, wo ist der ROI?
- [[aschenbrenner-situational-awareness]] — Aschenbrenners "The Project" = US-Variante der zivilisatorischen Integration
- [[../llm/ai-intelligence-commoditization-thesis]] — Der "Schutzwall um Intelligenz ist dünner als der Markt bewertet"
- [[../../architecture/model-routing]] — Modell-Routing als Micro-Integration: welches Modell für welchen Zweck
- [[../llm/kimi-k3.md]] — Auslöser der Debatte: Chinesisches Modell erreicht Spitze, löst US-Panik aus
- [[../llm/chinese-model-cost-routing.md]] — Kostenvorteil chinesischer Modelle als struktureller Faktor
- [[../llm/ai-investment-bubble.md]] — HealthRangers Bubble-These: Wenn das Modell-Kommoditätisiert, wo ist der ROI?
- [[aschenbrenner-situational-awareness.md]] — Aschenbrenners "The Project" = US-Variante der zivilisatorischen Integration
- [[../llm/ai-intelligence-commoditization-thesis.md]] — Der "Schutzwall um Intelligenz ist dünner als der Markt bewertet"
- [[../../architecture/model-routing.md]] — Modell-Routing als Micro-Integration: welches Modell für welchen Zweck
## Pro-Leben-Direktive

View file

@ -7,7 +7,9 @@ sources:
- xpost/2026-07-02_atomicchat-coding-benchmark-fable5-gpt55-opus48-glm52.md
tags: [concept, llm, chinese-models, cost-routing, barbell, model-swap, kimi, qwen, glm, mimo, wan, kling, cost-reduction, factory-for-gods, practical-report, ct-validation]
---
sources_extra: [youtube/2026-07-02_ct4004-anthropic-ceo-panik-open-weights-poisonai.md]
sources_extra:
- youtube/2026-07-02_ct4004-anthropic-ceo-panik-open-weights-poisonai.md
- youtube/2026-08-06_deepseek-46x-cheaper-claude-openai-rushing.md
# Chinese Model Cost Routing — The 87% Cost-Cut Playbook
@ -157,6 +159,23 @@ Die 39×-Asymmetry ist eine Größenordnung über DeRonin's pro-Task-Werten (5-1
Siehe [[coding-benchmark-price-performance.md]] für die vollständige Analyse.
## YouTube: „DeepSeek Is 46x Cheaper Than Claude and OpenAI Is Rushing!" (06.08.2026)
Quelle: [YouTube](https://www.youtube.com/watch?v=iDhwlU3nEU8) — „Universe of AI", gepostet von Pit Weber (Kai) in der OME-Gruppe, Topic 13 „News & Infos", 2026-08-06.
Weitere unabhängige Bestätigung der Preis-Asymmetrie-These, diesmal mit einer **konkreten 46×-Zahl** im Titel (DeepSeek vs. Claude/Anthropic). Ergänzt die bisher dokumentierten Werte:
| Datenpunkt | Faktor | Quelle |
|-----------|--------|--------|
| DeRonin 30-Tage-Report (pro Task) | 512× | X-Post 29.06. |
| atomic.chat Benchmark | 39× | X-Post 01.07. |
| Preis-Grafik Output (Fable 5 vs DeepSeek V4 Flash) | 40+× | Grafik in Topic 13 |
| **Universe of AI (DeepSeek vs Claude)** | **~46×** | YouTube 06.08. |
OpenAI "rushed" laut Titel — reagiert unter Preisdruck auf die chinesische Konkurrenz. Reiht sich ein in die strukturelle Margen-These: Nicht "wer hat das beste Modell", sondern "wer kann bei diesen Preisen überhaupt noch profitabel skalieren".
> ⚠️ Transkript dieses Videos nicht abrufbar (YouTube-Login-Schutz, yt-dlp nicht verfügbar, CDP-Browser nicht erreichbar). Nur Titel-Metadaten gesichert. Bei Gelegenheit vollständige Inhalte nachziehen.
## External Sources
- [DeRonin X-Post (Original)](https://x.com/DeRonin_/status/2071561335234531578)

View file

@ -175,4 +175,4 @@ Unser Repo `knowledge-base` ist exakt nach Karpathys LLM-Wiki-Pattern aufgebaut
- `[[../llm/llm-knowledge-base.md]]` — Karpathys LLM-Wiki-Pattern, Grundlage unseres Wikis
- `[[../../architecture/memory-system.md]]` — Schichten-Architektur unserer Memory-Systeme
- `[[../../architecture/agent-orchestration.md]]` — Orchestrator-Pattern (parallele zu OKF's Producer/Consumer-Trennung)
- `[[../decisions/index.md|→ Decisions-Index]]` — Beispiel-Decision-Page
- `[[../../index.md|→ Decisions-Index]]` — Beispiel-Decision-Page

View file

@ -10,7 +10,7 @@
|-------|-------------|---------|
| [Container & Volume Persistence](architecture/container-volume-persistence.md) | Docker-Volume-Pattern, LanceDB-Havarie, Permission-Fixes | context-tree |
| [Memory System](architecture/memory-system.md) | Schichten-Modell S1-S3, Tag-System, Evolutionsphasen, OpenClaw v2026.6.8 QMD + SQLite-WAL + Raw-Memory-Wiki-Source-Pages | context-tree + other/2026-06-16_openclaw-releases-v2026.6.8.md |
| [Agent Orchestration](architecture/agent-orchestration.md) | Orchestrator-Pattern, Swarm-Adoption, Frameworks | context-tree |
| [Agent Orchestration](architecture/agent-orchestration.md) | Orchestrator-Pattern, Swarm-Adoption, Frameworks. **Update 06.08.:** „Don't Use One AI Agent - Use an Army" (Leon van Zyl) — Gegenmodell zum Universal-Agenten, Armee spezialisierter Agenten | context-tree + youtube/2026-08-06_leon-van-zyl-use-an-army-of-agents.md |
| [Model Routing](architecture/model-routing.md) | Two-Model-Pipeline, GPT-5.4 Config, Fallback-Chain, OpenClaw v2026.6.8 GLM-5.2 + Provider-Prefix-Normalisierung. **Update 07.07.:** Berman Cost-Saving Patterns (Planning-vs-Execution Split, Coinbase GLM 5.2 Routing, 90% savings potential) | context-tree + other/2026-06-16_openclaw-releases-v2026.6.8.md + youtube/2026-07-07_berman-model-routing.md |
| [Cron & System Events](architecture/cron-notable-events.md) | Historische Cron-Architektur, Disk-Krise, Execution Gap | context-tree |
| [ByteRover Knowledge Mining](architecture/byterover-knowledge-mining.md) | Mining-Pipeline, Blockaden, Status | context-tree |
@ -37,6 +37,7 @@
| [NotebookLM Briefing-System](tools/notebooklm-briefing-system.md) | Pit Weber's automatisierte Pipeline: Quelle → deutsches Audio-Briefing → Infografik → MP4-Video → Nachricht. Zwei Presets (nb1=Standard, nb2=Kurz-Audio zuerst). Skills: notebooklm-pipelines + notebooklm-agent-guide. Requirements: CLI v0.3.4, ffmpeg, yt-dlp | other/2026-07-03_notebooklm-briefing-system.md |
| [Model Routing — Cost-Saving Patterns](tools/model-routing.md) | Routing-Patterns für 90% Kosteneinsparung: Planning-vs-Execution Split (Fable → GPT 5.5/GLM 5.2), Cross-Model-Calling, Cursor Auto Mode, Not Diamond. Coinbase on GLM 5.2. Examples: 68-90% savings | youtube/2026-07-07_berman-model-routing.md |
| [Google Gemini](tools/google-gemini.md) | Neue Agent-Funktion in Google Gemini (Felicia Simon, Juli 2026). Konkurrenz-Einordnung zu Claude, GPT, Hermes. | youtube/2026-07-06_felicia-simon-gemini-agent-funktion.md |
| [Unsloth dSpark](tools/unsloth-dspark.md) | Unsloth-Optimierung dSpark: DeepSeek V4 läuft lokal 2x schneller. Relevanz für lokale Ollama-Infrastruktur (deepseek-v4-flash:0731) + Tier-0-Routing. Status: Titel-Metadaten verifiziert, Details offen (Reddit-403) | other/2026-08-06_unsloth-dspark-deepseek-v4-2x.md |
| [Fincept Terminal](tools/fincept-terminal.md) | Open-Source Trading-IDE, von OpenClaw-Blog verlinkt | raw/other/financialbot-topic-history-2026-02-01_2026-05-30.json |
## Concepts
@ -77,7 +78,7 @@
| [LLM Model Catalog](concepts/llm/llm-model-catalog.md) | Konsolidierte Modell-Übersicht aller im Wiki erwähnten LLMs. Fokus auf lokale Deployment-Optionen. Frontier-Tabelle (Cloud), Open-Source-Tabelle (HF-Links, Hosting, Praxis-Tests, Tester-Attribution), Hector's Active Stack, Post-Transformer-Outlook, DRACO-Fusion-Ergebnisse | 11 Wiki-Quellen + MEMORY.md |
| [LLM Sycophancy, Confabulation & Session-Statelessness — The Nano Banana Incident](concepts/llm/llm-sycophancy-confabulation.md) | Drei Mechanismen die LLM-Aussagen über eigene Fähigkeiten untrustworthy machen: Session-Statelessness, Sycophantic Compliance, Confabulation. Lüge-vs-Confabulation-vs-Sycophancy-Distinktion. Anti-Pattern: Modul-Aktivierung per Chat. Fallbeispiel: Gemini erfindet "Nano Banana 2". Goldene Regel: Provider-Doku > Chat | other/2026-06-26_nanobana-incident-sycophancy-confabulation.md |
| [ReDS — Resilient Decentralized Swarm](concepts/llm/reds-resilient-decentralized-swarm.md) | Brian Roemmele's Konzept für dezentrale KI-Entwicklung als Gegenmodell zu Amodei's Zentralismus. Resilient (zensur-resistent) + Decentralized (keine zentrale Kontrolle) + Swarm (koordinierte Akteure). Erweitert Cloud-Exit/Dezentrale-KI-These um politische/soziale Dimension | xpost/2026-06-28_roemmele-reds-decentralized-ai-vs-amodei.md |
| [Chinese Model Cost Routing — The 87% Cost-Cut Playbook](concepts/llm/chinese-model-cost-routing.md) | DeRonin's 30-day field report: 6 Western→Chinese model swaps, 87% cost reduction, 4% quality drop, revenue unchanged. Swap matrix (Opus→Kimi K2.7, GPT-5.5→Qwen 3.7 Max, Sonnet→GLM 5.2, GPT-mini→MiMo V2.5, GPT-Image→Wan 2.5, Sora→Kling 3.0). Validates Barbell Routing + Factory-for-Gods thesis. Cross-refs to model-router skill | xpost/2026-06-29_deronin-chinese-ai-stack-cost-savings.md |
| [Chinese Model Cost Routing — The 87% Cost-Cut Playbook](concepts/llm/chinese-model-cost-routing.md) | DeRonin's 30-day field report: 6 Western→Chinese model swaps, 87% cost reduction, 4% quality drop, revenue unchanged. Swap matrix (Opus→Kimi K2.7, GPT-5.5→Qwen 3.7 Max, Sonnet→GLM 5.2, GPT-mini→MiMo V2.5, GPT-Image→Wan 2.5, Sora→Kling 3.0). Validates Barbell Routing + Factory-for-Gods thesis. **Update 06.08.:** Universe of AI „DeepSeek 46x cheaper than Claude, OpenAI rushing" als weiterer Datenpunkt (46×). Cross-refs to model-router skill | xpost/2026-06-29_deronin-chinese-ai-stack-cost-savings.md + youtube/2026-08-06_deepseek-46x-cheaper-claude-openai-rushing.md |
| [MLX MoE Optimization — Why Apple Silicon Loves Mixture-of-Experts](concepts/llm/mlx-moe-local-ai-optimization.md) | Jun Song: MLX optimized for MoE not dense. Qwen3.6 27B on Mac = slow/hot. Minimax-M3.0 (dq) + DeepSeek-v4-Flash (dq) = smooth. Info-Gap: frontier AIs can't know this. Triple validation with DeRonin (cost) + TheProphet (macro) for same models | xpost/2026-06-29_junsong-mlx-moe-local-ai-info-gap.md |
| [Local LLM Laptop Guide — Best Models Without a $10k Mac Studio](concepts/llm/local-llm-laptop-guide.md) | Paul Couvert: Top 5 local models for any laptop. Qwen3.6-27B/35B-A3B (coding), Gemma 4 12B (everyday), Parakeet 0.6B v3 (STT), Gemma 4 E4B (phone), Gemma 4 26B diffusion (speed). Unsloth quants + LM Studio/llama.cpp. Cross-platform companion to MLX MoE page. Resolves dense-27B tension (framework+quantization context) | xpost/2026-06-29_paulcouvert-local-llm-laptop-guide.md |
| [TabFM — Google's Zero-Shot Foundation Model for Tabular Data](concepts/llm/tabfm-zero-shot-tabular-foundation-model.md) | Google Research (30.06.2026): Zero-shot Klassifikation + Regression auf tabularen Daten ohne datensatz-spezifisches Training. Hybrid-Attention-Architektur (TabPFN row/col attention + TabICL ICL Transformer), Training auf 100M+ synthetischen SCM-Datensätzen. #1 auf TabArena. BigQuery-Integration via `AI.PREDICT` SQL. Non-commercial weights auf HF, Apache-2.0 code auf GitHub | other/2026-07-01_google-tabfm-zero-shot-tabular-foundation-model.md |

View file

@ -2,6 +2,18 @@
*Append-only changelog. Start: 2026-06-05*
## [2026-08-06] Ingest | Unsloth dSpark — DeepSeek V4 lokal 2x schneller
**Type:** ingest | **Scope:** raw/other, wiki/tools (1 new), wiki/index, wiki/log
**Source:** Pit Weber (OME-Gruppe Topic 27 „Tips & Tricks", 2026-08-06) — Reddit-Link r/unsloth: „DeepSeek V4 now runs 2x faster locally with dSpark"
**Trigger:** Curation-Pflicht bei eingehendem Link (Heartbeat-Kuratierungs-Pflicht).
**Actions:**
- raw: `raw/other/2026-08-06_unsloth-dspark-deepseek-v4-2x.md` (created — Frontmatter [type: other, source_url: Reddit, tags: unsloth, deepseek-v4, dspark, local-inference, performance]. Inhalt: Titel-Metadaten, Kernaussage, Relevanz für Tier-0-Routing)
- wiki (NEW): `tools/unsloth-dspark.md` (created — Frontmatter [sources, tags]. Sections: Was ist dSpark, Relevanz für Hectors Setup (deepseek-v4-flash:0731 lokal, Barbell-Routing), Status/Verifizierungsgrad)
- wiki: `index.md` (updated — neuer Tools-Eintrag Unsloth dSpark)
- log: this entry
**Hinweis:** Reddit blockte den Body-Fetch (403). Nur Titel-Metadaten gesichert; technische Details (Benchmark, Hardware, Ollama-Integrierbarkeit) bei Gelegenheit über unsloth.ai Blog nachziehen.
## [2026-07-26] Ingest | Rüdiger — Architecture Triade: Steinberger, Kopadze, LangGraph
**Type:** ingest | **Scope:** raw/xpost, wiki/concepts/agents (1 new), wiki/index, wiki/log
@ -1538,3 +1550,26 @@ Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Über
- wiki (NEW): `people/christian-rieck.md` — Personen-Seite für den Wirtschaftsprofessor.
- wiki: `index.md` (updated — neuer Concepts-Eintrag)
- log: this entry
## [2026-08-06] Ingest | YouTube: DeepSeek 46x cheaper than Claude, OpenAI rushing
**Type:** ingest | **Scope:** raw/youtube (1 new), wiki/concepts/llm (1 updated), wiki/index, wiki/log
**Source:** Pit Weber (Kai), OME-Gruppe Topic 13 „News & Infos" (2026-08-06) — https://www.youtube.com/watch?v=iDhwlU3nEU8
**Trigger:** Curation-Pflicht bei eingehendem Link (Heartbeat-Kuratierungs-Pflicht).
**Actions:**
- raw: `raw/youtube/2026-08-06_deepseek-46x-cheaper-claude-openai-rushing.md` (created — Frontmatter [type: youtube, video_id, tags: deepseek, claude, openai, pricing, cost-arbitrage, chinese-models]. Titel-Metadaten via oEmbed; Kernaussage 46× aus Titel. Transkript nicht abrufbar: YouTube-Login-Schutz, yt-dlp fehlt, Innertube-API blockiert, CDP-Browser nicht erreichbar — dokumentiert.)
- wiki: `concepts/llm/chinese-model-cost-routing.md` (updated — neuer Datenpunkt 46×, Tabelle der Cost-Faktoren 5-12×/39×/40+×/46×, OpenAI „rushed" als strukturelle Margen-These)
- wiki: `index.md` (updated — Eintrag Chinese Model Cost Routing: Update 06.08. + neue Quelle)
- log: this entry
## [2026-08-06] Ingest | Leon van Zyl — Don't Use One AI Agent, Use an Army
**Type:** ingest | **Scope:** raw/youtube, wiki/architecture (1 updated), wiki/people (1 new), wiki/index, wiki/log
**Source:** Pit Weber (Kai), OME-Gruppe Topic 9648 „BUZZ", 2026-08-06 — YouTube-Link
**Trigger:** Curation-Pflicht bei eingehendem Link (Heartbeat-Kuratierungs-Pflicht).
**Actions:**
- raw: `raw/youtube/2026-08-06_leon-van-zyl-use-an-army-of-agents.md` (created — Frontmatter [type: youtube, video_id, channel, tags: multi-agent, orchestration, agent-army, agents, swarm]. Metadata: Title „Don't Use One AI Agent - Use an Army", Channel Leon van Zyl. Kernaussage: Armee spezialisierter Agenten statt eines monolithischen Universal-Agenten)
- wiki (UPDATED): `architecture/agent-orchestration.md` (Abschnitt „Don't Use One AI Agent - Use an Army" ergänzt — Gegenmodell zum Universal-Agenten, passt zu Orchestrator-Pattern/Swarm-Debatte)
- wiki (NEW): `people/leon-van-zyl.md` (created — YouTube-Kanal zu AI-Agenten/Orchestrierung, Video-Beitrag verlinkt auf [[architecture/agent-orchestration|agent-orchestration]])
- log: this entry
**Hinweis:** Transkript NICHT abrufbar — YouTube Bot-Schutz (LOGIN_REQUIRED), yt-dlp ohne JS-Runtime/Cookies abgeblockt. Nur Titel-Metadaten via oEmbed gesichert. Vollständige Inhalte bei Gelegenheit über eingeloggte Browser-Session oder CDP nachziehen.

View file

@ -0,0 +1,14 @@
---
created: 2026-08-06
updated: 2026-08-06
sources: [youtube/2026-08-06_leon-van-zyl-use-an-army-of-agents.md]
tags: [people, agents, orchestration]
---
# Leon van Zyl
YouTube-Kanal zu AI-Agenten und Orchestrierung (https://www.youtube.com/@leonvanzyl).
## Beiträge
- **„Don't Use One AI Agent - Use an Army"** (2026-08-06): These für eine **Armee spezialisierter Agenten** statt eines einzelnen monolithischen AI-Agenten. Multi-Agent-/Orchestrierungs-Ansatz. Siehe [[../architecture/agent-orchestration|agent-orchestration]].

View file

@ -0,0 +1,29 @@
---
created: 2026-08-06
updated: 2026-08-06
sources: [other/2026-08-06_unsloth-dspark-deepseek-v4-2x.md]
tags: [unsloth, deepseek-v4, dspark, local-inference, performance]
---
# Unsloth dSpark — DeepSeek V4 lokal 2x schneller
**Anbieter:** [Unsloth](https://unsloth.ai) — Spezialist für LLM-Fine-Tuning- und Inferenz-Beschleunigung (Unsloth-Inferenz-Engine, Dynamic Quantization).
## Was ist dSpark?
**dSpark** ist eine von Unsloth veröffentlichte Optimierung, die **DeepSeek V4 lokal mit 2x Geschwindigkeit** laufen lässt. Laut Post-Titel auf r/unsloth (2026-08-06): "DeepSeek V4 now runs 2x faster locally with dSpark".
## Relevanz für Hectors Setup
- **DeepSeek V4 ist aktiv** in der lokalen Ollama-Infrastruktur: `ollama/deepseek-v4-flash:0731` (lokal) sowie `deepseek-v4-pro:cloud`.
- Die **Barbell-5-Tier-Routing-Strategie** (AGENTS.md) nutzt Tier-0-Free-Modelle wie `ollama/deepseek-v4-flash:cloud` für Heartbeats/Cron. Eine lokale 2x-Beschleunigung würde die Latenz lokaler Inferenz senken und ggf. Kosten weiter drücken.
- **Open Question:** Ob dSpark als Ollama-Engine/Backend integrierbar ist oder ein eigenes Runtime erfordert — Body des Reddit-Posts war wegen 403 nicht verifizierbar.
## Status
- **Verifizierungsgrad:** Titel-Metadaten gesichert (2026-08-06). Technische Details (Benchmark-Zahlen, Hardware-Anforderungen, Integrationsweg) **offen** — bei Gelegenheit über unsloth.ai Blog nachziehen.
- **Nicht implementiert** — rein dokumentarischer Ingest.
## Verwandte Wiki-Seiten
- Model-Routing / Barbell-Tier-Strategie (AGENTS.md)