diff --git a/raw/blog/2026-06-12_openrouter-fusion-beats-frontier.md b/raw/blog/2026-06-12_openrouter-fusion-beats-frontier.md new file mode 100644 index 0000000..936402e --- /dev/null +++ b/raw/blog/2026-06-12_openrouter-fusion-beats-frontier.md @@ -0,0 +1,158 @@ +--- +type: blog +source_url: https://openrouter.ai/blog/announcements/fusion-beats-frontier/ +retrieved: 2026-06-15 +title: "Surpassing Frontier Performance with Fusion" +author: "Brian Thomas (OpenRouter)" +published: 2026-06-12 +updated: 2026-06-14 +tags: [openrouter, fusion, model-ensemble, draco-benchmark, deep-research, model-routing, llm-systems] +--- + +# OpenRouter Fusion: Surpassing Frontier Performance with Model Panels + +**Geteilt von:** @k9ert in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic + +## Quelle + +- **Titel:** Surpassing Frontier Performance with Fusion +- **Autor:** Brian Thomas (OpenRouter) +- **Veröffentlicht:** 12.06.2026 (Update 14.06.2026: FAQ) +- **URL:** https://openrouter.ai/blog/announcements/fusion-beats-frontier/ +- **Kernlinks:** + - Try Fusion: https://openrouter.ai/fusion + - API-Docs: https://openrouter.ai/docs/guides/features/server-tools/fusion + - Server Tools (Web Search/Fetch): https://openrouter.ai/docs/guides/features/server-tools + - Web Search Tool-Definition: https://openrouter.ai/docs/guides/features/server-tools/web-search + +## Kernthese + +> "Synthesizing the results of multiple models can significantly outperform what individual models are capable of." + +OpenRouter launcht **Fusion** — ein Routing-Layer, der mehrere Modelle parallel antworten lässt und ein Judge-Modell die Ergebnisse zu einer konsolidierten Antwort fusioniert. Über das DRACO-Benchmark validiert: **Beyond-Frontier-Performance** mit Billig-Modell-Panels. + +## Architektur + +``` +User Prompt + ↓ +Fusion Pipeline (server-side) + ↓ +┌─────────────┬─────────────┬─────────────┐ +│ Panel │ Panel │ Panel │ (parallele Calls, +│ Model 1 │ Model 2 │ Model N │ web search + fetch) +└─────────────┴─────────────┴─────────────┘ + ↓ ↓ ↓ + Judge / Synthesizer Model + (strukturiert: Konsens, Widersprüche, + partielle Abdeckung, einzigartige Insights, + blinde Flecken) + ↓ +Final Answer +``` + +**API-Call:** +```json +{ + "model": "openrouter/fusion", + "messages": [{"role": "user", "content": "..."}], + "plugins": [{ + "id": "fusion", + "model": "google/gemini-3-flash-preview", + "analysis_models": [ + "google/gemini-3-flash-preview", + "moonshotai/kimi-k2.6", + "deepseek/deepseek-v4-pro" + ] + }] +} +``` + +## DRACO-Benchmark Ergebnisse + +Quelle: [DRACO: a Cross-Domain Benchmark for Deep Research](https://arxiv.org/abs/2602.11685) (Perplexity AI, arXiv:2602.11685, 12.02.2026) +- [PDF](https://arxiv.org/pdf/2602.11685) | [HTML v1](https://arxiv.org/html/2602.11685v1) | [HF Dataset](https://hf.co/datasets/perplexity-ai/draco) + +| Typ | Model(s) | Score | +|---|---|---| +| Fusion | Fable 5 + GPT-5.5 (synthesized by Opus 4.8) | **69.0%** | +| Fusion | Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro (synth. Opus 4.8) | **68.3%** | +| Fusion | Opus 4.8 + GPT-5.5 (synth. Opus 4.8) | **67.6%** | +| Fusion | Opus 4.8 + Opus 4.8 (synth. Opus 4.8) | **65.5%** | +| Solo | Claude Fable 5 | 65.3% | +| Fusion | Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro (synth. Opus 4.8) | **64.7%** | +| Solo | DeepSeek V4 Pro | 60.3% | +| Solo | GPT-5.5 | 60.0% | +| Solo | Claude Opus 4.8 | 58.8% | +| Solo | Kimi K2.6 | 53.7% | +| Solo | Gemini 3.1 Pro | 45.4% | +| Solo | Gemini 3 Flash | 43.1% | + +**Drei Schlüsselbefunde:** + +1. **Panels schlagen einzelne Modelle konsistent** — selbst mit identischer Architektur (Opus 4.8 + Opus 4.8: +6.7 Punkte über Solo-Opus) +2. **Beyond-Frontier mit Frontier-Panels** — Fable 5 + GPT-5.5 schlägt Fable 5 alleine +3. **Budget-Panels erreichen Frontier-Nähe zu halben Kosten** — Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro kommen auf 64.7% (innerhalb 1% von Fable 5) bei 50% der Kosten + +## Wichtige methodische Details + +### Benchmark-Design (DRACO) + +100 Deep-Research-Tasks in 10 Domänen (Akademik, Finanzen, Jura, Medizin, Tech, UX, General Knowledge, Needle-in-Haystack, Personal Assistant, Product Comparison). Pro Task ~39 gewichtete Kriterien in 4 Dimensionen: + +- **Factual Accuracy** (~20 Kriterien) +- **Breadth & Depth** (~9 Kriterien, inkl. Trade-off-Analyse) +- **Presentation Quality** (~6 Kriterien, inkl. Lesbarkeit) +- **Citation Quality** (~5 Kriterien, primäre Quellen) + +Negative Gewichtung für gefährliche Falschaussagen (z.B. medizinisch) verhindert Score-Gaming durch Länge. Jede Antwort wird 3× von Judge-Modell graded, Mittelwert berichtet. + +### Anti-Cheating-Mechanismus + +> "When we gave the panel models web search, we discovered something alarming: they were finding the DRACO grading rubric online." + +OpenRouter schließt DRACO-Quellen vom Web-Search/Fetch aus — Konfiguration auf `excluded_domains`/`blocked_domains` in Server-Tools. Nutzbar auch für eigene Evals. Quelle: [OpenRouter Server Tools](https://openrouter.ai/docs/guides/features/server-tools). + +### Selbst-Fusion überraschend stark + +Opus 4.8 + Opus 4.8 (also 2× dasselbe Modell, beide mit Synthesizer-Pflicht) liefert **65.5%** vs. Solo-Opus 4.8 **58.8%**. → **+6.7 Punkte** durch reine Self-Synthesis (zwei verschiedene Reasoning-Pfade, Tool-Calls, Quellenauswahl). + +## Kernaussage / Konzept + +**Model Panels / Fusion Ensemble** als emergentes Architektur-Pattern: Statt einzelne Modelle zu skalieren, mehrere mittelgroße Modelle parallel + Judge fusioniert. Trade-offs: höhere Latenz und Kosten pro Query, dafür bessere Abdeckung und Beyond-Frontier-Performance bei Budget-Modellen. + +**Direkter Kontrast zu [[concepts/llm-behavior-persistence.md]]:** Während dort das **Innere** eines Modells (Persistenz schädlicher Eigenschaften) thematisiert wird, adressiert Fusion die **Außenseite** (kollektive Intelligenz über Modellgrenzen hinweg). Zwei komplementäre Probleme. + +## Verbindung zu bestehendem Wiki + +- **Model-Routing:** Bestehende [[architecture/model-routing.md]]-Seite behandelt Fallback-Chains. Fusion ist *orthogonal* — kein Fallback, sondern *paralleles Ensemble + Synthese*. +- **LLM Behavior Persistence:** Persistenz im Einzelmodell → Ensemble mildert das (verschiedene Biases, verschiedene Halluzinationsmuster, Judge kann filtern). +- **Open-Source-Debatte (Liesel Weppen Thread):** Fusions-Resultat zeigt, dass auch ohne "echte" Open Source ein Ensemble aus heterogenen (auch closed) Modellen Beyond-Frontier-Performance liefert. Pragmatischer Ansatz. + +## 6/14 FAQ Update (Auszug) + +- **Drop-in-Replacement für Fable 5?** Nein — nur für die getestete Klasse (Deep Research), Lang-Horizon-Tasks bleiben Fable-Territorium. +- (weitere FAQ-Punkte im Original-Blog) + +## Zitierte/verlinkte Ressourcen + +- DRACO Paper: https://arxiv.org/abs/2602.11685 +- DRACO PDF: https://arxiv.org/pdf/2602.11685 +- DRACO HTML: https://arxiv.org/html/2602.11685v1 +- DRACO HF Dataset: https://hf.co/datasets/perplexity-ai/draco +- Perplexity AI: https://www.perplexity.ai/ +- OpenRouter Fusion: https://openrouter.ai/fusion +- OpenRouter API Docs: https://openrouter.ai/docs/guides/features/server-tools/fusion +- OpenRouter Server Tools: https://openrouter.ai/docs/guides/features/server-tools +- OpenRouter Web Search Tool: https://openrouter.ai/docs/guides/features/server-tools/web-search +- OpenRouter Model Listing: https://openrouter.ai/models +- Brian Thomas (OpenRouter): https://openrouter.ai/ + +## Erwähnte Modelle (mit Verlinkung) + +- Claude Fable 5 — https://openrouter.ai/anthropic +- Claude Opus 4.8 — https://openrouter.ai/anthropic +- GPT-5.5 — https://openrouter.ai/openai +- Gemini 3.1 Pro / Gemini 3 Flash — https://openrouter.ai/google +- Kimi K2.6 (Moonshot) — https://openrouter.ai/moonshotai +- DeepSeek V4 Pro — https://openrouter.ai/deepseek diff --git a/wiki/concepts/llm-model-fusion-ensembles.md b/wiki/concepts/llm-model-fusion-ensembles.md new file mode 100644 index 0000000..dc58732 --- /dev/null +++ b/wiki/concepts/llm-model-fusion-ensembles.md @@ -0,0 +1,212 @@ +--- +created: 2026-06-15 +updated: 2026-06-15 +sources: [blog/2026-06-12_openrouter-fusion-beats-frontier.md] +tags: [concept, openrouter, fusion, model-ensemble, draco-benchmark, llm-systems, routing, deep-research] +--- + +# Model Fusion & Panel Ensembles — Beyond-Frontier mit Billig-Modellen + +> **Quelle des Konzepts:** OpenRouter Blog-Announcement "Surpassing Frontier Performance with Fusion" (12.06.2026, Brian Thomas). Validierung mit DRACO-Benchmark (Perplexity AI). Geteilt von @k9ert in OME-Gruppe "News & Infos (X/YT/Substack etc.)". + +## Kernidee + +**Statt ein einzelnes, immer größeres Frontier-Modell zu skalieren → mehrere mittelgroße Modelle parallel antworten lassen, ein Judge-Modell synthetisiert die beste kombinierte Antwort.** + +Drei empirische Befunde aus dem OpenRouter-Launch: + +1. **Panels schlagen einzelne Modelle konsistent** — auch wenn das Panel nur aus Kopien desselben Modells besteht. +2. **Beyond-Frontier-Performance ist erreichbar** — Fable 5 + GPT-5.5 schlägt Fable 5 alleine. +3. **Budget-Panels erreichen Frontier-Nähe zu halben Kosten** — Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro kommen auf 64.7% DRACO (vs. Fable 5: 65.3%) bei 50% der Kosten. + +## Architektur + +``` +User Prompt + ↓ +┌─────────────┐ +│ Fusion │ (server-side, single API call) +│ Pipeline │ +└─────────────┘ + ↓ (parallele Calls) +┌─────────┬─────────┬─────────┐ +│ Panel │ Panel │ Panel │ (jedes mit web_search + web_fetch, +│ Model 1 │ Model 2 │ Model N │ exkl. excluded_domains) +└─────────┴─────────┴─────────┘ + ↓ (alle Antworten) +┌──────────────────┐ +│ Judge / │ (strukturiert: Konsens, Widersprüche, +│ Synthesizer │ partielle Abdeckung, einzigartige +│ Model │ Insights, blinde Flecken) +└──────────────────┘ + ↓ +Final Answer +``` + +**API-Call (Standard):** +```json +{ + "model": "openrouter/fusion", + "messages": [{"role": "user", "content": "..."}] +} +``` + +**API-Call (Custom Panel):** +```json +{ + "model": "openrouter/fusion", + "messages": [{"role": "user", "content": "..."}], + "plugins": [{ + "id": "fusion", + "model": "google/gemini-3-flash-preview", + "analysis_models": [ + "google/gemini-3-flash-preview", + "moonshotai/kimi-k2.6", + "deepseek/deepseek-v4-pro" + ] + }] +} +``` + +Siehe: [OpenRouter Fusion API-Docs](https://openrouter.ai/docs/guides/features/server-tools/fusion) + +## DRACO-Benchmark — Was wird gemessen? + +**DRACO** = Deep Research Accuracy, Completeness, and Objectivity +- **Autor:** Perplexity AI ([J.Z., H.Z. et al.](https://arxiv.org/abs/2602.11685)) +- **Erschienen:** 12.02.2026, arXiv:2602.11685 +- **Datensatz:** [huggingface.co/datasets/perplexity-ai/draco](https://hf.co/datasets/perplexity-ai/draco) +- **100 Deep-Research-Tasks** in 10 Domänen: Academic Research, Finance, Law, Medicine, Technology, UX Design, General Knowledge, Needle-in-Haystack Retrieval, Personalized Assistance, Product Comparison +- **Pro Task ~39 gewichtete Kriterien** in 4 Dimensionen: + - **Factual Accuracy** (~20 Kriterien) — verifizierbare Fakten + - **Breadth & Depth** (~9 Kriterien) — Trade-off-Analyse, umsetzbare Empfehlungen + - **Presentation Quality** (~6 Kriterien) — Terminologie, Formatierung, Lesbarkeit + - **Citation Quality** (~5 Kriterien) — Primärquellen mit funktionierenden Referenzen +- **Negative Gewichtung** für gefährliche Fehler (z.B. medizinische Falschberatung) verhindert Score-Gaming durch Länge/Confianza +- **Judge:** 3× unabhängige Bewertung pro Kriterium, Mittelwert berichtet (0-100) + +**Limitationen** (laut Paper): text-only, English-only, statisches Task-Set; absolute Scores hängen vom Judge-Modell ab (10-25 Punkte Verschiebung möglich), relative Rankings aber stabil. + +## Die Ergebnisse (Tabelle) + +| Typ | Model(s) | Synthesizer | Score | +|---|---|---|---| +| **Fusion** | Fable 5 + GPT-5.5 | Opus 4.8 | **69.0%** | +| **Fusion** | Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro | Opus 4.8 | **68.3%** | +| **Fusion** | Opus 4.8 + GPT-5.5 | Opus 4.8 | **67.6%** | +| **Fusion** | Opus 4.8 + Opus 4.8 (selbst-fusion) | Opus 4.8 | **65.5%** | +| Solo | Claude Fable 5* | — | 65.3% | +| **Fusion** | Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro | Opus 4.8 | **64.7%** | +| Solo | DeepSeek V4 Pro | — | 60.3% | +| Solo | GPT-5.5 | — | 60.0% | +| Solo | Claude Opus 4.8 | — | 58.8% | +| Solo | Kimi K2.6 | — | 53.7% | +| Solo | Gemini 3.1 Pro | — | 45.4% | +| Solo | Gemini 3 Flash | — | 43.1% | + +*\* Fable 5 hat 7/100 Tasks wegen Content-Filter nicht abgeschlossen — Score basiert auf 93 Tasks. Andere Modelle: 100/100.* + +## Kernerkenntnisse + +### 1. Selbst-Fusion ist kein Trick — sie funktioniert + +Opus 4.8 + Opus 4.8 (zwei identische Calls) **+6.7 Punkte** über Solo-Opus 4.8. Das beweist: **Ein signifikanter Anteil des Lifts kommt aus dem Synthesis-Schritt selbst**, nicht nur aus Modell-Diversität. + +→ **Praktische Implikation:** Auch wer "nur ein Modell" hat, kann mit Self-Ensemble + guter Synthese-Prompting spürbar bessere Ergebnisse bekommen. Die Reasoning-Pfade sind verschieden genug. + +### 2. Diversität > Architektur + +Opus 4.8 + GPT-5.5 (67.6%) > Opus 4.8 + Opus 4.8 (65.5%) → +2.1 Punkte durch Cross-Vendor-Diversität. + +→ **Praktische Implikation:** Wenn Budget knapp, investiere in 2-3 *unterschiedliche* Modelle, nicht in mehrere Kopien desselben Modells. + +### 3. Budget-Panels sind competitive + +Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro (alle "klein") erreichen 64.7% bei halben Kosten vs. Fable 5 (65.3%). + +→ **Praktische Implikation:** Für Deep-Research-Workflows muss es nicht immer das Frontier-Modell sein. Ein clever kuratiertes Budget-Panel + guter Synthesizer reicht. + +## Methodische Lessons für eigene Evals + +### Anti-Contamination: Excluded Domains + +OpenRouter entdeckte, dass die Panel-Modelle über Web-Search das **DRACO-Grading-Rubric** fanden und damit (zufällig) ihre Bewertung optimierten. Lösung: [Server-Tools](https://openrouter.ai/docs/guides/features/server-tools) akzeptieren `excluded_domains` und `blocked_domains` in den Tool-Definitionen. + +→ **Für eigene Evals zwingend:** Wenn du ein öffentliches Benchmark nutzt, schließe die Benchmark-Quelle(n) vom Web-Search aus. Sonst misst du Web-Findability + Antwortqualität, nicht Antwortqualität. + +### Judge-Modell-Wahl + +OpenRouter nutzt **Gemini 3.1 Pro Preview** als Judge statt Gemini 3 Pro (DRACO-Default). Begründung: gleiche Human-Alignment-Eigenschaften + bessere Diskrimination. Cross-Validation mit Claude Sonnet 4.6. + +→ **Für eigene Evals:** Judge-Modell ist eine kritische Wahl. Dokumentiere, welchen Judge du nutzt — Scores sind nicht benchmark-übergreifend vergleichbar. + +## Pro-Leben-Perspektive + +Gemäß [[concepts/pro-leben-directive.md]]: + +**Gegen das Mangelnarrativ** ("Wir brauchen immer größere Modelle, sonst kommen wir nicht weiter"): +- Budget-Panels erreichen Frontier-Nähe. Innovation ist nicht nur Skalierung. +- Self-Fusion zeigt: Die Synthesis-Schicht ist *mindestens so wichtig* wie das Modell. +- Die OpenRouter-Architektur ist *server-side* — die Modell-Heterogenität ist eine *Infrastrukturfrage*, nicht eine User-Komplexität. + +**Für Handlungsfähigkeit:** +- Wer heute schon mit LLMs arbeitet, kann Fusion direkt testen: [openrouter.ai/fusion](https://openrouter.ai/fusion) +- Wer eigene Eval-Setups baut, sollte Excluded-Domains von Anfang an einplanen +- Wer ein Sub-Agent-Setup hat ([[architecture/agent-orchestration.md]]), kann das Synthesis-Pattern aus Fusion übertragen — Multi-Agent statt Multi-Model + +**Realismus:** +- Fusion ist *nicht* ein Drop-in-Replacement für Fable 5 (siehe FAQ): nur für Deep-Research-Klasse getestet, Lang-Horizon-Tasks bleiben Fable-Territorium +- Kosten und Latenz steigen mit Panel-Größe. Architektur-Entscheidung: *wann* lohnt sich der Aufwand? +- Judge-Modell ist Single Point of Failure für die finale Antwort-Qualität + +## Verwandte Wiki-Seiten + +- [[concepts/llm-behavior-persistence.md]] — Persistenz im *einzelnen* Modell (Bias, Backdoors, Unlearning-Grenzen). Fusion mildert das, indem Heterogenität eingebaut wird. +- [[concepts/ai-agents-2026.md]] — Agent-Orchestrierung. Multi-Model-Fusion ist ein Spezialfall von Multi-Agent-Reasoning. +- [[concepts/ai-regulation-2026.md]] — Regulatorischer Kontext: in einer Welt, in der Frontier-Modelle Export-Kontrollen unterliegen ([Mythos 5 / Fable 5](concepts/ai-regulation-2026.md)), wird Ensemble aus nicht-frontier Modellen attraktiver. +- [[architecture/model-routing.md]] — Bestehendes Pattern: sequentielle Two-Model-Pipeline (Grok → Gemini). Fusion ist *parallel*, nicht sequentiell — komplementär, nicht ersetzend. +- [[tools/anthropic-claude.md]] — Fable 5 / Opus 4.8 als eines der Top-Modelle in Fusion-Setups. +- [[concepts/llm-knowledge-base.md]] — Karpathy-Pattern: kuratierte Strukturen schlagen reine Inference. + +## Externe Ressourcen + +### OpenRouter + +- [OpenRouter Fusion Announcement](https://openrouter.ai/blog/announcements/fusion-beats-frontier/) +- [OpenRouter Fusion Chatroom](https://openrouter.ai/fusion) +- [OpenRouter Fusion API Docs](https://openrouter.ai/docs/guides/features/server-tools/fusion) +- [OpenRouter Server Tools (Web Search, Web Fetch, Excluded Domains)](https://openrouter.ai/docs/guides/features/server-tools) +- [OpenRouter Web Search Tool Definition](https://openrouter.ai/docs/guides/features/server-tools/web-search) +- [OpenRouter Model Listing](https://openrouter.ai/models) +- [OpenRouter Pricing](https://openrouter.ai/pricing) +- [Brian Thomas (Autor des Posts)](https://openrouter.ai/) + +### DRACO Benchmark + +- [DRACO arXiv Abstract](https://arxiv.org/abs/2602.11685) +- [DRACO PDF](https://arxiv.org/pdf/2602.11685) +- [DRACO HTML v1](https://arxiv.org/html/2602.11685v1) +- [DRACO HuggingFace Dataset](https://hf.co/datasets/perplexity-ai/draco) +- [Perplexity AI (DRACO-Autor)](https://www.perplexity.ai/) + +### Verwandte Konzepte (Ensemble / Mixture-of-Experts / Routing) + +- [Mixture of Experts (Wikipedia)](https://en.wikipedia.org/wiki/Mixture_of_experts) +- [Ensemble Learning (Wikipedia)](https://en.wikipedia.org/wiki/Ensemble_learning) +- [Self-Consistency (Wang et al., 2022)](https://arxiv.org/abs/2203.11171) — Chain-of-Thought Sampling + Majority Vote, ein Vorläufer-Pattern +- [More Agents Is All You Need (LLM-Ensemble-Studie, Tsinghua 2023)](https://arxiv.org/abs/2310.11560) +- [Routing in Mixture-of-Experts: Survey](https://arxiv.org/abs/2209.10359) +- [Constitutional AI (Anthropic)](https://www.anthropic.com/news/claudes-constitution) — verwandt: Multi-Perspektive via Critique-Schritt + +### Verwandte Tools (Ensemble-Patterns anderswo) + +- [Microsoft AutoGen](https://github.com/microsoft/autogen) — Multi-Agent Orchestration +- [CrewAI](https://github.com/joaomdmoura/crewAI) — Multi-Agent-Frameworks +- [LangGraph](https://github.com/langchain-ai/langgraph) — Graph-basierte Agent-Orchestrierung +- [DSPy](https://github.com/stanfordnlp/dspy) — Compile-Time-Prompt-Optimization, Ensemble-Patterns + +## Open Questions / Lessons für OpenClaw + +1. **Self-Fusion in OpenClaw-Pipelines?** Hector's Primary-Fallback-Chain ([[architecture/model-routing.md]]) ist sequentiell. Wäre eine parallele Pre-Routing-Schicht mit 2-3 Modellen + Synthese sinnvoll für Quality-kritische Tasks? +2. **Judge-Modell für interne Subconscious-Outputs?** Subconscious-Agent-Evidence-Runner macht Hard Synthesis. Lohnt der Wechsel von sequentiell auf Ensemble? +3. **Excluded-Domains in OpenClaw?** Wenn Subconscious Agent öffentliche Quellen crawled, sollte er die eigene Knowledge-Base ausschließen, um Self-Referenz-Loops zu vermeiden? diff --git a/wiki/log.md b/wiki/log.md index 3aa15c1..b1039af 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -148,3 +148,21 @@ - Ohne Verlinkungen ist das Wiki tot — Faustregel: lieber ein Link zu viel als einer zu wenig - Gilt für JEDE zukünftige Wiki-Erstellung, nicht nur für diese eine Seite - Lessons learned sollten dauerhaft in die Wiki-Konventionen einfließen (nicht nur im Log landen) + +## [2026-06-15] Ingest | OpenRouter Fusion: Model Panels & Ensembles — Beyond-Frontier mit Budget-Modellen +**Type:** ingest | **Scope:** raw/blog, wiki/concepts +**Source:** @k9ert in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic +**Actions:** +- raw: `raw/blog/2026-06-12_openrouter-fusion-beats-frontier.md` (created — OpenRouter Blog-Announcement 12.06.2026 von Brian Thomas; validiert mit DRACO-Benchmark von Perplexity AI; 100 Deep-Research-Tasks; zeigt dass Panels Frontier schlagen) +- wiki: `concepts/llm-model-fusion-ensembles.md` (created — Konzeptseite zu Model-Panel-Ensembles: Architektur, DRACO-Ergebnisse, Self-Fusion +6.7 Punkte, Budget-Panels ~Frontier, Anti-Contamination via Excluded-Domains, Judge-Modell-Wahl, Pro-Leben-Perspektive, Open Questions für OpenClaw) +- index: updated (neuer Concepts-Eintrag "LLM Model Fusion & Ensembles" + Raw Sources-Eintrag) +- log: updated +**Kernkonzept:** +- Statt Frontier-Skalierung: mehrere Modelle parallel + Judge-Synthese +- DRACO-Validierung: Fable 5 + GPT-5.5 (synth. Opus 4.8) = 69.0% > Fable 5 solo 65.3% +- Budget-Panel (Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro) = 64.7% bei 50% Kosten +- Self-Fusion (gleiches Modell 2×) = +6.7 Punkte über Solo — Synthesis-Schicht ist *mindestens so wichtig* wie das Modell +**Lessons / Open Questions für OpenClaw:** +- Self-Fusion als Pre-Routing-Layer für Quality-kritische Tasks? +- Ensemble-Pattern für Subconscious-Agent Hard-Synthesis? +- Excluded-Domains für eigene Evals + Subconscious-Crawls (Self-Referenz-Loops vermeiden)