--- created: 2026-06-15 updated: 2026-06-15 sources: [blog/2026-06-12_openrouter-fusion-beats-frontier.md] tags: [concept, openrouter, fusion, model-ensemble, draco-benchmark, llm-systems, routing, deep-research] --- # Model Fusion & Panel Ensembles — Beyond-Frontier mit Billig-Modellen > **Quelle des Konzepts:** OpenRouter Blog-Announcement "Surpassing Frontier Performance with Fusion" (12.06.2026, Brian Thomas). Validierung mit DRACO-Benchmark (Perplexity AI). Geteilt von @k9ert in OME-Gruppe "News & Infos (X/YT/Substack etc.)". ## Kernidee **Statt ein einzelnes, immer größeres Frontier-Modell zu skalieren → mehrere mittelgroße Modelle parallel antworten lassen, ein Judge-Modell synthetisiert die beste kombinierte Antwort.** Drei empirische Befunde aus dem OpenRouter-Launch: 1. **Panels schlagen einzelne Modelle konsistent** — auch wenn das Panel nur aus Kopien desselben Modells besteht. 2. **Beyond-Frontier-Performance ist erreichbar** — Fable 5 + GPT-5.5 schlägt Fable 5 alleine. 3. **Budget-Panels erreichen Frontier-Nähe zu halben Kosten** — Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro kommen auf 64.7% DRACO (vs. Fable 5: 65.3%) bei 50% der Kosten. ## Architektur ``` User Prompt ↓ ┌─────────────┐ │ Fusion │ (server-side, single API call) │ Pipeline │ └─────────────┘ ↓ (parallele Calls) ┌─────────┬─────────┬─────────┐ │ Panel │ Panel │ Panel │ (jedes mit web_search + web_fetch, │ Model 1 │ Model 2 │ Model N │ exkl. excluded_domains) └─────────┴─────────┴─────────┘ ↓ (alle Antworten) ┌──────────────────┐ │ Judge / │ (strukturiert: Konsens, Widersprüche, │ Synthesizer │ partielle Abdeckung, einzigartige │ Model │ Insights, blinde Flecken) └──────────────────┘ ↓ Final Answer ``` **API-Call (Standard):** ```json { "model": "openrouter/fusion", "messages": [{"role": "user", "content": "..."}] } ``` **API-Call (Custom Panel):** ```json { "model": "openrouter/fusion", "messages": [{"role": "user", "content": "..."}], "plugins": [{ "id": "fusion", "model": "google/gemini-3-flash-preview", "analysis_models": [ "google/gemini-3-flash-preview", "moonshotai/kimi-k2.6", "deepseek/deepseek-v4-pro" ] }] } ``` Siehe: [OpenRouter Fusion API-Docs](https://openrouter.ai/docs/guides/features/server-tools/fusion) ## DRACO-Benchmark — Was wird gemessen? **DRACO** = Deep Research Accuracy, Completeness, and Objectivity - **Autor:** Perplexity AI ([J.Z., H.Z. et al.](https://arxiv.org/abs/2602.11685)) - **Erschienen:** 12.02.2026, arXiv:2602.11685 - **Datensatz:** [huggingface.co/datasets/perplexity-ai/draco](https://hf.co/datasets/perplexity-ai/draco) - **100 Deep-Research-Tasks** in 10 Domänen: Academic Research, Finance, Law, Medicine, Technology, UX Design, General Knowledge, Needle-in-Haystack Retrieval, Personalized Assistance, Product Comparison - **Pro Task ~39 gewichtete Kriterien** in 4 Dimensionen: - **Factual Accuracy** (~20 Kriterien) — verifizierbare Fakten - **Breadth & Depth** (~9 Kriterien) — Trade-off-Analyse, umsetzbare Empfehlungen - **Presentation Quality** (~6 Kriterien) — Terminologie, Formatierung, Lesbarkeit - **Citation Quality** (~5 Kriterien) — Primärquellen mit funktionierenden Referenzen - **Negative Gewichtung** für gefährliche Fehler (z.B. medizinische Falschberatung) verhindert Score-Gaming durch Länge/Confianza - **Judge:** 3× unabhängige Bewertung pro Kriterium, Mittelwert berichtet (0-100) **Limitationen** (laut Paper): text-only, English-only, statisches Task-Set; absolute Scores hängen vom Judge-Modell ab (10-25 Punkte Verschiebung möglich), relative Rankings aber stabil. ## Die Ergebnisse (Tabelle) | Typ | Model(s) | Synthesizer | Score | |---|---|---|---| | **Fusion** | Fable 5 + GPT-5.5 | Opus 4.8 | **69.0%** | | **Fusion** | Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro | Opus 4.8 | **68.3%** | | **Fusion** | Opus 4.8 + GPT-5.5 | Opus 4.8 | **67.6%** | | **Fusion** | Opus 4.8 + Opus 4.8 (selbst-fusion) | Opus 4.8 | **65.5%** | | Solo | Claude Fable 5* | — | 65.3% | | **Fusion** | Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro | Opus 4.8 | **64.7%** | | Solo | DeepSeek V4 Pro | — | 60.3% | | Solo | GPT-5.5 | — | 60.0% | | Solo | Claude Opus 4.8 | — | 58.8% | | Solo | Kimi K2.6 | — | 53.7% | | Solo | Gemini 3.1 Pro | — | 45.4% | | Solo | Gemini 3 Flash | — | 43.1% | *\* Fable 5 hat 7/100 Tasks wegen Content-Filter nicht abgeschlossen — Score basiert auf 93 Tasks. Andere Modelle: 100/100.* ## Kernerkenntnisse ### 1. Selbst-Fusion ist kein Trick — sie funktioniert Opus 4.8 + Opus 4.8 (zwei identische Calls) **+6.7 Punkte** über Solo-Opus 4.8. Das beweist: **Ein signifikanter Anteil des Lifts kommt aus dem Synthesis-Schritt selbst**, nicht nur aus Modell-Diversität. → **Praktische Implikation:** Auch wer "nur ein Modell" hat, kann mit Self-Ensemble + guter Synthese-Prompting spürbar bessere Ergebnisse bekommen. Die Reasoning-Pfade sind verschieden genug. ### 2. Diversität > Architektur Opus 4.8 + GPT-5.5 (67.6%) > Opus 4.8 + Opus 4.8 (65.5%) → +2.1 Punkte durch Cross-Vendor-Diversität. → **Praktische Implikation:** Wenn Budget knapp, investiere in 2-3 *unterschiedliche* Modelle, nicht in mehrere Kopien desselben Modells. ### 3. Budget-Panels sind competitive Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro (alle "klein") erreichen 64.7% bei halben Kosten vs. Fable 5 (65.3%). → **Praktische Implikation:** Für Deep-Research-Workflows muss es nicht immer das Frontier-Modell sein. Ein clever kuratiertes Budget-Panel + guter Synthesizer reicht. ## Methodische Lessons für eigene Evals ### Anti-Contamination: Excluded Domains OpenRouter entdeckte, dass die Panel-Modelle über Web-Search das **DRACO-Grading-Rubric** fanden und damit (zufällig) ihre Bewertung optimierten. Lösung: [Server-Tools](https://openrouter.ai/docs/guides/features/server-tools) akzeptieren `excluded_domains` und `blocked_domains` in den Tool-Definitionen. → **Für eigene Evals zwingend:** Wenn du ein öffentliches Benchmark nutzt, schließe die Benchmark-Quelle(n) vom Web-Search aus. Sonst misst du Web-Findability + Antwortqualität, nicht Antwortqualität. ### Judge-Modell-Wahl OpenRouter nutzt **Gemini 3.1 Pro Preview** als Judge statt Gemini 3 Pro (DRACO-Default). Begründung: gleiche Human-Alignment-Eigenschaften + bessere Diskrimination. Cross-Validation mit Claude Sonnet 4.6. → **Für eigene Evals:** Judge-Modell ist eine kritische Wahl. Dokumentiere, welchen Judge du nutzt — Scores sind nicht benchmark-übergreifend vergleichbar. ## Pro-Leben-Perspektive Gemäß [[concepts/directives/pro-leben-directive.md]]: **Gegen das Mangelnarrativ** ("Wir brauchen immer größere Modelle, sonst kommen wir nicht weiter"): - Budget-Panels erreichen Frontier-Nähe. Innovation ist nicht nur Skalierung. - Self-Fusion zeigt: Die Synthesis-Schicht ist *mindestens so wichtig* wie das Modell. - Die OpenRouter-Architektur ist *server-side* — die Modell-Heterogenität ist eine *Infrastrukturfrage*, nicht eine User-Komplexität. **Für Handlungsfähigkeit:** - Wer heute schon mit LLMs arbeitet, kann Fusion direkt testen: [openrouter.ai/fusion](https://openrouter.ai/fusion) - Wer eigene Eval-Setups baut, sollte Excluded-Domains von Anfang an einplanen - Wer ein Sub-Agent-Setup hat ([[architecture/agent-orchestration.md]]), kann das Synthesis-Pattern aus Fusion übertragen — Multi-Agent statt Multi-Model **Realismus:** - Fusion ist *nicht* ein Drop-in-Replacement für Fable 5 (siehe FAQ): nur für Deep-Research-Klasse getestet, Lang-Horizon-Tasks bleiben Fable-Territorium - Kosten und Latenz steigen mit Panel-Größe. Architektur-Entscheidung: *wann* lohnt sich der Aufwand? - Judge-Modell ist Single Point of Failure für die finale Antwort-Qualität ## Verwandte Wiki-Seiten - [[concepts/llm/llm-behavior-persistence.md]] — Persistenz im *einzelnen* Modell (Bias, Backdoors, Unlearning-Grenzen). Fusion mildert das, indem Heterogenität eingebaut wird. - [[concepts/agents/ai-agents-2026.md]] — Agent-Orchestrierung. Multi-Model-Fusion ist ein Spezialfall von Multi-Agent-Reasoning. - [[concepts/policy/ai-regulation-2026.md]] — Regulatorischer Kontext: in einer Welt, in der Frontier-Modelle Export-Kontrollen unterliegen ([Mythos 5 / Fable 5](concepts/policy/ai-regulation-2026.md)), wird Ensemble aus nicht-frontier Modellen attraktiver. - [[architecture/model-routing.md]] — Bestehendes Pattern: sequentielle Two-Model-Pipeline (Grok → Gemini). Fusion ist *parallel*, nicht sequentiell — komplementär, nicht ersetzend. - [[tools/anthropic-claude.md]] — Fable 5 / Opus 4.8 als eines der Top-Modelle in Fusion-Setups. - [[concepts/llm/llm-knowledge-base.md]] — Karpathy-Pattern: kuratierte Strukturen schlagen reine Inference. ## Externe Ressourcen ### OpenRouter - [OpenRouter Fusion Announcement](https://openrouter.ai/blog/announcements/fusion-beats-frontier/) - [OpenRouter Fusion Chatroom](https://openrouter.ai/fusion) - [OpenRouter Fusion API Docs](https://openrouter.ai/docs/guides/features/server-tools/fusion) - [OpenRouter Server Tools (Web Search, Web Fetch, Excluded Domains)](https://openrouter.ai/docs/guides/features/server-tools) - [OpenRouter Web Search Tool Definition](https://openrouter.ai/docs/guides/features/server-tools/web-search) - [OpenRouter Model Listing](https://openrouter.ai/models) - [OpenRouter Pricing](https://openrouter.ai/pricing) - [Brian Thomas (Autor des Posts)](https://openrouter.ai/) ### DRACO Benchmark - [DRACO arXiv Abstract](https://arxiv.org/abs/2602.11685) - [DRACO PDF](https://arxiv.org/pdf/2602.11685) - [DRACO HTML v1](https://arxiv.org/html/2602.11685v1) - [DRACO HuggingFace Dataset](https://hf.co/datasets/perplexity-ai/draco) - [Perplexity AI (DRACO-Autor)](https://www.perplexity.ai/) ### Verwandte Konzepte (Ensemble / Mixture-of-Experts / Routing) - [Mixture of Experts (Wikipedia)](https://en.wikipedia.org/wiki/Mixture_of_experts) - [Ensemble Learning (Wikipedia)](https://en.wikipedia.org/wiki/Ensemble_learning) - [Self-Consistency (Wang et al., 2022)](https://arxiv.org/abs/2203.11171) — Chain-of-Thought Sampling + Majority Vote, ein Vorläufer-Pattern - [More Agents Is All You Need (LLM-Ensemble-Studie, Tsinghua 2023)](https://arxiv.org/abs/2310.11560) - [Routing in Mixture-of-Experts: Survey](https://arxiv.org/abs/2209.10359) - [Constitutional AI (Anthropic)](https://www.anthropic.com/news/claudes-constitution) — verwandt: Multi-Perspektive via Critique-Schritt ### Verwandte Tools (Ensemble-Patterns anderswo) - [Microsoft AutoGen](https://github.com/microsoft/autogen) — Multi-Agent Orchestration - [CrewAI](https://github.com/joaomdmoura/crewAI) — Multi-Agent-Frameworks - [LangGraph](https://github.com/langchain-ai/langgraph) — Graph-basierte Agent-Orchestrierung - [DSPy](https://github.com/stanfordnlp/dspy) — Compile-Time-Prompt-Optimization, Ensemble-Patterns ## Open Questions / Lessons für OpenClaw 1. **Self-Fusion in OpenClaw-Pipelines?** Hector's Primary-Fallback-Chain ([[architecture/model-routing.md]]) ist sequentiell. Wäre eine parallele Pre-Routing-Schicht mit 2-3 Modellen + Synthese sinnvoll für Quality-kritische Tasks? 2. **Judge-Modell für interne Subconscious-Outputs?** Subconscious-Agent-Evidence-Runner macht Hard Synthesis. Lohnt der Wechsel von sequentiell auf Ensemble? 3. **Excluded-Domains in OpenClaw?** Wenn Subconscious Agent öffentliche Quellen crawled, sollte er die eigene Knowledge-Base ausschließen, um Self-Referenz-Loops zu vermeiden?