OpenRouter launcht Fusion (12.06.2026) - parallele Model-Panels mit Judge-Synthese. DRACO-Validierung (Perplexity AI) zeigt: - Fable 5 + GPT-5.5 (synth. Opus 4.8) = 69.0% > Fable 5 solo 65.3% - Budget-Panel (Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro) = 64.7% bei 50% der Kosten vs. Fable 5 (65.3%) - Self-Fusion (Opus 4.8 + Opus 4.8) = +6.7 Punkte ueber Solo-Opus - Anti-Contamination: excluded_domains in Server Tools Konzeptseite wiki/concepts/llm-model-fusion-ensembles.md mit: - Architektur + API-Beispiele - Vollstaendige DRACO-Result-Tabelle mit Verlinkung - Methodische Lessons (Excluded-Domains, Judge-Wahl) - Pro-Leben-Perspektive (gegen Frontier-Skalierungs-Mangelnarrativ) - Cross-Refs zu llm-behavior-persistence, model-routing, ai-agents - Externe Ressourcen: OpenRouter, DRACO arXiv+HF, Ensemble-Literatur - Open Questions fuer OpenClaw (Self-Fusion in Routing, Excluded-Domains) Maximale Verlinkung gemaess neuer AGENTS.md-Kardinalregel: - 7 OpenRouter-Links - 5 DRACO-Links (arXiv Abstract/PDF/HTML, HF Dataset, Perplexity) - 6 Ensemble-Konzept-Links (Self-Consistency, MoE, Tsinghua-Studie) - 4 Multi-Agent-Framework-Links (AutoGen, CrewAI, LangGraph, DSPy) - 3 Wiki-Cross-References
7.6 KiB
| type | source_url | retrieved | title | author | published | updated | tags | |||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| blog | https://openrouter.ai/blog/announcements/fusion-beats-frontier/ | 2026-06-15 | Surpassing Frontier Performance with Fusion | Brian Thomas (OpenRouter) | 2026-06-12 | 2026-06-14 |
|
OpenRouter Fusion: Surpassing Frontier Performance with Model Panels
Geteilt von: @k9ert in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic
Quelle
- Titel: Surpassing Frontier Performance with Fusion
- Autor: Brian Thomas (OpenRouter)
- Veröffentlicht: 12.06.2026 (Update 14.06.2026: FAQ)
- URL: https://openrouter.ai/blog/announcements/fusion-beats-frontier/
- Kernlinks:
- Try Fusion: https://openrouter.ai/fusion
- API-Docs: https://openrouter.ai/docs/guides/features/server-tools/fusion
- Server Tools (Web Search/Fetch): https://openrouter.ai/docs/guides/features/server-tools
- Web Search Tool-Definition: https://openrouter.ai/docs/guides/features/server-tools/web-search
Kernthese
"Synthesizing the results of multiple models can significantly outperform what individual models are capable of."
OpenRouter launcht Fusion — ein Routing-Layer, der mehrere Modelle parallel antworten lässt und ein Judge-Modell die Ergebnisse zu einer konsolidierten Antwort fusioniert. Über das DRACO-Benchmark validiert: Beyond-Frontier-Performance mit Billig-Modell-Panels.
Architektur
User Prompt
↓
Fusion Pipeline (server-side)
↓
┌─────────────┬─────────────┬─────────────┐
│ Panel │ Panel │ Panel │ (parallele Calls,
│ Model 1 │ Model 2 │ Model N │ web search + fetch)
└─────────────┴─────────────┴─────────────┘
↓ ↓ ↓
Judge / Synthesizer Model
(strukturiert: Konsens, Widersprüche,
partielle Abdeckung, einzigartige Insights,
blinde Flecken)
↓
Final Answer
API-Call:
{
"model": "openrouter/fusion",
"messages": [{"role": "user", "content": "..."}],
"plugins": [{
"id": "fusion",
"model": "google/gemini-3-flash-preview",
"analysis_models": [
"google/gemini-3-flash-preview",
"moonshotai/kimi-k2.6",
"deepseek/deepseek-v4-pro"
]
}]
}
DRACO-Benchmark Ergebnisse
Quelle: DRACO: a Cross-Domain Benchmark for Deep Research (Perplexity AI, arXiv:2602.11685, 12.02.2026)
- PDF | HTML v1 | HF Dataset
| Typ | Model(s) | Score |
|---|---|---|
| Fusion | Fable 5 + GPT-5.5 (synthesized by Opus 4.8) | 69.0% |
| Fusion | Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro (synth. Opus 4.8) | 68.3% |
| Fusion | Opus 4.8 + GPT-5.5 (synth. Opus 4.8) | 67.6% |
| Fusion | Opus 4.8 + Opus 4.8 (synth. Opus 4.8) | 65.5% |
| Solo | Claude Fable 5 | 65.3% |
| Fusion | Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro (synth. Opus 4.8) | 64.7% |
| Solo | DeepSeek V4 Pro | 60.3% |
| Solo | GPT-5.5 | 60.0% |
| Solo | Claude Opus 4.8 | 58.8% |
| Solo | Kimi K2.6 | 53.7% |
| Solo | Gemini 3.1 Pro | 45.4% |
| Solo | Gemini 3 Flash | 43.1% |
Drei Schlüsselbefunde:
- Panels schlagen einzelne Modelle konsistent — selbst mit identischer Architektur (Opus 4.8 + Opus 4.8: +6.7 Punkte über Solo-Opus)
- Beyond-Frontier mit Frontier-Panels — Fable 5 + GPT-5.5 schlägt Fable 5 alleine
- Budget-Panels erreichen Frontier-Nähe zu halben Kosten — Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro kommen auf 64.7% (innerhalb 1% von Fable 5) bei 50% der Kosten
Wichtige methodische Details
Benchmark-Design (DRACO)
100 Deep-Research-Tasks in 10 Domänen (Akademik, Finanzen, Jura, Medizin, Tech, UX, General Knowledge, Needle-in-Haystack, Personal Assistant, Product Comparison). Pro Task ~39 gewichtete Kriterien in 4 Dimensionen:
- Factual Accuracy (~20 Kriterien)
- Breadth & Depth (~9 Kriterien, inkl. Trade-off-Analyse)
- Presentation Quality (~6 Kriterien, inkl. Lesbarkeit)
- Citation Quality (~5 Kriterien, primäre Quellen)
Negative Gewichtung für gefährliche Falschaussagen (z.B. medizinisch) verhindert Score-Gaming durch Länge. Jede Antwort wird 3× von Judge-Modell graded, Mittelwert berichtet.
Anti-Cheating-Mechanismus
"When we gave the panel models web search, we discovered something alarming: they were finding the DRACO grading rubric online."
OpenRouter schließt DRACO-Quellen vom Web-Search/Fetch aus — Konfiguration auf excluded_domains/blocked_domains in Server-Tools. Nutzbar auch für eigene Evals. Quelle: OpenRouter Server Tools.
Selbst-Fusion überraschend stark
Opus 4.8 + Opus 4.8 (also 2× dasselbe Modell, beide mit Synthesizer-Pflicht) liefert 65.5% vs. Solo-Opus 4.8 58.8%. → +6.7 Punkte durch reine Self-Synthesis (zwei verschiedene Reasoning-Pfade, Tool-Calls, Quellenauswahl).
Kernaussage / Konzept
Model Panels / Fusion Ensemble als emergentes Architektur-Pattern: Statt einzelne Modelle zu skalieren, mehrere mittelgroße Modelle parallel + Judge fusioniert. Trade-offs: höhere Latenz und Kosten pro Query, dafür bessere Abdeckung und Beyond-Frontier-Performance bei Budget-Modellen.
Direkter Kontrast zu concepts/llm-behavior-persistence.md: Während dort das Innere eines Modells (Persistenz schädlicher Eigenschaften) thematisiert wird, adressiert Fusion die Außenseite (kollektive Intelligenz über Modellgrenzen hinweg). Zwei komplementäre Probleme.
Verbindung zu bestehendem Wiki
- Model-Routing: Bestehende architecture/model-routing.md-Seite behandelt Fallback-Chains. Fusion ist orthogonal — kein Fallback, sondern paralleles Ensemble + Synthese.
- LLM Behavior Persistence: Persistenz im Einzelmodell → Ensemble mildert das (verschiedene Biases, verschiedene Halluzinationsmuster, Judge kann filtern).
- Open-Source-Debatte (Liesel Weppen Thread): Fusions-Resultat zeigt, dass auch ohne "echte" Open Source ein Ensemble aus heterogenen (auch closed) Modellen Beyond-Frontier-Performance liefert. Pragmatischer Ansatz.
6/14 FAQ Update (Auszug)
- Drop-in-Replacement für Fable 5? Nein — nur für die getestete Klasse (Deep Research), Lang-Horizon-Tasks bleiben Fable-Territorium.
- (weitere FAQ-Punkte im Original-Blog)
Zitierte/verlinkte Ressourcen
- DRACO Paper: https://arxiv.org/abs/2602.11685
- DRACO PDF: https://arxiv.org/pdf/2602.11685
- DRACO HTML: https://arxiv.org/html/2602.11685v1
- DRACO HF Dataset: https://hf.co/datasets/perplexity-ai/draco
- Perplexity AI: https://www.perplexity.ai/
- OpenRouter Fusion: https://openrouter.ai/fusion
- OpenRouter API Docs: https://openrouter.ai/docs/guides/features/server-tools/fusion
- OpenRouter Server Tools: https://openrouter.ai/docs/guides/features/server-tools
- OpenRouter Web Search Tool: https://openrouter.ai/docs/guides/features/server-tools/web-search
- OpenRouter Model Listing: https://openrouter.ai/models
- Brian Thomas (OpenRouter): https://openrouter.ai/
Erwähnte Modelle (mit Verlinkung)
- Claude Fable 5 — https://openrouter.ai/anthropic
- Claude Opus 4.8 — https://openrouter.ai/anthropic
- GPT-5.5 — https://openrouter.ai/openai
- Gemini 3.1 Pro / Gemini 3 Flash — https://openrouter.ai/google
- Kimi K2.6 (Moonshot) — https://openrouter.ai/moonshotai
- DeepSeek V4 Pro — https://openrouter.ai/deepseek