knowledge-base/raw/blog/2026-06-12_openrouter-fusion-beats-frontier.md
Hector Bot ce85f0e7ce ingest(blog): openrouter-fusion-beats-frontier
OpenRouter launcht Fusion (12.06.2026) - parallele Model-Panels mit
Judge-Synthese. DRACO-Validierung (Perplexity AI) zeigt:

- Fable 5 + GPT-5.5 (synth. Opus 4.8) = 69.0% > Fable 5 solo 65.3%
- Budget-Panel (Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro) = 64.7%
  bei 50% der Kosten vs. Fable 5 (65.3%)
- Self-Fusion (Opus 4.8 + Opus 4.8) = +6.7 Punkte ueber Solo-Opus
- Anti-Contamination: excluded_domains in Server Tools

Konzeptseite wiki/concepts/llm-model-fusion-ensembles.md mit:
- Architektur + API-Beispiele
- Vollstaendige DRACO-Result-Tabelle mit Verlinkung
- Methodische Lessons (Excluded-Domains, Judge-Wahl)
- Pro-Leben-Perspektive (gegen Frontier-Skalierungs-Mangelnarrativ)
- Cross-Refs zu llm-behavior-persistence, model-routing, ai-agents
- Externe Ressourcen: OpenRouter, DRACO arXiv+HF, Ensemble-Literatur
- Open Questions fuer OpenClaw (Self-Fusion in Routing, Excluded-Domains)

Maximale Verlinkung gemaess neuer AGENTS.md-Kardinalregel:
- 7 OpenRouter-Links
- 5 DRACO-Links (arXiv Abstract/PDF/HTML, HF Dataset, Perplexity)
- 6 Ensemble-Konzept-Links (Self-Consistency, MoE, Tsinghua-Studie)
- 4 Multi-Agent-Framework-Links (AutoGen, CrewAI, LangGraph, DSPy)
- 3 Wiki-Cross-References
2026-06-15 09:18:25 +02:00

7.6 KiB
Raw Permalink Blame History

type source_url retrieved title author published updated tags
blog https://openrouter.ai/blog/announcements/fusion-beats-frontier/ 2026-06-15 Surpassing Frontier Performance with Fusion Brian Thomas (OpenRouter) 2026-06-12 2026-06-14
openrouter
fusion
model-ensemble
draco-benchmark
deep-research
model-routing
llm-systems

OpenRouter Fusion: Surpassing Frontier Performance with Model Panels

Geteilt von: @k9ert in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic

Quelle

Kernthese

"Synthesizing the results of multiple models can significantly outperform what individual models are capable of."

OpenRouter launcht Fusion — ein Routing-Layer, der mehrere Modelle parallel antworten lässt und ein Judge-Modell die Ergebnisse zu einer konsolidierten Antwort fusioniert. Über das DRACO-Benchmark validiert: Beyond-Frontier-Performance mit Billig-Modell-Panels.

Architektur

User Prompt
    ↓
Fusion Pipeline (server-side)
    ↓
┌─────────────┬─────────────┬─────────────┐
│  Panel      │  Panel      │  Panel      │  (parallele Calls,
│  Model 1    │  Model 2    │  Model N    │   web search + fetch)
└─────────────┴─────────────┴─────────────┘
    ↓             ↓             ↓
        Judge / Synthesizer Model
        (strukturiert: Konsens, Widersprüche,
         partielle Abdeckung, einzigartige Insights,
         blinde Flecken)
    ↓
Final Answer

API-Call:

{
  "model": "openrouter/fusion",
  "messages": [{"role": "user", "content": "..."}],
  "plugins": [{
    "id": "fusion",
    "model": "google/gemini-3-flash-preview",
    "analysis_models": [
      "google/gemini-3-flash-preview",
      "moonshotai/kimi-k2.6",
      "deepseek/deepseek-v4-pro"
    ]
  }]
}

DRACO-Benchmark Ergebnisse

Quelle: DRACO: a Cross-Domain Benchmark for Deep Research (Perplexity AI, arXiv:2602.11685, 12.02.2026)

Typ Model(s) Score
Fusion Fable 5 + GPT-5.5 (synthesized by Opus 4.8) 69.0%
Fusion Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro (synth. Opus 4.8) 68.3%
Fusion Opus 4.8 + GPT-5.5 (synth. Opus 4.8) 67.6%
Fusion Opus 4.8 + Opus 4.8 (synth. Opus 4.8) 65.5%
Solo Claude Fable 5 65.3%
Fusion Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro (synth. Opus 4.8) 64.7%
Solo DeepSeek V4 Pro 60.3%
Solo GPT-5.5 60.0%
Solo Claude Opus 4.8 58.8%
Solo Kimi K2.6 53.7%
Solo Gemini 3.1 Pro 45.4%
Solo Gemini 3 Flash 43.1%

Drei Schlüsselbefunde:

  1. Panels schlagen einzelne Modelle konsistent — selbst mit identischer Architektur (Opus 4.8 + Opus 4.8: +6.7 Punkte über Solo-Opus)
  2. Beyond-Frontier mit Frontier-Panels — Fable 5 + GPT-5.5 schlägt Fable 5 alleine
  3. Budget-Panels erreichen Frontier-Nähe zu halben Kosten — Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro kommen auf 64.7% (innerhalb 1% von Fable 5) bei 50% der Kosten

Wichtige methodische Details

Benchmark-Design (DRACO)

100 Deep-Research-Tasks in 10 Domänen (Akademik, Finanzen, Jura, Medizin, Tech, UX, General Knowledge, Needle-in-Haystack, Personal Assistant, Product Comparison). Pro Task ~39 gewichtete Kriterien in 4 Dimensionen:

  • Factual Accuracy (~20 Kriterien)
  • Breadth & Depth (~9 Kriterien, inkl. Trade-off-Analyse)
  • Presentation Quality (~6 Kriterien, inkl. Lesbarkeit)
  • Citation Quality (~5 Kriterien, primäre Quellen)

Negative Gewichtung für gefährliche Falschaussagen (z.B. medizinisch) verhindert Score-Gaming durch Länge. Jede Antwort wird 3× von Judge-Modell graded, Mittelwert berichtet.

Anti-Cheating-Mechanismus

"When we gave the panel models web search, we discovered something alarming: they were finding the DRACO grading rubric online."

OpenRouter schließt DRACO-Quellen vom Web-Search/Fetch aus — Konfiguration auf excluded_domains/blocked_domains in Server-Tools. Nutzbar auch für eigene Evals. Quelle: OpenRouter Server Tools.

Selbst-Fusion überraschend stark

Opus 4.8 + Opus 4.8 (also 2× dasselbe Modell, beide mit Synthesizer-Pflicht) liefert 65.5% vs. Solo-Opus 4.8 58.8%. → +6.7 Punkte durch reine Self-Synthesis (zwei verschiedene Reasoning-Pfade, Tool-Calls, Quellenauswahl).

Kernaussage / Konzept

Model Panels / Fusion Ensemble als emergentes Architektur-Pattern: Statt einzelne Modelle zu skalieren, mehrere mittelgroße Modelle parallel + Judge fusioniert. Trade-offs: höhere Latenz und Kosten pro Query, dafür bessere Abdeckung und Beyond-Frontier-Performance bei Budget-Modellen.

Direkter Kontrast zu concepts/llm-behavior-persistence.md: Während dort das Innere eines Modells (Persistenz schädlicher Eigenschaften) thematisiert wird, adressiert Fusion die Außenseite (kollektive Intelligenz über Modellgrenzen hinweg). Zwei komplementäre Probleme.

Verbindung zu bestehendem Wiki

  • Model-Routing: Bestehende architecture/model-routing.md-Seite behandelt Fallback-Chains. Fusion ist orthogonal — kein Fallback, sondern paralleles Ensemble + Synthese.
  • LLM Behavior Persistence: Persistenz im Einzelmodell → Ensemble mildert das (verschiedene Biases, verschiedene Halluzinationsmuster, Judge kann filtern).
  • Open-Source-Debatte (Liesel Weppen Thread): Fusions-Resultat zeigt, dass auch ohne "echte" Open Source ein Ensemble aus heterogenen (auch closed) Modellen Beyond-Frontier-Performance liefert. Pragmatischer Ansatz.

6/14 FAQ Update (Auszug)

  • Drop-in-Replacement für Fable 5? Nein — nur für die getestete Klasse (Deep Research), Lang-Horizon-Tasks bleiben Fable-Territorium.
  • (weitere FAQ-Punkte im Original-Blog)

Zitierte/verlinkte Ressourcen

Erwähnte Modelle (mit Verlinkung)