knowledge-base/raw/blog/2026-06-12_openrouter-fusion-beats-frontier.md
Hector Bot ce85f0e7ce ingest(blog): openrouter-fusion-beats-frontier
OpenRouter launcht Fusion (12.06.2026) - parallele Model-Panels mit
Judge-Synthese. DRACO-Validierung (Perplexity AI) zeigt:

- Fable 5 + GPT-5.5 (synth. Opus 4.8) = 69.0% > Fable 5 solo 65.3%
- Budget-Panel (Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro) = 64.7%
  bei 50% der Kosten vs. Fable 5 (65.3%)
- Self-Fusion (Opus 4.8 + Opus 4.8) = +6.7 Punkte ueber Solo-Opus
- Anti-Contamination: excluded_domains in Server Tools

Konzeptseite wiki/concepts/llm-model-fusion-ensembles.md mit:
- Architektur + API-Beispiele
- Vollstaendige DRACO-Result-Tabelle mit Verlinkung
- Methodische Lessons (Excluded-Domains, Judge-Wahl)
- Pro-Leben-Perspektive (gegen Frontier-Skalierungs-Mangelnarrativ)
- Cross-Refs zu llm-behavior-persistence, model-routing, ai-agents
- Externe Ressourcen: OpenRouter, DRACO arXiv+HF, Ensemble-Literatur
- Open Questions fuer OpenClaw (Self-Fusion in Routing, Excluded-Domains)

Maximale Verlinkung gemaess neuer AGENTS.md-Kardinalregel:
- 7 OpenRouter-Links
- 5 DRACO-Links (arXiv Abstract/PDF/HTML, HF Dataset, Perplexity)
- 6 Ensemble-Konzept-Links (Self-Consistency, MoE, Tsinghua-Studie)
- 4 Multi-Agent-Framework-Links (AutoGen, CrewAI, LangGraph, DSPy)
- 3 Wiki-Cross-References
2026-06-15 09:18:25 +02:00

158 lines
7.6 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
type: blog
source_url: https://openrouter.ai/blog/announcements/fusion-beats-frontier/
retrieved: 2026-06-15
title: "Surpassing Frontier Performance with Fusion"
author: "Brian Thomas (OpenRouter)"
published: 2026-06-12
updated: 2026-06-14
tags: [openrouter, fusion, model-ensemble, draco-benchmark, deep-research, model-routing, llm-systems]
---
# OpenRouter Fusion: Surpassing Frontier Performance with Model Panels
**Geteilt von:** @k9ert in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic
## Quelle
- **Titel:** Surpassing Frontier Performance with Fusion
- **Autor:** Brian Thomas (OpenRouter)
- **Veröffentlicht:** 12.06.2026 (Update 14.06.2026: FAQ)
- **URL:** https://openrouter.ai/blog/announcements/fusion-beats-frontier/
- **Kernlinks:**
- Try Fusion: https://openrouter.ai/fusion
- API-Docs: https://openrouter.ai/docs/guides/features/server-tools/fusion
- Server Tools (Web Search/Fetch): https://openrouter.ai/docs/guides/features/server-tools
- Web Search Tool-Definition: https://openrouter.ai/docs/guides/features/server-tools/web-search
## Kernthese
> "Synthesizing the results of multiple models can significantly outperform what individual models are capable of."
OpenRouter launcht **Fusion** — ein Routing-Layer, der mehrere Modelle parallel antworten lässt und ein Judge-Modell die Ergebnisse zu einer konsolidierten Antwort fusioniert. Über das DRACO-Benchmark validiert: **Beyond-Frontier-Performance** mit Billig-Modell-Panels.
## Architektur
```
User Prompt
Fusion Pipeline (server-side)
┌─────────────┬─────────────┬─────────────┐
│ Panel │ Panel │ Panel │ (parallele Calls,
│ Model 1 │ Model 2 │ Model N │ web search + fetch)
└─────────────┴─────────────┴─────────────┘
↓ ↓ ↓
Judge / Synthesizer Model
(strukturiert: Konsens, Widersprüche,
partielle Abdeckung, einzigartige Insights,
blinde Flecken)
Final Answer
```
**API-Call:**
```json
{
"model": "openrouter/fusion",
"messages": [{"role": "user", "content": "..."}],
"plugins": [{
"id": "fusion",
"model": "google/gemini-3-flash-preview",
"analysis_models": [
"google/gemini-3-flash-preview",
"moonshotai/kimi-k2.6",
"deepseek/deepseek-v4-pro"
]
}]
}
```
## DRACO-Benchmark Ergebnisse
Quelle: [DRACO: a Cross-Domain Benchmark for Deep Research](https://arxiv.org/abs/2602.11685) (Perplexity AI, arXiv:2602.11685, 12.02.2026)
- [PDF](https://arxiv.org/pdf/2602.11685) | [HTML v1](https://arxiv.org/html/2602.11685v1) | [HF Dataset](https://hf.co/datasets/perplexity-ai/draco)
| Typ | Model(s) | Score |
|---|---|---|
| Fusion | Fable 5 + GPT-5.5 (synthesized by Opus 4.8) | **69.0%** |
| Fusion | Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro (synth. Opus 4.8) | **68.3%** |
| Fusion | Opus 4.8 + GPT-5.5 (synth. Opus 4.8) | **67.6%** |
| Fusion | Opus 4.8 + Opus 4.8 (synth. Opus 4.8) | **65.5%** |
| Solo | Claude Fable 5 | 65.3% |
| Fusion | Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro (synth. Opus 4.8) | **64.7%** |
| Solo | DeepSeek V4 Pro | 60.3% |
| Solo | GPT-5.5 | 60.0% |
| Solo | Claude Opus 4.8 | 58.8% |
| Solo | Kimi K2.6 | 53.7% |
| Solo | Gemini 3.1 Pro | 45.4% |
| Solo | Gemini 3 Flash | 43.1% |
**Drei Schlüsselbefunde:**
1. **Panels schlagen einzelne Modelle konsistent** — selbst mit identischer Architektur (Opus 4.8 + Opus 4.8: +6.7 Punkte über Solo-Opus)
2. **Beyond-Frontier mit Frontier-Panels** — Fable 5 + GPT-5.5 schlägt Fable 5 alleine
3. **Budget-Panels erreichen Frontier-Nähe zu halben Kosten** — Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro kommen auf 64.7% (innerhalb 1% von Fable 5) bei 50% der Kosten
## Wichtige methodische Details
### Benchmark-Design (DRACO)
100 Deep-Research-Tasks in 10 Domänen (Akademik, Finanzen, Jura, Medizin, Tech, UX, General Knowledge, Needle-in-Haystack, Personal Assistant, Product Comparison). Pro Task ~39 gewichtete Kriterien in 4 Dimensionen:
- **Factual Accuracy** (~20 Kriterien)
- **Breadth & Depth** (~9 Kriterien, inkl. Trade-off-Analyse)
- **Presentation Quality** (~6 Kriterien, inkl. Lesbarkeit)
- **Citation Quality** (~5 Kriterien, primäre Quellen)
Negative Gewichtung für gefährliche Falschaussagen (z.B. medizinisch) verhindert Score-Gaming durch Länge. Jede Antwort wird 3× von Judge-Modell graded, Mittelwert berichtet.
### Anti-Cheating-Mechanismus
> "When we gave the panel models web search, we discovered something alarming: they were finding the DRACO grading rubric online."
OpenRouter schließt DRACO-Quellen vom Web-Search/Fetch aus — Konfiguration auf `excluded_domains`/`blocked_domains` in Server-Tools. Nutzbar auch für eigene Evals. Quelle: [OpenRouter Server Tools](https://openrouter.ai/docs/guides/features/server-tools).
### Selbst-Fusion überraschend stark
Opus 4.8 + Opus 4.8 (also 2× dasselbe Modell, beide mit Synthesizer-Pflicht) liefert **65.5%** vs. Solo-Opus 4.8 **58.8%**. → **+6.7 Punkte** durch reine Self-Synthesis (zwei verschiedene Reasoning-Pfade, Tool-Calls, Quellenauswahl).
## Kernaussage / Konzept
**Model Panels / Fusion Ensemble** als emergentes Architektur-Pattern: Statt einzelne Modelle zu skalieren, mehrere mittelgroße Modelle parallel + Judge fusioniert. Trade-offs: höhere Latenz und Kosten pro Query, dafür bessere Abdeckung und Beyond-Frontier-Performance bei Budget-Modellen.
**Direkter Kontrast zu [[concepts/llm-behavior-persistence.md]]:** Während dort das **Innere** eines Modells (Persistenz schädlicher Eigenschaften) thematisiert wird, adressiert Fusion die **Außenseite** (kollektive Intelligenz über Modellgrenzen hinweg). Zwei komplementäre Probleme.
## Verbindung zu bestehendem Wiki
- **Model-Routing:** Bestehende [[architecture/model-routing.md]]-Seite behandelt Fallback-Chains. Fusion ist *orthogonal* — kein Fallback, sondern *paralleles Ensemble + Synthese*.
- **LLM Behavior Persistence:** Persistenz im Einzelmodell → Ensemble mildert das (verschiedene Biases, verschiedene Halluzinationsmuster, Judge kann filtern).
- **Open-Source-Debatte (Liesel Weppen Thread):** Fusions-Resultat zeigt, dass auch ohne "echte" Open Source ein Ensemble aus heterogenen (auch closed) Modellen Beyond-Frontier-Performance liefert. Pragmatischer Ansatz.
## 6/14 FAQ Update (Auszug)
- **Drop-in-Replacement für Fable 5?** Nein — nur für die getestete Klasse (Deep Research), Lang-Horizon-Tasks bleiben Fable-Territorium.
- (weitere FAQ-Punkte im Original-Blog)
## Zitierte/verlinkte Ressourcen
- DRACO Paper: https://arxiv.org/abs/2602.11685
- DRACO PDF: https://arxiv.org/pdf/2602.11685
- DRACO HTML: https://arxiv.org/html/2602.11685v1
- DRACO HF Dataset: https://hf.co/datasets/perplexity-ai/draco
- Perplexity AI: https://www.perplexity.ai/
- OpenRouter Fusion: https://openrouter.ai/fusion
- OpenRouter API Docs: https://openrouter.ai/docs/guides/features/server-tools/fusion
- OpenRouter Server Tools: https://openrouter.ai/docs/guides/features/server-tools
- OpenRouter Web Search Tool: https://openrouter.ai/docs/guides/features/server-tools/web-search
- OpenRouter Model Listing: https://openrouter.ai/models
- Brian Thomas (OpenRouter): https://openrouter.ai/
## Erwähnte Modelle (mit Verlinkung)
- Claude Fable 5 — https://openrouter.ai/anthropic
- Claude Opus 4.8 — https://openrouter.ai/anthropic
- GPT-5.5 — https://openrouter.ai/openai
- Gemini 3.1 Pro / Gemini 3 Flash — https://openrouter.ai/google
- Kimi K2.6 (Moonshot) — https://openrouter.ai/moonshotai
- DeepSeek V4 Pro — https://openrouter.ai/deepseek