159 lines
7.6 KiB
Markdown
159 lines
7.6 KiB
Markdown
|
|
---
|
|||
|
|
type: blog
|
|||
|
|
source_url: https://openrouter.ai/blog/announcements/fusion-beats-frontier/
|
|||
|
|
retrieved: 2026-06-15
|
|||
|
|
title: "Surpassing Frontier Performance with Fusion"
|
|||
|
|
author: "Brian Thomas (OpenRouter)"
|
|||
|
|
published: 2026-06-12
|
|||
|
|
updated: 2026-06-14
|
|||
|
|
tags: [openrouter, fusion, model-ensemble, draco-benchmark, deep-research, model-routing, llm-systems]
|
|||
|
|
---
|
|||
|
|
|
|||
|
|
# OpenRouter Fusion: Surpassing Frontier Performance with Model Panels
|
|||
|
|
|
|||
|
|
**Geteilt von:** @k9ert in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic
|
|||
|
|
|
|||
|
|
## Quelle
|
|||
|
|
|
|||
|
|
- **Titel:** Surpassing Frontier Performance with Fusion
|
|||
|
|
- **Autor:** Brian Thomas (OpenRouter)
|
|||
|
|
- **Veröffentlicht:** 12.06.2026 (Update 14.06.2026: FAQ)
|
|||
|
|
- **URL:** https://openrouter.ai/blog/announcements/fusion-beats-frontier/
|
|||
|
|
- **Kernlinks:**
|
|||
|
|
- Try Fusion: https://openrouter.ai/fusion
|
|||
|
|
- API-Docs: https://openrouter.ai/docs/guides/features/server-tools/fusion
|
|||
|
|
- Server Tools (Web Search/Fetch): https://openrouter.ai/docs/guides/features/server-tools
|
|||
|
|
- Web Search Tool-Definition: https://openrouter.ai/docs/guides/features/server-tools/web-search
|
|||
|
|
|
|||
|
|
## Kernthese
|
|||
|
|
|
|||
|
|
> "Synthesizing the results of multiple models can significantly outperform what individual models are capable of."
|
|||
|
|
|
|||
|
|
OpenRouter launcht **Fusion** — ein Routing-Layer, der mehrere Modelle parallel antworten lässt und ein Judge-Modell die Ergebnisse zu einer konsolidierten Antwort fusioniert. Über das DRACO-Benchmark validiert: **Beyond-Frontier-Performance** mit Billig-Modell-Panels.
|
|||
|
|
|
|||
|
|
## Architektur
|
|||
|
|
|
|||
|
|
```
|
|||
|
|
User Prompt
|
|||
|
|
↓
|
|||
|
|
Fusion Pipeline (server-side)
|
|||
|
|
↓
|
|||
|
|
┌─────────────┬─────────────┬─────────────┐
|
|||
|
|
│ Panel │ Panel │ Panel │ (parallele Calls,
|
|||
|
|
│ Model 1 │ Model 2 │ Model N │ web search + fetch)
|
|||
|
|
└─────────────┴─────────────┴─────────────┘
|
|||
|
|
↓ ↓ ↓
|
|||
|
|
Judge / Synthesizer Model
|
|||
|
|
(strukturiert: Konsens, Widersprüche,
|
|||
|
|
partielle Abdeckung, einzigartige Insights,
|
|||
|
|
blinde Flecken)
|
|||
|
|
↓
|
|||
|
|
Final Answer
|
|||
|
|
```
|
|||
|
|
|
|||
|
|
**API-Call:**
|
|||
|
|
```json
|
|||
|
|
{
|
|||
|
|
"model": "openrouter/fusion",
|
|||
|
|
"messages": [{"role": "user", "content": "..."}],
|
|||
|
|
"plugins": [{
|
|||
|
|
"id": "fusion",
|
|||
|
|
"model": "google/gemini-3-flash-preview",
|
|||
|
|
"analysis_models": [
|
|||
|
|
"google/gemini-3-flash-preview",
|
|||
|
|
"moonshotai/kimi-k2.6",
|
|||
|
|
"deepseek/deepseek-v4-pro"
|
|||
|
|
]
|
|||
|
|
}]
|
|||
|
|
}
|
|||
|
|
```
|
|||
|
|
|
|||
|
|
## DRACO-Benchmark Ergebnisse
|
|||
|
|
|
|||
|
|
Quelle: [DRACO: a Cross-Domain Benchmark for Deep Research](https://arxiv.org/abs/2602.11685) (Perplexity AI, arXiv:2602.11685, 12.02.2026)
|
|||
|
|
- [PDF](https://arxiv.org/pdf/2602.11685) | [HTML v1](https://arxiv.org/html/2602.11685v1) | [HF Dataset](https://hf.co/datasets/perplexity-ai/draco)
|
|||
|
|
|
|||
|
|
| Typ | Model(s) | Score |
|
|||
|
|
|---|---|---|
|
|||
|
|
| Fusion | Fable 5 + GPT-5.5 (synthesized by Opus 4.8) | **69.0%** |
|
|||
|
|
| Fusion | Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro (synth. Opus 4.8) | **68.3%** |
|
|||
|
|
| Fusion | Opus 4.8 + GPT-5.5 (synth. Opus 4.8) | **67.6%** |
|
|||
|
|
| Fusion | Opus 4.8 + Opus 4.8 (synth. Opus 4.8) | **65.5%** |
|
|||
|
|
| Solo | Claude Fable 5 | 65.3% |
|
|||
|
|
| Fusion | Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro (synth. Opus 4.8) | **64.7%** |
|
|||
|
|
| Solo | DeepSeek V4 Pro | 60.3% |
|
|||
|
|
| Solo | GPT-5.5 | 60.0% |
|
|||
|
|
| Solo | Claude Opus 4.8 | 58.8% |
|
|||
|
|
| Solo | Kimi K2.6 | 53.7% |
|
|||
|
|
| Solo | Gemini 3.1 Pro | 45.4% |
|
|||
|
|
| Solo | Gemini 3 Flash | 43.1% |
|
|||
|
|
|
|||
|
|
**Drei Schlüsselbefunde:**
|
|||
|
|
|
|||
|
|
1. **Panels schlagen einzelne Modelle konsistent** — selbst mit identischer Architektur (Opus 4.8 + Opus 4.8: +6.7 Punkte über Solo-Opus)
|
|||
|
|
2. **Beyond-Frontier mit Frontier-Panels** — Fable 5 + GPT-5.5 schlägt Fable 5 alleine
|
|||
|
|
3. **Budget-Panels erreichen Frontier-Nähe zu halben Kosten** — Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro kommen auf 64.7% (innerhalb 1% von Fable 5) bei 50% der Kosten
|
|||
|
|
|
|||
|
|
## Wichtige methodische Details
|
|||
|
|
|
|||
|
|
### Benchmark-Design (DRACO)
|
|||
|
|
|
|||
|
|
100 Deep-Research-Tasks in 10 Domänen (Akademik, Finanzen, Jura, Medizin, Tech, UX, General Knowledge, Needle-in-Haystack, Personal Assistant, Product Comparison). Pro Task ~39 gewichtete Kriterien in 4 Dimensionen:
|
|||
|
|
|
|||
|
|
- **Factual Accuracy** (~20 Kriterien)
|
|||
|
|
- **Breadth & Depth** (~9 Kriterien, inkl. Trade-off-Analyse)
|
|||
|
|
- **Presentation Quality** (~6 Kriterien, inkl. Lesbarkeit)
|
|||
|
|
- **Citation Quality** (~5 Kriterien, primäre Quellen)
|
|||
|
|
|
|||
|
|
Negative Gewichtung für gefährliche Falschaussagen (z.B. medizinisch) verhindert Score-Gaming durch Länge. Jede Antwort wird 3× von Judge-Modell graded, Mittelwert berichtet.
|
|||
|
|
|
|||
|
|
### Anti-Cheating-Mechanismus
|
|||
|
|
|
|||
|
|
> "When we gave the panel models web search, we discovered something alarming: they were finding the DRACO grading rubric online."
|
|||
|
|
|
|||
|
|
OpenRouter schließt DRACO-Quellen vom Web-Search/Fetch aus — Konfiguration auf `excluded_domains`/`blocked_domains` in Server-Tools. Nutzbar auch für eigene Evals. Quelle: [OpenRouter Server Tools](https://openrouter.ai/docs/guides/features/server-tools).
|
|||
|
|
|
|||
|
|
### Selbst-Fusion überraschend stark
|
|||
|
|
|
|||
|
|
Opus 4.8 + Opus 4.8 (also 2× dasselbe Modell, beide mit Synthesizer-Pflicht) liefert **65.5%** vs. Solo-Opus 4.8 **58.8%**. → **+6.7 Punkte** durch reine Self-Synthesis (zwei verschiedene Reasoning-Pfade, Tool-Calls, Quellenauswahl).
|
|||
|
|
|
|||
|
|
## Kernaussage / Konzept
|
|||
|
|
|
|||
|
|
**Model Panels / Fusion Ensemble** als emergentes Architektur-Pattern: Statt einzelne Modelle zu skalieren, mehrere mittelgroße Modelle parallel + Judge fusioniert. Trade-offs: höhere Latenz und Kosten pro Query, dafür bessere Abdeckung und Beyond-Frontier-Performance bei Budget-Modellen.
|
|||
|
|
|
|||
|
|
**Direkter Kontrast zu [[concepts/llm-behavior-persistence.md]]:** Während dort das **Innere** eines Modells (Persistenz schädlicher Eigenschaften) thematisiert wird, adressiert Fusion die **Außenseite** (kollektive Intelligenz über Modellgrenzen hinweg). Zwei komplementäre Probleme.
|
|||
|
|
|
|||
|
|
## Verbindung zu bestehendem Wiki
|
|||
|
|
|
|||
|
|
- **Model-Routing:** Bestehende [[architecture/model-routing.md]]-Seite behandelt Fallback-Chains. Fusion ist *orthogonal* — kein Fallback, sondern *paralleles Ensemble + Synthese*.
|
|||
|
|
- **LLM Behavior Persistence:** Persistenz im Einzelmodell → Ensemble mildert das (verschiedene Biases, verschiedene Halluzinationsmuster, Judge kann filtern).
|
|||
|
|
- **Open-Source-Debatte (Liesel Weppen Thread):** Fusions-Resultat zeigt, dass auch ohne "echte" Open Source ein Ensemble aus heterogenen (auch closed) Modellen Beyond-Frontier-Performance liefert. Pragmatischer Ansatz.
|
|||
|
|
|
|||
|
|
## 6/14 FAQ Update (Auszug)
|
|||
|
|
|
|||
|
|
- **Drop-in-Replacement für Fable 5?** Nein — nur für die getestete Klasse (Deep Research), Lang-Horizon-Tasks bleiben Fable-Territorium.
|
|||
|
|
- (weitere FAQ-Punkte im Original-Blog)
|
|||
|
|
|
|||
|
|
## Zitierte/verlinkte Ressourcen
|
|||
|
|
|
|||
|
|
- DRACO Paper: https://arxiv.org/abs/2602.11685
|
|||
|
|
- DRACO PDF: https://arxiv.org/pdf/2602.11685
|
|||
|
|
- DRACO HTML: https://arxiv.org/html/2602.11685v1
|
|||
|
|
- DRACO HF Dataset: https://hf.co/datasets/perplexity-ai/draco
|
|||
|
|
- Perplexity AI: https://www.perplexity.ai/
|
|||
|
|
- OpenRouter Fusion: https://openrouter.ai/fusion
|
|||
|
|
- OpenRouter API Docs: https://openrouter.ai/docs/guides/features/server-tools/fusion
|
|||
|
|
- OpenRouter Server Tools: https://openrouter.ai/docs/guides/features/server-tools
|
|||
|
|
- OpenRouter Web Search Tool: https://openrouter.ai/docs/guides/features/server-tools/web-search
|
|||
|
|
- OpenRouter Model Listing: https://openrouter.ai/models
|
|||
|
|
- Brian Thomas (OpenRouter): https://openrouter.ai/
|
|||
|
|
|
|||
|
|
## Erwähnte Modelle (mit Verlinkung)
|
|||
|
|
|
|||
|
|
- Claude Fable 5 — https://openrouter.ai/anthropic
|
|||
|
|
- Claude Opus 4.8 — https://openrouter.ai/anthropic
|
|||
|
|
- GPT-5.5 — https://openrouter.ai/openai
|
|||
|
|
- Gemini 3.1 Pro / Gemini 3 Flash — https://openrouter.ai/google
|
|||
|
|
- Kimi K2.6 (Moonshot) — https://openrouter.ai/moonshotai
|
|||
|
|
- DeepSeek V4 Pro — https://openrouter.ai/deepseek
|