> **Quelle des Konzepts:** OpenRouter Blog-Announcement "Surpassing Frontier Performance with Fusion" (12.06.2026, Brian Thomas). Validierung mit DRACO-Benchmark (Perplexity AI). Geteilt von [[../../people/k9ert-antigravity.md|@k9ert]] in OME-Gruppe "News & Infos (X/YT/Substack etc.)".
**Statt ein einzelnes, immer größeres Frontier-Modell zu skalieren → mehrere mittelgroße Modelle parallel antworten lassen, ein Judge-Modell synthetisiert die beste kombinierte Antwort.**
Drei empirische Befunde aus dem OpenRouter-Launch:
1.**Panels schlagen einzelne Modelle konsistent** — auch wenn das Panel nur aus Kopien desselben Modells besteht.
3.**Budget-Panels erreichen Frontier-Nähe zu halben Kosten** — Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro kommen auf 64.7% DRACO (vs. Fable 5: 65.3%) bei 50% der Kosten.
| **Fusion** | Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro | Opus 4.8 | **68.3%** |
| **Fusion** | Opus 4.8 + GPT-5.5 | Opus 4.8 | **67.6%** |
| **Fusion** | Opus 4.8 + Opus 4.8 (selbst-fusion) | Opus 4.8 | **65.5%** |
| Solo | Claude Fable 5* | — | 65.3% |
| **Fusion** | Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro | Opus 4.8 | **64.7%** |
| Solo | DeepSeek V4 Pro | — | 60.3% |
| Solo | GPT-5.5 | — | 60.0% |
| Solo | Claude Opus 4.8 | — | 58.8% |
| Solo | Kimi K2.6 | — | 53.7% |
| Solo | Gemini 3.1 Pro | — | 45.4% |
| Solo | Gemini 3 Flash | — | 43.1% |
*\* Fable 5 hat 7/100 Tasks wegen Content-Filter nicht abgeschlossen — Score basiert auf 93 Tasks. Andere Modelle: 100/100.*
## Kernerkenntnisse
### 1. Selbst-Fusion ist kein Trick — sie funktioniert
Opus 4.8 + Opus 4.8 (zwei identische Calls) **+6.7 Punkte** über Solo-Opus 4.8. Das beweist: **Ein signifikanter Anteil des Lifts kommt aus dem Synthesis-Schritt selbst**, nicht nur aus Modell-Diversität.
→ **Praktische Implikation:** Auch wer "nur ein Modell" hat, kann mit Self-Ensemble + guter Synthese-Prompting spürbar bessere Ergebnisse bekommen. Die Reasoning-Pfade sind verschieden genug.
### 2. Diversität > Architektur
Opus 4.8 + GPT-5.5 (67.6%) > Opus 4.8 + Opus 4.8 (65.5%) → +2.1 Punkte durch Cross-Vendor-Diversität.
→ **Praktische Implikation:** Wenn Budget knapp, investiere in 2-3 *unterschiedliche* Modelle, nicht in mehrere Kopien desselben Modells.
### 3. Budget-Panels sind competitive
Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro (alle "klein") erreichen 64.7% bei halben Kosten vs. Fable 5 (65.3%).
→ **Praktische Implikation:** Für Deep-Research-Workflows muss es nicht immer das Frontier-Modell sein. Ein clever kuratiertes Budget-Panel + guter Synthesizer reicht.
## Methodische Lessons für eigene Evals
### Anti-Contamination: Excluded Domains
OpenRouter entdeckte, dass die Panel-Modelle über Web-Search das **DRACO-Grading-Rubric** fanden und damit (zufällig) ihre Bewertung optimierten. Lösung: [Server-Tools](https://openrouter.ai/docs/guides/features/server-tools) akzeptieren `excluded_domains` und `blocked_domains` in den Tool-Definitionen.
→ **Für eigene Evals zwingend:** Wenn du ein öffentliches Benchmark nutzt, schließe die Benchmark-Quelle(n) vom Web-Search aus. Sonst misst du Web-Findability + Antwortqualität, nicht Antwortqualität.
### Judge-Modell-Wahl
OpenRouter nutzt **Gemini 3.1 Pro Preview** als Judge statt Gemini 3 Pro (DRACO-Default). Begründung: gleiche Human-Alignment-Eigenschaften + bessere Diskrimination. Cross-Validation mit Claude Sonnet 4.6.
→ **Für eigene Evals:** Judge-Modell ist eine kritische Wahl. Dokumentiere, welchen Judge du nutzt — Scores sind nicht benchmark-übergreifend vergleichbar.
**Gegen das Mangelnarrativ** ("Wir brauchen immer größere Modelle, sonst kommen wir nicht weiter"):
- Budget-Panels erreichen Frontier-Nähe. Innovation ist nicht nur Skalierung.
- Self-Fusion zeigt: Die Synthesis-Schicht ist *mindestens so wichtig* wie das Modell.
- Die OpenRouter-Architektur ist *server-side* — die Modell-Heterogenität ist eine *Infrastrukturfrage*, nicht eine User-Komplexität.
**Für Handlungsfähigkeit:**
- Wer heute schon mit LLMs arbeitet, kann Fusion direkt testen: [openrouter.ai/fusion](https://openrouter.ai/fusion)
- Wer eigene Eval-Setups baut, sollte Excluded-Domains von Anfang an einplanen
- Wer ein Sub-Agent-Setup hat ([[architecture/agent-orchestration.md]]), kann das Synthesis-Pattern aus Fusion übertragen — Multi-Agent statt Multi-Model
**Realismus:**
- Fusion ist *nicht* ein Drop-in-Replacement für Fable 5 (siehe FAQ): nur für Deep-Research-Klasse getestet, Lang-Horizon-Tasks bleiben Fable-Territorium
- Kosten und Latenz steigen mit Panel-Größe. Architektur-Entscheidung: *wann* lohnt sich der Aufwand?
- Judge-Modell ist Single Point of Failure für die finale Antwort-Qualität
- [[concepts/llm/llm-behavior-persistence.md]] — Persistenz im *einzelnen* Modell (Bias, Backdoors, Unlearning-Grenzen). Fusion mildert das, indem Heterogenität eingebaut wird.
- [[concepts/agents/ai-agents-2026.md]] — Agent-Orchestrierung. Multi-Model-Fusion ist ein Spezialfall von Multi-Agent-Reasoning.
- [[concepts/policy/ai-regulation-2026.md]] — Regulatorischer Kontext: in einer Welt, in der Frontier-Modelle Export-Kontrollen unterliegen ([Mythos 5 / Fable 5](concepts/policy/ai-regulation-2026.md)), wird Ensemble aus nicht-frontier Modellen attraktiver.
1.**Self-Fusion in OpenClaw-Pipelines?** Hector's Primary-Fallback-Chain ([[architecture/model-routing.md]]) ist sequentiell. Wäre eine parallele Pre-Routing-Schicht mit 2-3 Modellen + Synthese sinnvoll für Quality-kritische Tasks?
2.**Judge-Modell für interne Subconscious-Outputs?** Subconscious-Agent-Evidence-Runner macht Hard Synthesis. Lohnt der Wechsel von sequentiell auf Ensemble?
3.**Excluded-Domains in OpenClaw?** Wenn Subconscious Agent öffentliche Quellen crawled, sollte er die eigene Knowledge-Base ausschließen, um Self-Referenz-Loops zu vermeiden?