knowledge-base/wiki/concepts/llm/llm-model-fusion-ensembles.md
Hector 0e02fdbd59 feat: people-pages for all TODO institutions markers
- Created 27 new people-pages for all TODO-marked persons
- Replaced all TODO: people-page markers with wiki-links in institutions
- Cross-referenced back to institutions from each people-page
- 0 TODO markers remaining

New people-pages:
  shayne-coplan, jim-zemlin, wang-changhu, yang-bingyang, demis-hassabis,
  clement-delangue, thomas-kurian, fei-fei-li, christopher-manning,
  sam-altman, ilya-sutskever, moritz-kaminski, elon-musk, nicolas-burtey,
  elizabeth-stark, olaoluwa-osuntokun, jan-leike, oren-etzioni,
  ali-farhadi, jaime-sevilla, max-tegmark, daniela-rus, jared-kaplan,
  alex-atallah, andrew-moore, tuomas-sandholm, mitchell-baker
2026-06-25 21:44:25 +02:00

212 lines
12 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-06-15
updated: 2026-06-15
sources: [blog/2026-06-12_openrouter-fusion-beats-frontier.md]
tags: [concept, openrouter, fusion, model-ensemble, draco-benchmark, llm-systems, routing, deep-research]
---
# Model Fusion & Panel Ensembles — Beyond-Frontier mit Billig-Modellen
> **Quelle des Konzepts:** OpenRouter Blog-Announcement "Surpassing Frontier Performance with Fusion" (12.06.2026, Brian Thomas). Validierung mit DRACO-Benchmark (Perplexity AI). Geteilt von [[../../people/k9ert-antigravity.md|@k9ert]] in OME-Gruppe "News & Infos (X/YT/Substack etc.)".
## Kernidee
**Statt ein einzelnes, immer größeres Frontier-Modell zu skalieren → mehrere mittelgroße Modelle parallel antworten lassen, ein Judge-Modell synthetisiert die beste kombinierte Antwort.**
Drei empirische Befunde aus dem OpenRouter-Launch:
1. **Panels schlagen einzelne Modelle konsistent** — auch wenn das Panel nur aus Kopien desselben Modells besteht.
2. **Beyond-Frontier-Performance ist erreichbar** — Fable 5 + GPT-5.5 schlägt Fable 5 alleine.
3. **Budget-Panels erreichen Frontier-Nähe zu halben Kosten** — Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro kommen auf 64.7% DRACO (vs. Fable 5: 65.3%) bei 50% der Kosten.
## Architektur
```
User Prompt
┌─────────────┐
│ Fusion │ (server-side, single API call)
│ Pipeline │
└─────────────┘
↓ (parallele Calls)
┌─────────┬─────────┬─────────┐
│ Panel │ Panel │ Panel │ (jedes mit web_search + web_fetch,
│ Model 1 │ Model 2 │ Model N │ exkl. excluded_domains)
└─────────┴─────────┴─────────┘
↓ (alle Antworten)
┌──────────────────┐
│ Judge / │ (strukturiert: Konsens, Widersprüche,
│ Synthesizer │ partielle Abdeckung, einzigartige
│ Model │ Insights, blinde Flecken)
└──────────────────┘
Final Answer
```
**API-Call (Standard):**
```json
{
"model": "openrouter/fusion",
"messages": [{"role": "user", "content": "..."}]
}
```
**API-Call (Custom Panel):**
```json
{
"model": "openrouter/fusion",
"messages": [{"role": "user", "content": "..."}],
"plugins": [{
"id": "fusion",
"model": "google/gemini-3-flash-preview",
"analysis_models": [
"google/gemini-3-flash-preview",
"moonshotai/kimi-k2.6",
"deepseek/deepseek-v4-pro"
]
}]
}
```
Siehe: [OpenRouter Fusion API-Docs](https://openrouter.ai/docs/guides/features/server-tools/fusion)
## DRACO-Benchmark — Was wird gemessen?
**DRACO** = Deep Research Accuracy, Completeness, and Objectivity
- **Autor:** Perplexity AI ([J.Z., H.Z. et al.](https://arxiv.org/abs/2602.11685))
- **Erschienen:** 12.02.2026, arXiv:2602.11685
- **Datensatz:** [huggingface.co/datasets/perplexity-ai/draco](https://hf.co/datasets/perplexity-ai/draco)
- **100 Deep-Research-Tasks** in 10 Domänen: Academic Research, Finance, Law, Medicine, Technology, UX Design, General Knowledge, Needle-in-Haystack Retrieval, Personalized Assistance, Product Comparison
- **Pro Task ~39 gewichtete Kriterien** in 4 Dimensionen:
- **Factual Accuracy** (~20 Kriterien) — verifizierbare Fakten
- **Breadth & Depth** (~9 Kriterien) — Trade-off-Analyse, umsetzbare Empfehlungen
- **Presentation Quality** (~6 Kriterien) — Terminologie, Formatierung, Lesbarkeit
- **Citation Quality** (~5 Kriterien) — Primärquellen mit funktionierenden Referenzen
- **Negative Gewichtung** für gefährliche Fehler (z.B. medizinische Falschberatung) verhindert Score-Gaming durch Länge/Confianza
- **Judge:** 3× unabhängige Bewertung pro Kriterium, Mittelwert berichtet (0-100)
**Limitationen** (laut Paper): text-only, English-only, statisches Task-Set; absolute Scores hängen vom Judge-Modell ab (10-25 Punkte Verschiebung möglich), relative Rankings aber stabil.
## Die Ergebnisse (Tabelle)
| Typ | Model(s) | Synthesizer | Score |
|---|---|---|---|
| **Fusion** | Fable 5 + GPT-5.5 | Opus 4.8 | **69.0%** |
| **Fusion** | Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro | Opus 4.8 | **68.3%** |
| **Fusion** | Opus 4.8 + GPT-5.5 | Opus 4.8 | **67.6%** |
| **Fusion** | Opus 4.8 + Opus 4.8 (selbst-fusion) | Opus 4.8 | **65.5%** |
| Solo | Claude Fable 5* | — | 65.3% |
| **Fusion** | Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro | Opus 4.8 | **64.7%** |
| Solo | DeepSeek V4 Pro | — | 60.3% |
| Solo | GPT-5.5 | — | 60.0% |
| Solo | Claude Opus 4.8 | — | 58.8% |
| Solo | Kimi K2.6 | — | 53.7% |
| Solo | Gemini 3.1 Pro | — | 45.4% |
| Solo | Gemini 3 Flash | — | 43.1% |
*\* Fable 5 hat 7/100 Tasks wegen Content-Filter nicht abgeschlossen — Score basiert auf 93 Tasks. Andere Modelle: 100/100.*
## Kernerkenntnisse
### 1. Selbst-Fusion ist kein Trick — sie funktioniert
Opus 4.8 + Opus 4.8 (zwei identische Calls) **+6.7 Punkte** über Solo-Opus 4.8. Das beweist: **Ein signifikanter Anteil des Lifts kommt aus dem Synthesis-Schritt selbst**, nicht nur aus Modell-Diversität.
**Praktische Implikation:** Auch wer "nur ein Modell" hat, kann mit Self-Ensemble + guter Synthese-Prompting spürbar bessere Ergebnisse bekommen. Die Reasoning-Pfade sind verschieden genug.
### 2. Diversität > Architektur
Opus 4.8 + GPT-5.5 (67.6%) > Opus 4.8 + Opus 4.8 (65.5%) → +2.1 Punkte durch Cross-Vendor-Diversität.
**Praktische Implikation:** Wenn Budget knapp, investiere in 2-3 *unterschiedliche* Modelle, nicht in mehrere Kopien desselben Modells.
### 3. Budget-Panels sind competitive
Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro (alle "klein") erreichen 64.7% bei halben Kosten vs. Fable 5 (65.3%).
**Praktische Implikation:** Für Deep-Research-Workflows muss es nicht immer das Frontier-Modell sein. Ein clever kuratiertes Budget-Panel + guter Synthesizer reicht.
## Methodische Lessons für eigene Evals
### Anti-Contamination: Excluded Domains
OpenRouter entdeckte, dass die Panel-Modelle über Web-Search das **DRACO-Grading-Rubric** fanden und damit (zufällig) ihre Bewertung optimierten. Lösung: [Server-Tools](https://openrouter.ai/docs/guides/features/server-tools) akzeptieren `excluded_domains` und `blocked_domains` in den Tool-Definitionen.
**Für eigene Evals zwingend:** Wenn du ein öffentliches Benchmark nutzt, schließe die Benchmark-Quelle(n) vom Web-Search aus. Sonst misst du Web-Findability + Antwortqualität, nicht Antwortqualität.
### Judge-Modell-Wahl
OpenRouter nutzt **Gemini 3.1 Pro Preview** als Judge statt Gemini 3 Pro (DRACO-Default). Begründung: gleiche Human-Alignment-Eigenschaften + bessere Diskrimination. Cross-Validation mit Claude Sonnet 4.6.
**Für eigene Evals:** Judge-Modell ist eine kritische Wahl. Dokumentiere, welchen Judge du nutzt — Scores sind nicht benchmark-übergreifend vergleichbar.
## Pro-Leben-Perspektive
Gemäß [[../directives/pro-leben-directive.md]]:
**Gegen das Mangelnarrativ** ("Wir brauchen immer größere Modelle, sonst kommen wir nicht weiter"):
- Budget-Panels erreichen Frontier-Nähe. Innovation ist nicht nur Skalierung.
- Self-Fusion zeigt: Die Synthesis-Schicht ist *mindestens so wichtig* wie das Modell.
- Die OpenRouter-Architektur ist *server-side* — die Modell-Heterogenität ist eine *Infrastrukturfrage*, nicht eine User-Komplexität.
**Für Handlungsfähigkeit:**
- Wer heute schon mit LLMs arbeitet, kann Fusion direkt testen: [openrouter.ai/fusion](https://openrouter.ai/fusion)
- Wer eigene Eval-Setups baut, sollte Excluded-Domains von Anfang an einplanen
- Wer ein Sub-Agent-Setup hat ([[../../architecture/agent-orchestration.md]]), kann das Synthesis-Pattern aus Fusion übertragen — Multi-Agent statt Multi-Model
**Realismus:**
- Fusion ist *nicht* ein Drop-in-Replacement für Fable 5 (siehe FAQ): nur für Deep-Research-Klasse getestet, Lang-Horizon-Tasks bleiben Fable-Territorium
- Kosten und Latenz steigen mit Panel-Größe. Architektur-Entscheidung: *wann* lohnt sich der Aufwand?
- Judge-Modell ist Single Point of Failure für die finale Antwort-Qualität
## Verwandte Wiki-Seiten
- [[llm-behavior-persistence.md]] — Persistenz im *einzelnen* Modell (Bias, Backdoors, Unlearning-Grenzen). Fusion mildert das, indem Heterogenität eingebaut wird.
- [[../agents/ai-agents-2026.md]] — Agent-Orchestrierung. Multi-Model-Fusion ist ein Spezialfall von Multi-Agent-Reasoning.
- [[../policy/ai-regulation-2026.md]] — Regulatorischer Kontext: in einer Welt, in der Frontier-Modelle Export-Kontrollen unterliegen ([Mythos 5 / Fable 5](concepts/policy/ai-regulation-2026.md)), wird Ensemble aus nicht-frontier Modellen attraktiver.
- [[../../architecture/model-routing.md]] — Bestehendes Pattern: sequentielle Two-Model-Pipeline (Grok → Gemini). Fusion ist *parallel*, nicht sequentiell — komplementär, nicht ersetzend.
- [[../../tools/anthropic-claude.md]] — Fable 5 / Opus 4.8 als eines der Top-Modelle in Fusion-Setups.
- [[llm-knowledge-base.md]] — Karpathy-Pattern: kuratierte Strukturen schlagen reine Inference.
## Externe Ressourcen
### OpenRouter
- [OpenRouter Fusion Announcement](https://openrouter.ai/blog/announcements/fusion-beats-frontier/)
- [OpenRouter Fusion Chatroom](https://openrouter.ai/fusion)
- [OpenRouter Fusion API Docs](https://openrouter.ai/docs/guides/features/server-tools/fusion)
- [OpenRouter Server Tools (Web Search, Web Fetch, Excluded Domains)](https://openrouter.ai/docs/guides/features/server-tools)
- [OpenRouter Web Search Tool Definition](https://openrouter.ai/docs/guides/features/server-tools/web-search)
- [OpenRouter Model Listing](https://openrouter.ai/models)
- [OpenRouter Pricing](https://openrouter.ai/pricing)
- [Brian Thomas (Autor des Posts)](https://openrouter.ai/)
### DRACO Benchmark
- [DRACO arXiv Abstract](https://arxiv.org/abs/2602.11685)
- [DRACO PDF](https://arxiv.org/pdf/2602.11685)
- [DRACO HTML v1](https://arxiv.org/html/2602.11685v1)
- [DRACO HuggingFace Dataset](https://hf.co/datasets/perplexity-ai/draco)
- [Perplexity AI (DRACO-Autor)](https://www.perplexity.ai/)
### Verwandte Konzepte (Ensemble / Mixture-of-Experts / Routing)
- [Mixture of Experts (Wikipedia)](https://en.wikipedia.org/wiki/Mixture_of_experts)
- [Ensemble Learning (Wikipedia)](https://en.wikipedia.org/wiki/Ensemble_learning)
- [Self-Consistency (Wang et al., 2022)](https://arxiv.org/abs/2203.11171) — Chain-of-Thought Sampling + Majority Vote, ein Vorläufer-Pattern
- [More Agents Is All You Need (LLM-Ensemble-Studie, Tsinghua 2023)](https://arxiv.org/abs/2310.11560)
- [Routing in Mixture-of-Experts: Survey](https://arxiv.org/abs/2209.10359)
- [Constitutional AI (Anthropic)](https://www.anthropic.com/news/claudes-constitution) — verwandt: Multi-Perspektive via Critique-Schritt
### Verwandte Tools (Ensemble-Patterns anderswo)
- [Microsoft AutoGen](https://github.com/microsoft/autogen) — Multi-Agent Orchestration
- [CrewAI](https://github.com/joaomdmoura/crewAI) — Multi-Agent-Frameworks
- [LangGraph](https://github.com/langchain-ai/langgraph) — Graph-basierte Agent-Orchestrierung
- [DSPy](https://github.com/stanfordnlp/dspy) — Compile-Time-Prompt-Optimization, Ensemble-Patterns
## Open Questions / Lessons für OpenClaw
1. **Self-Fusion in OpenClaw-Pipelines?** Hector's Primary-Fallback-Chain ([[../../architecture/model-routing.md]]) ist sequentiell. Wäre eine parallele Pre-Routing-Schicht mit 2-3 Modellen + Synthese sinnvoll für Quality-kritische Tasks?
2. **Judge-Modell für interne Subconscious-Outputs?** Subconscious-Agent-Evidence-Runner macht Hard Synthesis. Lohnt der Wechsel von sequentiell auf Ensemble?
3. **Excluded-Domains in OpenClaw?** Wenn Subconscious Agent öffentliche Quellen crawled, sollte er die eigene Knowledge-Base ausschließen, um Self-Referenz-Loops zu vermeiden?