knowledge-base/wiki/concepts/llm/llm-model-fusion-ensembles.md
Hector 9cc4989fc1 push: all untracked institutions + modified wiki pages
- 23 new institutions pages (alby, anthropic, blink-wallet, carnegie-mellon, deepmind, epoch-ai, fincept, google-cloud, hugging-face, lightning-labs, linux-foundation, mit, moonshot-ai, mozilla-foundation, openai, openai-superalignment, openrouter, polymarket, stanford-ai-lab, tu-muenchen, xai, z-ai)
- institutions-ingest-runner.md script
- modified concepts (agi, hardware, llm) + tools pages
- wiki-lint-report update
2026-06-25 21:08:50 +02:00

12 KiB
Raw Blame History

created updated sources tags
2026-06-15 2026-06-15
blog/2026-06-12_openrouter-fusion-beats-frontier.md
concept
openrouter
fusion
model-ensemble
draco-benchmark
llm-systems
routing
deep-research

Model Fusion & Panel Ensembles — Beyond-Frontier mit Billig-Modellen

Quelle des Konzepts: OpenRouter Blog-Announcement "Surpassing Frontier Performance with Fusion" (12.06.2026, Brian Thomas). Validierung mit DRACO-Benchmark (Perplexity AI). Geteilt von ../../people/k9ert-antigravity.md in OME-Gruppe "News & Infos (X/YT/Substack etc.)".

Kernidee

Statt ein einzelnes, immer größeres Frontier-Modell zu skalieren → mehrere mittelgroße Modelle parallel antworten lassen, ein Judge-Modell synthetisiert die beste kombinierte Antwort.

Drei empirische Befunde aus dem OpenRouter-Launch:

  1. Panels schlagen einzelne Modelle konsistent — auch wenn das Panel nur aus Kopien desselben Modells besteht.
  2. Beyond-Frontier-Performance ist erreichbar — Fable 5 + GPT-5.5 schlägt Fable 5 alleine.
  3. Budget-Panels erreichen Frontier-Nähe zu halben Kosten — Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro kommen auf 64.7% DRACO (vs. Fable 5: 65.3%) bei 50% der Kosten.

Architektur

User Prompt
    ↓
┌─────────────┐
│  Fusion     │  (server-side, single API call)
│  Pipeline   │
└─────────────┘
    ↓ (parallele Calls)
┌─────────┬─────────┬─────────┐
│ Panel   │ Panel   │ Panel   │  (jedes mit web_search + web_fetch,
│ Model 1 │ Model 2 │ Model N │   exkl. excluded_domains)
└─────────┴─────────┴─────────┘
    ↓ (alle Antworten)
┌──────────────────┐
│ Judge /          │  (strukturiert: Konsens, Widersprüche,
│ Synthesizer      │   partielle Abdeckung, einzigartige
│ Model            │   Insights, blinde Flecken)
└──────────────────┘
    ↓
Final Answer

API-Call (Standard):

{
  "model": "openrouter/fusion",
  "messages": [{"role": "user", "content": "..."}]
}

API-Call (Custom Panel):

{
  "model": "openrouter/fusion",
  "messages": [{"role": "user", "content": "..."}],
  "plugins": [{
    "id": "fusion",
    "model": "google/gemini-3-flash-preview",
    "analysis_models": [
      "google/gemini-3-flash-preview",
      "moonshotai/kimi-k2.6",
      "deepseek/deepseek-v4-pro"
    ]
  }]
}

Siehe: OpenRouter Fusion API-Docs

DRACO-Benchmark — Was wird gemessen?

DRACO = Deep Research Accuracy, Completeness, and Objectivity

  • Autor: Perplexity AI (J.Z., H.Z. et al.)
  • Erschienen: 12.02.2026, arXiv:2602.11685
  • Datensatz: huggingface.co/datasets/perplexity-ai/draco
  • 100 Deep-Research-Tasks in 10 Domänen: Academic Research, Finance, Law, Medicine, Technology, UX Design, General Knowledge, Needle-in-Haystack Retrieval, Personalized Assistance, Product Comparison
  • Pro Task ~39 gewichtete Kriterien in 4 Dimensionen:
    • Factual Accuracy (~20 Kriterien) — verifizierbare Fakten
    • Breadth & Depth (~9 Kriterien) — Trade-off-Analyse, umsetzbare Empfehlungen
    • Presentation Quality (~6 Kriterien) — Terminologie, Formatierung, Lesbarkeit
    • Citation Quality (~5 Kriterien) — Primärquellen mit funktionierenden Referenzen
  • Negative Gewichtung für gefährliche Fehler (z.B. medizinische Falschberatung) verhindert Score-Gaming durch Länge/Confianza
  • Judge: 3× unabhängige Bewertung pro Kriterium, Mittelwert berichtet (0-100)

Limitationen (laut Paper): text-only, English-only, statisches Task-Set; absolute Scores hängen vom Judge-Modell ab (10-25 Punkte Verschiebung möglich), relative Rankings aber stabil.

Die Ergebnisse (Tabelle)

Typ Model(s) Synthesizer Score
Fusion Fable 5 + GPT-5.5 Opus 4.8 69.0%
Fusion Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro Opus 4.8 68.3%
Fusion Opus 4.8 + GPT-5.5 Opus 4.8 67.6%
Fusion Opus 4.8 + Opus 4.8 (selbst-fusion) Opus 4.8 65.5%
Solo Claude Fable 5* 65.3%
Fusion Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro Opus 4.8 64.7%
Solo DeepSeek V4 Pro 60.3%
Solo GPT-5.5 60.0%
Solo Claude Opus 4.8 58.8%
Solo Kimi K2.6 53.7%
Solo Gemini 3.1 Pro 45.4%
Solo Gemini 3 Flash 43.1%

* Fable 5 hat 7/100 Tasks wegen Content-Filter nicht abgeschlossen — Score basiert auf 93 Tasks. Andere Modelle: 100/100.

Kernerkenntnisse

1. Selbst-Fusion ist kein Trick — sie funktioniert

Opus 4.8 + Opus 4.8 (zwei identische Calls) +6.7 Punkte über Solo-Opus 4.8. Das beweist: Ein signifikanter Anteil des Lifts kommt aus dem Synthesis-Schritt selbst, nicht nur aus Modell-Diversität.

Praktische Implikation: Auch wer "nur ein Modell" hat, kann mit Self-Ensemble + guter Synthese-Prompting spürbar bessere Ergebnisse bekommen. Die Reasoning-Pfade sind verschieden genug.

2. Diversität > Architektur

Opus 4.8 + GPT-5.5 (67.6%) > Opus 4.8 + Opus 4.8 (65.5%) → +2.1 Punkte durch Cross-Vendor-Diversität.

Praktische Implikation: Wenn Budget knapp, investiere in 2-3 unterschiedliche Modelle, nicht in mehrere Kopien desselben Modells.

3. Budget-Panels sind competitive

Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro (alle "klein") erreichen 64.7% bei halben Kosten vs. Fable 5 (65.3%).

Praktische Implikation: Für Deep-Research-Workflows muss es nicht immer das Frontier-Modell sein. Ein clever kuratiertes Budget-Panel + guter Synthesizer reicht.

Methodische Lessons für eigene Evals

Anti-Contamination: Excluded Domains

OpenRouter entdeckte, dass die Panel-Modelle über Web-Search das DRACO-Grading-Rubric fanden und damit (zufällig) ihre Bewertung optimierten. Lösung: Server-Tools akzeptieren excluded_domains und blocked_domains in den Tool-Definitionen.

Für eigene Evals zwingend: Wenn du ein öffentliches Benchmark nutzt, schließe die Benchmark-Quelle(n) vom Web-Search aus. Sonst misst du Web-Findability + Antwortqualität, nicht Antwortqualität.

Judge-Modell-Wahl

OpenRouter nutzt Gemini 3.1 Pro Preview als Judge statt Gemini 3 Pro (DRACO-Default). Begründung: gleiche Human-Alignment-Eigenschaften + bessere Diskrimination. Cross-Validation mit Claude Sonnet 4.6.

Für eigene Evals: Judge-Modell ist eine kritische Wahl. Dokumentiere, welchen Judge du nutzt — Scores sind nicht benchmark-übergreifend vergleichbar.

Pro-Leben-Perspektive

Gemäß concepts/directives/pro-leben-directive.md:

Gegen das Mangelnarrativ ("Wir brauchen immer größere Modelle, sonst kommen wir nicht weiter"):

  • Budget-Panels erreichen Frontier-Nähe. Innovation ist nicht nur Skalierung.
  • Self-Fusion zeigt: Die Synthesis-Schicht ist mindestens so wichtig wie das Modell.
  • Die OpenRouter-Architektur ist server-side — die Modell-Heterogenität ist eine Infrastrukturfrage, nicht eine User-Komplexität.

Für Handlungsfähigkeit:

  • Wer heute schon mit LLMs arbeitet, kann Fusion direkt testen: openrouter.ai/fusion
  • Wer eigene Eval-Setups baut, sollte Excluded-Domains von Anfang an einplanen
  • Wer ein Sub-Agent-Setup hat (architecture/agent-orchestration.md), kann das Synthesis-Pattern aus Fusion übertragen — Multi-Agent statt Multi-Model

Realismus:

  • Fusion ist nicht ein Drop-in-Replacement für Fable 5 (siehe FAQ): nur für Deep-Research-Klasse getestet, Lang-Horizon-Tasks bleiben Fable-Territorium
  • Kosten und Latenz steigen mit Panel-Größe. Architektur-Entscheidung: wann lohnt sich der Aufwand?
  • Judge-Modell ist Single Point of Failure für die finale Antwort-Qualität

Verwandte Wiki-Seiten

Externe Ressourcen

OpenRouter

DRACO Benchmark

Verwandte Konzepte (Ensemble / Mixture-of-Experts / Routing)

Verwandte Tools (Ensemble-Patterns anderswo)

  • Microsoft AutoGen — Multi-Agent Orchestration
  • CrewAI — Multi-Agent-Frameworks
  • LangGraph — Graph-basierte Agent-Orchestrierung
  • DSPy — Compile-Time-Prompt-Optimization, Ensemble-Patterns

Open Questions / Lessons für OpenClaw

  1. Self-Fusion in OpenClaw-Pipelines? Hector's Primary-Fallback-Chain (architecture/model-routing.md) ist sequentiell. Wäre eine parallele Pre-Routing-Schicht mit 2-3 Modellen + Synthese sinnvoll für Quality-kritische Tasks?
  2. Judge-Modell für interne Subconscious-Outputs? Subconscious-Agent-Evidence-Runner macht Hard Synthesis. Lohnt der Wechsel von sequentiell auf Ensemble?
  3. Excluded-Domains in OpenClaw? Wenn Subconscious Agent öffentliche Quellen crawled, sollte er die eigene Knowledge-Base ausschließen, um Self-Referenz-Loops zu vermeiden?