knowledge-base/wiki/architecture/model-routing.md
Hector Bot 2cb33da005 ingest(youtube): fahd-mirza-kimi-k2.7-vs-glm-5.2
Fahd Mirza Head-to-Head in Hermes Agent (14.06.2026, 14 Min, 2659 views,
89 likes). Beide Modelle bekommen denselben Prompt, loesen denselben
Real-World-Task: Flask-App mit gepflanztem FIFA-Bug + Round-of-32-
Bracket-Feature mit Anti-Group-Rematch-Regel.

Test 1: Beide bestehen. Kimi schneller (~5 Min), innovativer
(zusaetzliche Progression-Previews). GLM: 97 tool calls, laenger.
Test 2 (Creative HTML, Siberian Wind): GLM staerker bei Animation +
Terrain-Detail; Kimi bei Stats + Geographie.

Konzept: Real-World-Showdown als Benchmark-Alternative zu statischen
Tests (HumanEval, MBPP, SWE-bench). Agent-Framework isoliert die
Modell-Variable sauber.

Direkte Implikation fuer OpenClaw:
- Sub-Task-spezifisches Coding-Routing (Kimi vs GLM je nach Task)
- Ensemble-Kandidaten: Kimi K2.7 + GLM-5.2 in Coding-Panels
- Real-World-Validierung statt nur Standard-Benchmarks fuer Production-
  Pfade
- Hermes Agent als alternatives Agent-Framework zu AutoGen/CrewAI

Aenderungen:
- raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md (neu)
- wiki/concepts/real-world-coding-showdown.md (neu)
- wiki/tools/kimi-k2.7-code.md (Cross-References)
- wiki/architecture/model-routing.md (neue Sektion Coding-Modelle)
- wiki/index.md (neuer Concepts-Eintrag + Raw Sources-Eintrag)
- wiki/log.md (Eintrag)

Maximale Verlinkung gemaess AGENTS.md-Kardinalregel:
- 12 externe Verweise auf Modelle (Kimi, GLM, Hermes, Ollama, Z.ai)
- 9 Benchmark-/Methoden-Links (SWE-bench, HumanEval, MBPP, MCP, etc.)
- 7 Fahd-Mirza-Links (YT, Blog, LinkedIn, Substack, Ko-Fi)
- 5 Wiki-Cross-References (fusion, ai-agents, kimi-k2.7, model-routing, behavior-persistence)
2026-06-15 09:45:38 +02:00

2.1 KiB

Model Routing

Migriert aus ByteRover context-tree (April 2026)

Two-Model-Pipeline

Für mehrstufige Aufgaben: Grok 4.20 → Gemini 2.5 Flash

Phase Modell Stärke
Ideation Grok 4.20 Kreative Exploration, Brainstorming, divergentes Denken
Synthesis Gemini 2.5 Flash Strukturierte Ausgabe, schnelle Synthese, konvergent

Dieses Pattern wird sowohl im allgemeinen Routing als auch im Subconscious Agent (Hard Synthesis) verwendet, aber nie als Shared Primitive formalisiert.

GPT-5.4 Konfiguration

  • Alias: GPT-5.4
  • Route: openrouter/openai/gpt-5.4
  • Context: 200k Tokens
  • Output: 32k Tokens
  • Reasoning/Thinking: Deaktiviert (per Claire Vo-Empfehlung)

Fallback-Chain (Hector Primary)

openrouter/auto
  → zai/glm-5-turbo
    → moonshot/moonshot-v1-auto
      → moonshot/kimi-k2.5
        → ollama/minimax-m2.7

Verwandt: Parallele Ensembles (Fusion)

Sequentielles Routing (Fallback) ist nicht das einzige Pattern. OpenRouter bietet Fusion — parallele Model-Panels mit Judge-Synthese. Siehe llm-model-fusion-ensembles.md für Details und DRACO-Benchmark-Ergebnisse.

Aktuell offene Frage: Soll OpenClaws Quality-kritische Pfade (z.B. Subconscious Hard Synthesis) um eine parallele Pre-Routing-Schicht erweitert werden? Trade-off: höhere Latenz + Kosten vs. bessere Qualität durch Modell-Heterogenität.

Coding-Modelle: Kimi K2.7 & GLM-5.2

Im Juni 2026 haben sich zwei starke Open-Source-Coding-Modelle aus China etabliert:

  • Kimi K2.7 (Moonshot AI) — siehe kimi-k2.7-code.md. MoE 1T/32B, 256K Kontext, schnell im Real-Coding-Showdown.
  • GLM-5.2 (Zhipu AI / Z.ai) — 744B Dense, 1M Kontext, MIT-Lizenz, stark bei kreativer Generation und Animation.

Head-to-Head-Vergleich in Hermes Agent: siehe real-world-coding-showdown.md.

Implikation für Routing: In Sub-Task-Spezialisierung (Coding vs. Creative vs. Long-Context) sind beide als Sub-Routing-Knoten sinnvoll — nicht als Ersatz der Primary-Fallback-Chain, sondern als spezialisierte Side-Branches für Coding-Tasks.