Fahd Mirza Head-to-Head in Hermes Agent (14.06.2026, 14 Min, 2659 views, 89 likes). Beide Modelle bekommen denselben Prompt, loesen denselben Real-World-Task: Flask-App mit gepflanztem FIFA-Bug + Round-of-32- Bracket-Feature mit Anti-Group-Rematch-Regel. Test 1: Beide bestehen. Kimi schneller (~5 Min), innovativer (zusaetzliche Progression-Previews). GLM: 97 tool calls, laenger. Test 2 (Creative HTML, Siberian Wind): GLM staerker bei Animation + Terrain-Detail; Kimi bei Stats + Geographie. Konzept: Real-World-Showdown als Benchmark-Alternative zu statischen Tests (HumanEval, MBPP, SWE-bench). Agent-Framework isoliert die Modell-Variable sauber. Direkte Implikation fuer OpenClaw: - Sub-Task-spezifisches Coding-Routing (Kimi vs GLM je nach Task) - Ensemble-Kandidaten: Kimi K2.7 + GLM-5.2 in Coding-Panels - Real-World-Validierung statt nur Standard-Benchmarks fuer Production- Pfade - Hermes Agent als alternatives Agent-Framework zu AutoGen/CrewAI Aenderungen: - raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md (neu) - wiki/concepts/real-world-coding-showdown.md (neu) - wiki/tools/kimi-k2.7-code.md (Cross-References) - wiki/architecture/model-routing.md (neue Sektion Coding-Modelle) - wiki/index.md (neuer Concepts-Eintrag + Raw Sources-Eintrag) - wiki/log.md (Eintrag) Maximale Verlinkung gemaess AGENTS.md-Kardinalregel: - 12 externe Verweise auf Modelle (Kimi, GLM, Hermes, Ollama, Z.ai) - 9 Benchmark-/Methoden-Links (SWE-bench, HumanEval, MBPP, MCP, etc.) - 7 Fahd-Mirza-Links (YT, Blog, LinkedIn, Substack, Ko-Fi) - 5 Wiki-Cross-References (fusion, ai-agents, kimi-k2.7, model-routing, behavior-persistence)
49 lines
No EOL
2.1 KiB
Markdown
49 lines
No EOL
2.1 KiB
Markdown
# Model Routing
|
|
|
|
> Migriert aus ByteRover context-tree (April 2026)
|
|
|
|
## Two-Model-Pipeline
|
|
|
|
Für mehrstufige Aufgaben: **Grok 4.20 → Gemini 2.5 Flash**
|
|
|
|
| Phase | Modell | Stärke |
|
|
|-------|--------|--------|
|
|
| Ideation | Grok 4.20 | Kreative Exploration, Brainstorming, divergentes Denken |
|
|
| Synthesis | Gemini 2.5 Flash | Strukturierte Ausgabe, schnelle Synthese, konvergent |
|
|
|
|
Dieses Pattern wird sowohl im allgemeinen Routing als auch im Subconscious Agent (Hard Synthesis) verwendet, aber nie als Shared Primitive formalisiert.
|
|
|
|
## GPT-5.4 Konfiguration
|
|
|
|
- **Alias:** `GPT-5.4`
|
|
- **Route:** `openrouter/openai/gpt-5.4`
|
|
- **Context:** 200k Tokens
|
|
- **Output:** 32k Tokens
|
|
- **Reasoning/Thinking:** ❌ Deaktiviert (per Claire Vo-Empfehlung)
|
|
|
|
## Fallback-Chain (Hector Primary)
|
|
|
|
```
|
|
openrouter/auto
|
|
→ zai/glm-5-turbo
|
|
→ moonshot/moonshot-v1-auto
|
|
→ moonshot/kimi-k2.5
|
|
→ ollama/minimax-m2.7
|
|
```
|
|
|
|
## Verwandt: Parallele Ensembles (Fusion)
|
|
|
|
Sequentielles Routing (Fallback) ist nicht das einzige Pattern. OpenRouter bietet **Fusion** — parallele Model-Panels mit Judge-Synthese. Siehe [[llm-model-fusion-ensembles.md]] für Details und DRACO-Benchmark-Ergebnisse.
|
|
|
|
**Aktuell offene Frage:** Soll OpenClaws Quality-kritische Pfade (z.B. Subconscious Hard Synthesis) um eine parallele Pre-Routing-Schicht erweitert werden? Trade-off: höhere Latenz + Kosten vs. bessere Qualität durch Modell-Heterogenität.
|
|
|
|
## Coding-Modelle: Kimi K2.7 & GLM-5.2
|
|
|
|
Im Juni 2026 haben sich zwei starke Open-Source-Coding-Modelle aus China etabliert:
|
|
|
|
- **Kimi K2.7** (Moonshot AI) — siehe [[kimi-k2.7-code.md]]. MoE 1T/32B, 256K Kontext, schnell im Real-Coding-Showdown.
|
|
- **GLM-5.2** (Zhipu AI / Z.ai) — 744B Dense, 1M Kontext, MIT-Lizenz, stark bei kreativer Generation und Animation.
|
|
|
|
Head-to-Head-Vergleich in Hermes Agent: siehe [[real-world-coding-showdown.md]].
|
|
|
|
**Implikation für Routing:** In Sub-Task-Spezialisierung (Coding vs. Creative vs. Long-Context) sind beide als Sub-Routing-Knoten sinnvoll — nicht als Ersatz der Primary-Fallback-Chain, sondern als **spezialisierte Side-Branches** für Coding-Tasks. |