knowledge-base/wiki/architecture/model-routing.md
Hector Bot 2223ee74f4 ingest(youtube): ichbinfabian-glm-5.2
GLM 5.2 Deep-Dive (IAmFabian, 14.06.2026, 13:15 Min, 212 views,
16 Likes). Deutscher Reviewer testet live: Flappy Bird (1:20, 481
Zeilen HTML, laeuft) und Newton-Pendel mit echter Physik (9:41, davon
8:27 nur Thinking).

Kernkonzepte:
- Chinas Frontier-Coding-Modelle 2026: Kimi K2.7 + GLM 5.2, beide
  Frontier-Niveau bei 10x niedrigeren Preisen
- GLM 5.2: 1M Kontext, MIT-Lizenz (Open Weights 'naechste Woche'),
  laut AI Code King Benchmarks nur 6% unter Opus 4.8
- Z.ai Coding Plan (18 USD/Monat Light) als exklusive Distribution
  - Light-Plan: 2-3x Kontingent-Mehrverbrauch in Stosszeiten
  - OpenRouter-Eintrag 'in den naechsten Tagen' erwartet
- Coding Helper (npx @z_ai/coding-helper) bindet GLM 5.2 in Claude
  Code, OpenCode, Cline, Kilo Code, Crush, Factory Droid ein

KRITISCHER IMPLIKAT FUER OPENCLAW:
- Z.ai Coding Plan listet 'Clawdbot/OpenClaw' naamentlich als
  unterstuetztes Environment - direkte Integration bereits vorbereitet
- Drei Setup-Optionen:
  1. Z.ai Coding Plan sofort (18 USD/Monat, Light)
  2. Self-Hosting nach Open Weights (MIT, HuggingFace)
  3. Warten auf OpenRouter (Tage)

Aenderungen:
- raw/youtube/2026-06-15_ichbinfabian-glm-5.2-coding-modell.md (neu)
- wiki/concepts/glm-5.2-zai-coding-model.md (neu)
- wiki/architecture/model-routing.md (neue Sektion GLM 5.2 +
  Routing-Position + 3 Setup-Optionen)
- wiki/index.md (neuer Concepts-Eintrag + Raw Sources-Eintrag)
- wiki/log.md (Eintrag)

Maximale Verlinkung: 12 Z.ai/HuggingFace/NPM-Links, 10 Tool-Links
(OpenCode, Claude Code, Cline, Kilo Code, Crush, Droid),
8 Wiki-Cross-References, 4 Konkurrenz-Links (Kimi, OpenRouter,
Open LLM Leaderboard, Anthropic).
2026-06-15 09:50:23 +02:00

72 lines
No EOL
3.4 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# Model Routing
> Migriert aus ByteRover context-tree (April 2026)
## Two-Model-Pipeline
Für mehrstufige Aufgaben: **Grok 4.20 → Gemini 2.5 Flash**
| Phase | Modell | Stärke |
|-------|--------|--------|
| Ideation | Grok 4.20 | Kreative Exploration, Brainstorming, divergentes Denken |
| Synthesis | Gemini 2.5 Flash | Strukturierte Ausgabe, schnelle Synthese, konvergent |
Dieses Pattern wird sowohl im allgemeinen Routing als auch im Subconscious Agent (Hard Synthesis) verwendet, aber nie als Shared Primitive formalisiert.
## GPT-5.4 Konfiguration
- **Alias:** `GPT-5.4`
- **Route:** `openrouter/openai/gpt-5.4`
- **Context:** 200k Tokens
- **Output:** 32k Tokens
- **Reasoning/Thinking:** ❌ Deaktiviert (per Claire Vo-Empfehlung)
## Fallback-Chain (Hector Primary)
```
openrouter/auto
→ zai/glm-5-turbo
→ moonshot/moonshot-v1-auto
→ moonshot/kimi-k2.5
→ ollama/minimax-m2.7
```
## Verwandt: Parallele Ensembles (Fusion)
Sequentielles Routing (Fallback) ist nicht das einzige Pattern. OpenRouter bietet **Fusion** — parallele Model-Panels mit Judge-Synthese. Siehe [[llm-model-fusion-ensembles.md]] für Details und DRACO-Benchmark-Ergebnisse.
**Aktuell offene Frage:** Soll OpenClaws Quality-kritische Pfade (z.B. Subconscious Hard Synthesis) um eine parallele Pre-Routing-Schicht erweitert werden? Trade-off: höhere Latenz + Kosten vs. bessere Qualität durch Modell-Heterogenität.
## Coding-Modelle: Kimi K2.7 & GLM-5.2
Im Juni 2026 haben sich zwei starke Open-Source-Coding-Modelle aus China etabliert:
- **Kimi K2.7** (Moonshot AI) — siehe [[kimi-k2.7-code.md]]. MoE 1T/32B, 256K Kontext, schnell im Real-Coding-Showdown.
- **GLM-5.2** (Zhipu AI / Z.ai) — 744B Dense, 1M Kontext, MIT-Lizenz, stark bei kreativer Generation und Animation.
Head-to-Head-Vergleich in Hermes Agent: siehe [[real-world-coding-showdown.md]].
**Implikation für Routing:** In Sub-Task-Spezialisierung (Coding vs. Creative vs. Long-Context) sind beide als Sub-Routing-Knoten sinnvoll — nicht als Ersatz der Primary-Fallback-Chain, sondern als **spezialisierte Side-Branches** für Coding-Tasks.
### GLM 5.2 (Z.ai) — 1M Kontext, MIT-Lizenz, 10x günstiger
Zusätzlich zu Kimi K2.7 ist **GLM 5.2** (Release 13.06.2026) ein zweiter chinesischer Frontier-Coding-Kandidat. Siehe [[glm-5.2-zai-coding-model.md]] für Details.
**Empfohlene Routing-Position:**
```
OpenClaw Primary Routing
├─ Creative / Long-Context (1M) → GLM 5.2
├─ Speed / Innovation Coding → Kimi K2.7 Code
├─ Standard Tasks → openrouter/auto → ...
└─ Frontier Quality → Claude Opus 4.8 / Fable
```
**Drei Setup-Optionen** (Stand 14.06.2026):
1. **Z.ai Coding Plan** (sofort, ab 18 USD/Monat) — via `npx @z_ai/coding-helper`. **Achtung:** Light-Plan hat in Stoßzeiten 2-3× Kontingent-Verbrauch und lange Wartezeiten.
2. **Self-Hosting** (nach Open Weights Release nächste Woche) — MIT-Lizenz, Self-Host via [HuggingFace](https://huggingface.co/zai-org/GLM-5).
3. **Warten** auf OpenRouter-Listing (Tage) — Standard-Routing greift dann automatisch.
**Ensemble-Kandidat:** GLM 5.2 + Kimi K2.7 als heterogenes Coding-Panel in [[llm-model-fusion-ensembles.md]] (unterschiedliche Architektur: Dense vs MoE, unterschiedliche Stärken).
**Besonderheit:** [Z.ai Coding Plan](https://z.ai/subscribe) listet `Clawdbot/OpenClaw` namentlich als unterstütztes Environment — direkte Integration bereits vorbereitet.