GLM 5.2 Deep-Dive (IAmFabian, 14.06.2026, 13:15 Min, 212 views, 16 Likes). Deutscher Reviewer testet live: Flappy Bird (1:20, 481 Zeilen HTML, laeuft) und Newton-Pendel mit echter Physik (9:41, davon 8:27 nur Thinking). Kernkonzepte: - Chinas Frontier-Coding-Modelle 2026: Kimi K2.7 + GLM 5.2, beide Frontier-Niveau bei 10x niedrigeren Preisen - GLM 5.2: 1M Kontext, MIT-Lizenz (Open Weights 'naechste Woche'), laut AI Code King Benchmarks nur 6% unter Opus 4.8 - Z.ai Coding Plan (18 USD/Monat Light) als exklusive Distribution - Light-Plan: 2-3x Kontingent-Mehrverbrauch in Stosszeiten - OpenRouter-Eintrag 'in den naechsten Tagen' erwartet - Coding Helper (npx @z_ai/coding-helper) bindet GLM 5.2 in Claude Code, OpenCode, Cline, Kilo Code, Crush, Factory Droid ein KRITISCHER IMPLIKAT FUER OPENCLAW: - Z.ai Coding Plan listet 'Clawdbot/OpenClaw' naamentlich als unterstuetztes Environment - direkte Integration bereits vorbereitet - Drei Setup-Optionen: 1. Z.ai Coding Plan sofort (18 USD/Monat, Light) 2. Self-Hosting nach Open Weights (MIT, HuggingFace) 3. Warten auf OpenRouter (Tage) Aenderungen: - raw/youtube/2026-06-15_ichbinfabian-glm-5.2-coding-modell.md (neu) - wiki/concepts/glm-5.2-zai-coding-model.md (neu) - wiki/architecture/model-routing.md (neue Sektion GLM 5.2 + Routing-Position + 3 Setup-Optionen) - wiki/index.md (neuer Concepts-Eintrag + Raw Sources-Eintrag) - wiki/log.md (Eintrag) Maximale Verlinkung: 12 Z.ai/HuggingFace/NPM-Links, 10 Tool-Links (OpenCode, Claude Code, Cline, Kilo Code, Crush, Droid), 8 Wiki-Cross-References, 4 Konkurrenz-Links (Kimi, OpenRouter, Open LLM Leaderboard, Anthropic).
72 lines
No EOL
3.4 KiB
Markdown
72 lines
No EOL
3.4 KiB
Markdown
# Model Routing
|
||
|
||
> Migriert aus ByteRover context-tree (April 2026)
|
||
|
||
## Two-Model-Pipeline
|
||
|
||
Für mehrstufige Aufgaben: **Grok 4.20 → Gemini 2.5 Flash**
|
||
|
||
| Phase | Modell | Stärke |
|
||
|-------|--------|--------|
|
||
| Ideation | Grok 4.20 | Kreative Exploration, Brainstorming, divergentes Denken |
|
||
| Synthesis | Gemini 2.5 Flash | Strukturierte Ausgabe, schnelle Synthese, konvergent |
|
||
|
||
Dieses Pattern wird sowohl im allgemeinen Routing als auch im Subconscious Agent (Hard Synthesis) verwendet, aber nie als Shared Primitive formalisiert.
|
||
|
||
## GPT-5.4 Konfiguration
|
||
|
||
- **Alias:** `GPT-5.4`
|
||
- **Route:** `openrouter/openai/gpt-5.4`
|
||
- **Context:** 200k Tokens
|
||
- **Output:** 32k Tokens
|
||
- **Reasoning/Thinking:** ❌ Deaktiviert (per Claire Vo-Empfehlung)
|
||
|
||
## Fallback-Chain (Hector Primary)
|
||
|
||
```
|
||
openrouter/auto
|
||
→ zai/glm-5-turbo
|
||
→ moonshot/moonshot-v1-auto
|
||
→ moonshot/kimi-k2.5
|
||
→ ollama/minimax-m2.7
|
||
```
|
||
|
||
## Verwandt: Parallele Ensembles (Fusion)
|
||
|
||
Sequentielles Routing (Fallback) ist nicht das einzige Pattern. OpenRouter bietet **Fusion** — parallele Model-Panels mit Judge-Synthese. Siehe [[llm-model-fusion-ensembles.md]] für Details und DRACO-Benchmark-Ergebnisse.
|
||
|
||
**Aktuell offene Frage:** Soll OpenClaws Quality-kritische Pfade (z.B. Subconscious Hard Synthesis) um eine parallele Pre-Routing-Schicht erweitert werden? Trade-off: höhere Latenz + Kosten vs. bessere Qualität durch Modell-Heterogenität.
|
||
|
||
## Coding-Modelle: Kimi K2.7 & GLM-5.2
|
||
|
||
Im Juni 2026 haben sich zwei starke Open-Source-Coding-Modelle aus China etabliert:
|
||
|
||
- **Kimi K2.7** (Moonshot AI) — siehe [[kimi-k2.7-code.md]]. MoE 1T/32B, 256K Kontext, schnell im Real-Coding-Showdown.
|
||
- **GLM-5.2** (Zhipu AI / Z.ai) — 744B Dense, 1M Kontext, MIT-Lizenz, stark bei kreativer Generation und Animation.
|
||
|
||
Head-to-Head-Vergleich in Hermes Agent: siehe [[real-world-coding-showdown.md]].
|
||
|
||
**Implikation für Routing:** In Sub-Task-Spezialisierung (Coding vs. Creative vs. Long-Context) sind beide als Sub-Routing-Knoten sinnvoll — nicht als Ersatz der Primary-Fallback-Chain, sondern als **spezialisierte Side-Branches** für Coding-Tasks.
|
||
|
||
### GLM 5.2 (Z.ai) — 1M Kontext, MIT-Lizenz, 10x günstiger
|
||
|
||
Zusätzlich zu Kimi K2.7 ist **GLM 5.2** (Release 13.06.2026) ein zweiter chinesischer Frontier-Coding-Kandidat. Siehe [[glm-5.2-zai-coding-model.md]] für Details.
|
||
|
||
**Empfohlene Routing-Position:**
|
||
|
||
```
|
||
OpenClaw Primary Routing
|
||
├─ Creative / Long-Context (1M) → GLM 5.2
|
||
├─ Speed / Innovation Coding → Kimi K2.7 Code
|
||
├─ Standard Tasks → openrouter/auto → ...
|
||
└─ Frontier Quality → Claude Opus 4.8 / Fable
|
||
```
|
||
|
||
**Drei Setup-Optionen** (Stand 14.06.2026):
|
||
1. **Z.ai Coding Plan** (sofort, ab 18 USD/Monat) — via `npx @z_ai/coding-helper`. **Achtung:** Light-Plan hat in Stoßzeiten 2-3× Kontingent-Verbrauch und lange Wartezeiten.
|
||
2. **Self-Hosting** (nach Open Weights Release nächste Woche) — MIT-Lizenz, Self-Host via [HuggingFace](https://huggingface.co/zai-org/GLM-5).
|
||
3. **Warten** auf OpenRouter-Listing (Tage) — Standard-Routing greift dann automatisch.
|
||
|
||
**Ensemble-Kandidat:** GLM 5.2 + Kimi K2.7 als heterogenes Coding-Panel in [[llm-model-fusion-ensembles.md]] (unterschiedliche Architektur: Dense vs MoE, unterschiedliche Stärken).
|
||
|
||
**Besonderheit:** [Z.ai Coding Plan](https://z.ai/subscribe) listet `Clawdbot/OpenClaw` namentlich als unterstütztes Environment — direkte Integration bereits vorbereitet. |