Dieses Pattern wird sowohl im allgemeinen Routing als auch im Subconscious Agent (Hard Synthesis) verwendet, aber nie als Shared Primitive formalisiert.
Sequentielles Routing (Fallback) ist nicht das einzige Pattern. OpenRouter bietet **Fusion** — parallele Model-Panels mit Judge-Synthese. Siehe [[llm-model-fusion-ensembles.md]] für Details und DRACO-Benchmark-Ergebnisse.
**Aktuell offene Frage:** Soll OpenClaws Quality-kritische Pfade (z.B. Subconscious Hard Synthesis) um eine parallele Pre-Routing-Schicht erweitert werden? Trade-off: höhere Latenz + Kosten vs. bessere Qualität durch Modell-Heterogenität.
## Coding-Modelle: Kimi K2.7 & GLM-5.2
Im Juni 2026 haben sich zwei starke Open-Source-Coding-Modelle aus China etabliert:
**Implikation für Routing:** In Sub-Task-Spezialisierung (Coding vs. Creative vs. Long-Context) sind beide als Sub-Routing-Knoten sinnvoll — nicht als Ersatz der Primary-Fallback-Chain, sondern als **spezialisierte Side-Branches** für Coding-Tasks.
Zusätzlich zu Kimi K2.7 ist **GLM 5.2** (Release 13.06.2026) ein zweiter chinesischer Frontier-Coding-Kandidat. Siehe [[glm-5.2-zai-coding-model.md]] für Details.
**Empfohlene Routing-Position:**
```
OpenClaw Primary Routing
├─ Creative / Long-Context (1M) → GLM 5.2
├─ Speed / Innovation Coding → Kimi K2.7 Code
├─ Standard Tasks → openrouter/auto → ...
└─ Frontier Quality → Claude Opus 4.8 / Fable
```
**Drei Setup-Optionen** (Stand 14.06.2026):
1.**Z.ai Coding Plan** (sofort, ab 18 USD/Monat) — via `npx @z_ai/coding-helper`. **Achtung:** Light-Plan hat in Stoßzeiten 2-3× Kontingent-Verbrauch und lange Wartezeiten.
2.**Self-Hosting** (nach Open Weights Release nächste Woche) — MIT-Lizenz, Self-Host via [HuggingFace](https://huggingface.co/zai-org/GLM-5).
3.**Warten** auf OpenRouter-Listing (Tage) — Standard-Routing greift dann automatisch.
**Ensemble-Kandidat:** GLM 5.2 + Kimi K2.7 als heterogenes Coding-Panel in [[llm-model-fusion-ensembles.md]] (unterschiedliche Architektur: Dense vs MoE, unterschiedliche Stärken).
**Besonderheit:** [Z.ai Coding Plan](https://z.ai/subscribe) listet `Clawdbot/OpenClaw` namentlich als unterstütztes Environment — direkte Integration bereits vorbereitet.
## Post-Transformer-Architekturen als künftige Routing-Optionen
Während aktuelles Routing primär **innerhalb** des AR-Transformer-Stacks arbeitet (mit Modell-Heterogenität als Variations-Achse), verschiebt DeepMind die Variations-Achse **architektonisch**: hybride Attention+Recurrence (Griffin, Recurrent Gemma, Titans), Diffusions-LLMs, JEPA-Weltmodelle. Details: [[concepts/llm/post-transformer-llm-architectures.md]].
**Aktuell noch nicht relevant für OpenClaw-Routing** (keine offenen Weights + stabile Provider-Listings), aber mittelfristig zu beobachten:
- **State-Space-Hybride** (Titans, Mamba) als effizientere lokale Embedding-Backends für SSR/Speicher-Layer
- **Diffusions-LLMs** für parallele Code-Completion in nicht-Präfix-Positionen (relevant für Hermes-Agent-Code-Edit-Tasks)
- **JEPA-Weltmodelle** für Subconscious-Agent-„Simulations-Prior" (statt nur Text-Pretraining-Prior)
**Status:** Beobachten, nicht adoptieren. Sobald OpenRouter oder ein anderer Provider-Adapter stabile Listings anbietet, evaluieren wie bei [[concepts/llm/glm-5.2-zai-coding-model.md]].
Mainzers Energie-Argument (20W Gehirn vs. Megawatt-LLM-Cluster, siehe [[concepts/hardware/neuromorphic-chips-und-quantencomputer]]) validiert [[concepts/llm/ai-value-migration-orchestration]] (Aravind: „Token Value per Watt per User"). Implikation für OpenClaw-Routing:
- **Edge-Tasks** (Smart-Home, Mobile, Embedded): langfristig nur mit neuromorphen/photonischen Backends wirtschaftlich — nicht mit Cloud-LLMs
- **Mittelfristig beobachten:** Intel Loihi, IBM TrueNorth, Lightmatter, Luminous Computing — Status 2026?
- **Kurzfristig:** Optimierung bestehender AR-Transformer-Pfade (Caching, Quantisierung, Speculative Decoding) bleibt wichtig, ist aber Endpunkt-Frickelei — Hardware-Diversität ist der eigentliche Spielfeldwechsel.