ingest(youtube): fahd-mirza-kimi-k2.7-vs-glm-5.2
Fahd Mirza Head-to-Head in Hermes Agent (14.06.2026, 14 Min, 2659 views,
89 likes). Beide Modelle bekommen denselben Prompt, loesen denselben
Real-World-Task: Flask-App mit gepflanztem FIFA-Bug + Round-of-32-
Bracket-Feature mit Anti-Group-Rematch-Regel.
Test 1: Beide bestehen. Kimi schneller (~5 Min), innovativer
(zusaetzliche Progression-Previews). GLM: 97 tool calls, laenger.
Test 2 (Creative HTML, Siberian Wind): GLM staerker bei Animation +
Terrain-Detail; Kimi bei Stats + Geographie.
Konzept: Real-World-Showdown als Benchmark-Alternative zu statischen
Tests (HumanEval, MBPP, SWE-bench). Agent-Framework isoliert die
Modell-Variable sauber.
Direkte Implikation fuer OpenClaw:
- Sub-Task-spezifisches Coding-Routing (Kimi vs GLM je nach Task)
- Ensemble-Kandidaten: Kimi K2.7 + GLM-5.2 in Coding-Panels
- Real-World-Validierung statt nur Standard-Benchmarks fuer Production-
Pfade
- Hermes Agent als alternatives Agent-Framework zu AutoGen/CrewAI
Aenderungen:
- raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md (neu)
- wiki/concepts/real-world-coding-showdown.md (neu)
- wiki/tools/kimi-k2.7-code.md (Cross-References)
- wiki/architecture/model-routing.md (neue Sektion Coding-Modelle)
- wiki/index.md (neuer Concepts-Eintrag + Raw Sources-Eintrag)
- wiki/log.md (Eintrag)
Maximale Verlinkung gemaess AGENTS.md-Kardinalregel:
- 12 externe Verweise auf Modelle (Kimi, GLM, Hermes, Ollama, Z.ai)
- 9 Benchmark-/Methoden-Links (SWE-bench, HumanEval, MBPP, MCP, etc.)
- 7 Fahd-Mirza-Links (YT, Blog, LinkedIn, Substack, Ko-Fi)
- 5 Wiki-Cross-References (fusion, ai-agents, kimi-k2.7, model-routing, behavior-persistence)
2026-06-15 09:45:38 +02:00
---
created: 2026-06-15
updated: 2026-06-15
sources: [youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md]
tags: [concept, coding-agents, hermes-agent, kimi-k2.7, glm-5.2, real-world-benchmark, open-source, china-ai, agentic-coding]
---
# Real-World Coding-Agent Showdowns — Methodik jenseits von Standard-Benchmarks
> **Quelle des Konzepts:** YouTube-Video "Kimi K2.7 vs GLM-5.2: Real Coding Showdown in Hermes Agent" (Fahd Mirza, 14.06.2026, 14 Min, 2659 Aufrufe, 89 Likes). Geteilt von @PWeber (Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic.
## Kernidee
**Statt statischer Code-Benchmarks (HumanEval, MBPP, SWE-bench) → head-to-head-Vergleich zweier Modelle in derselben Agent-Umgebung, mit echtem Bug + Feature-Anforderung in einer nicht-trivialen App.**
Das Video von [Fahd Mirza ](https://www.youtube.com/@fahdmirza ) demonstriert eine **alternative Evaluationsmethode** für Coding-Modelle: Beide Modelle erhalten denselben Prompt in derselben [Hermes Agent ](https://github.com/nousresearch/hermes-agent )-Instanz, lösen denselben realistischen Task (Bug-Fix + Feature-Build in einer Flask-App), und werden anhand konkreter Output-Qualität, Zeit und Tool-Call-Effizienz verglichen.
## Die Methodik
### Setup
| Element | Details |
|---|---|
| **Test-App** | Flask-Webanwendung (World Cup 2026 Tracker), DB + CRUD, "hundreds of files" |
| **Gepflanzter Bug** | Round-of-32-Ranking der besten Drittplatzierten ignoriert Goal Difference — verstößt gegen FIFA-Regel |
| **Feature-Anforderung** | Round-of-32-Bracket: 16 Matchups, Group-Winner auf starker Seite, **kein Team spielt gegen einen aus seiner eigenen Gruppe** |
| **Test-Framework** | [Hermes Agent ](https://github.com/nousresearch/hermes-agent ) von [Nous Research ](https://nousresearch.com/ ) (selber Agent für beide Modelle) |
| **Hardware** | Ubuntu-System, beide Modelle als Inference-Backends |
| **Prompt** | Identisch für beide Modelle, One-Shot mit echtem Use-Case |
| **Bewertungsdimensionen** | Korrektheit, Vollständigkeit, Zeit, Tool-Call-Anzahl, Innovation |
### Bewertung — Kriterien-Katalog (extrapoliert)
1. **Bug-Fix Korrektheit** — wird der FIFA-Regel-konforme Goal-Difference-Fix korrekt umgesetzt?
2. **Feature-Vollständigkeit** — funktioniert das Round-of-32-Bracket mit allen 16 Matchups?
3. **Constraint-Satisfaction** — Anti-Group-Rematch-Regel eingehalten?
4. **Tool-Call-Effizienz** — wie viele Tool-Calls für die Lösung?
5. **Zeit-Effizienz** — Inferenz-Zeit für die Gesamtaufgabe?
6. **Innovation** — Eigeninitiative über die Anforderung hinaus (z.B. zusätzliche UI-Features)
7. **Kreativität (zweiter Test)** — Fähigkeit zu Single-File-Creative-Coding mit Animation, Geographie, Live-Stats
## Ergebnisse (Video)
### Test 1: Real Coding (Bug-Fix + Feature)
| Kriterium | Kimi K2.7 | GLM-5.2 |
|---|---|---|
| Bug-Fix korrekt | ✅ | ✅ |
| Bracket-Feature | ✅ | ✅ |
| Anti-Group-Rematch | ✅ | ✅ |
| Tool-Calls | mehr | 97 |
| Zeit | ** ~5 Min** | länger |
| **Innovation** | ** +** (z.B. Progression-Previews) | – |
**Fazit Test 1:** Beide bestehen, **Kimi vorn** durch Geschwindigkeit + Innovation.
### Test 2: Creative HTML (Siberian Wind Simulation)
| Kriterium | Kimi K2.7 | GLM-5.2 |
|---|---|---|
| Geographie korrekt | ✅ | ✅ |
| Live-Stats (Wind, City) | ✅ | ✅ |
| **Animation sichtbar** | ⚠️ sehr schwach | ✅ |
| **Terrain-Detail** | ❌ "plain" | ✅ sichtbar |
**Fazit Test 2:** **GLM vorn** bei kreativer Animation + Detail.
**Gesamtfazit Mirza:** "Both models are neck to neck. Test on your own use case." (Subjektivität anerkannt.)
## Warum diese Methodik wertvoll ist
### 1. Statische Benchmarks haben Grenzen
Standard-Coding-Benchmarks messen **eng definierte Code-Generierung** (Funktion schreiben, Bug fixieren). Real-World-Coding-Agents brauchen mehr:
- **Multi-File-Reasoning** über hunderte Dateien
- **Tool-Use** (Shell, Browser, DB, Git)
- **Constraint-Satisfaction** mit nicht-offensichtlichen Regeln
- **Eigeninitiative** (User will "Bracket", aber gute Lösung antizipiert Edge-Cases)
- **Kombiniertes Bug-Fix + Feature-Build** in einem Shot
Der Hermes-Showdown testet all das **implizit** — ohne explizit dafür designte Benchmarks.
### 2. Agent-Framework isolieren
Indem **beide Modelle im selben Agent-Framework** laufen (Hermes Agent), wird die Modell-Variable sauber isoliert. Der Vergleich misst: *Was kann das Modell XY in einem realen Agent-Workflow?* — nicht: *Was kann Agent A vs Agent B?*
feat: people-pages for all TODO institutions markers
- Created 27 new people-pages for all TODO-marked persons
- Replaced all TODO: people-page markers with wiki-links in institutions
- Cross-referenced back to institutions from each people-page
- 0 TODO markers remaining
New people-pages:
shayne-coplan, jim-zemlin, wang-changhu, yang-bingyang, demis-hassabis,
clement-delangue, thomas-kurian, fei-fei-li, christopher-manning,
sam-altman, ilya-sutskever, moritz-kaminski, elon-musk, nicolas-burtey,
elizabeth-stark, olaoluwa-osuntokun, jan-leike, oren-etzioni,
ali-farhadi, jaime-sevilla, max-tegmark, daniela-rus, jared-kaplan,
alex-atallah, andrew-moore, tuomas-sandholm, mitchell-baker
2026-06-25 21:44:25 +02:00
**→ Direkter Implikat für OpenClaw:** Eine vergleichbare Showdown-Methodik mit [[../agents/ai-agents-2026.md]]-Setups würde zeigen, welches Modell für welchen Sub-Task im OpenClaw-Setup am besten passt.
ingest(youtube): fahd-mirza-kimi-k2.7-vs-glm-5.2
Fahd Mirza Head-to-Head in Hermes Agent (14.06.2026, 14 Min, 2659 views,
89 likes). Beide Modelle bekommen denselben Prompt, loesen denselben
Real-World-Task: Flask-App mit gepflanztem FIFA-Bug + Round-of-32-
Bracket-Feature mit Anti-Group-Rematch-Regel.
Test 1: Beide bestehen. Kimi schneller (~5 Min), innovativer
(zusaetzliche Progression-Previews). GLM: 97 tool calls, laenger.
Test 2 (Creative HTML, Siberian Wind): GLM staerker bei Animation +
Terrain-Detail; Kimi bei Stats + Geographie.
Konzept: Real-World-Showdown als Benchmark-Alternative zu statischen
Tests (HumanEval, MBPP, SWE-bench). Agent-Framework isoliert die
Modell-Variable sauber.
Direkte Implikation fuer OpenClaw:
- Sub-Task-spezifisches Coding-Routing (Kimi vs GLM je nach Task)
- Ensemble-Kandidaten: Kimi K2.7 + GLM-5.2 in Coding-Panels
- Real-World-Validierung statt nur Standard-Benchmarks fuer Production-
Pfade
- Hermes Agent als alternatives Agent-Framework zu AutoGen/CrewAI
Aenderungen:
- raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md (neu)
- wiki/concepts/real-world-coding-showdown.md (neu)
- wiki/tools/kimi-k2.7-code.md (Cross-References)
- wiki/architecture/model-routing.md (neue Sektion Coding-Modelle)
- wiki/index.md (neuer Concepts-Eintrag + Raw Sources-Eintrag)
- wiki/log.md (Eintrag)
Maximale Verlinkung gemaess AGENTS.md-Kardinalregel:
- 12 externe Verweise auf Modelle (Kimi, GLM, Hermes, Ollama, Z.ai)
- 9 Benchmark-/Methoden-Links (SWE-bench, HumanEval, MBPP, MCP, etc.)
- 7 Fahd-Mirza-Links (YT, Blog, LinkedIn, Substack, Ko-Fi)
- 5 Wiki-Cross-References (fusion, ai-agents, kimi-k2.7, model-routing, behavior-persistence)
2026-06-15 09:45:38 +02:00
### 3. Open-Source-Realität 2026
**Sowohl Kimi K2.7 (Moonshot AI) als auch GLM-5.2 (Zhipu AI) sind konkurrenzfähige Open-Source-Coding-Modelle** mit unterschiedlichen Trade-offs:
| Dimension | Kimi K2.7 | GLM-5.2 |
|---|---|---|
| Architektur | MoE (1T total, 32B active) | Dense (744B) |
| Kontext | 256K | **1M** |
| Lizenz | Open | **MIT** |
| Stärke (Test 1) | Speed, Innovation | Konsistenz |
| Stärke (Test 2) | Stats, Geographie | **Animation, Detail** |
feat: people-pages for all TODO institutions markers
- Created 27 new people-pages for all TODO-marked persons
- Replaced all TODO: people-page markers with wiki-links in institutions
- Cross-referenced back to institutions from each people-page
- 0 TODO markers remaining
New people-pages:
shayne-coplan, jim-zemlin, wang-changhu, yang-bingyang, demis-hassabis,
clement-delangue, thomas-kurian, fei-fei-li, christopher-manning,
sam-altman, ilya-sutskever, moritz-kaminski, elon-musk, nicolas-burtey,
elizabeth-stark, olaoluwa-osuntokun, jan-leike, oren-etzioni,
ali-farhadi, jaime-sevilla, max-tegmark, daniela-rus, jared-kaplan,
alex-atallah, andrew-moore, tuomas-sandholm, mitchell-baker
2026-06-25 21:44:25 +02:00
**→ Direkter Implikat für [[llm-model-fusion-ensembles.md]]:** In der OpenRouter-Fusion-Demo war Kimi K2.6 im Budget-Panel. Kimi K2.7 ist die nächste Generation und GLM-5.2 ein weiterer Kandidat. Beide könnten in heterogenen Coding-Panels Synergieeffekte erzeugen.
ingest(youtube): fahd-mirza-kimi-k2.7-vs-glm-5.2
Fahd Mirza Head-to-Head in Hermes Agent (14.06.2026, 14 Min, 2659 views,
89 likes). Beide Modelle bekommen denselben Prompt, loesen denselben
Real-World-Task: Flask-App mit gepflanztem FIFA-Bug + Round-of-32-
Bracket-Feature mit Anti-Group-Rematch-Regel.
Test 1: Beide bestehen. Kimi schneller (~5 Min), innovativer
(zusaetzliche Progression-Previews). GLM: 97 tool calls, laenger.
Test 2 (Creative HTML, Siberian Wind): GLM staerker bei Animation +
Terrain-Detail; Kimi bei Stats + Geographie.
Konzept: Real-World-Showdown als Benchmark-Alternative zu statischen
Tests (HumanEval, MBPP, SWE-bench). Agent-Framework isoliert die
Modell-Variable sauber.
Direkte Implikation fuer OpenClaw:
- Sub-Task-spezifisches Coding-Routing (Kimi vs GLM je nach Task)
- Ensemble-Kandidaten: Kimi K2.7 + GLM-5.2 in Coding-Panels
- Real-World-Validierung statt nur Standard-Benchmarks fuer Production-
Pfade
- Hermes Agent als alternatives Agent-Framework zu AutoGen/CrewAI
Aenderungen:
- raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md (neu)
- wiki/concepts/real-world-coding-showdown.md (neu)
- wiki/tools/kimi-k2.7-code.md (Cross-References)
- wiki/architecture/model-routing.md (neue Sektion Coding-Modelle)
- wiki/index.md (neuer Concepts-Eintrag + Raw Sources-Eintrag)
- wiki/log.md (Eintrag)
Maximale Verlinkung gemaess AGENTS.md-Kardinalregel:
- 12 externe Verweise auf Modelle (Kimi, GLM, Hermes, Ollama, Z.ai)
- 9 Benchmark-/Methoden-Links (SWE-bench, HumanEval, MBPP, MCP, etc.)
- 7 Fahd-Mirza-Links (YT, Blog, LinkedIn, Substack, Ko-Fi)
- 5 Wiki-Cross-References (fusion, ai-agents, kimi-k2.7, model-routing, behavior-persistence)
2026-06-15 09:45:38 +02:00
### 4. Sub-Task-Spezialisierung als Schlüssel
Statt "ein Modell für alles" zeigt der Showdown: **Beide Modelle sind kompetent, aber in verschiedenen Dimensionen stark.** Praktisch heißt das: in einer Ensemble-Architektur (Fusion) sollte man nicht nur diverse Modelle kombinieren, sondern auch **Sub-Task-spezifisch zuweisen** .
## Pro-Leben-Perspektive
feat: people-pages for all TODO institutions markers
- Created 27 new people-pages for all TODO-marked persons
- Replaced all TODO: people-page markers with wiki-links in institutions
- Cross-referenced back to institutions from each people-page
- 0 TODO markers remaining
New people-pages:
shayne-coplan, jim-zemlin, wang-changhu, yang-bingyang, demis-hassabis,
clement-delangue, thomas-kurian, fei-fei-li, christopher-manning,
sam-altman, ilya-sutskever, moritz-kaminski, elon-musk, nicolas-burtey,
elizabeth-stark, olaoluwa-osuntokun, jan-leike, oren-etzioni,
ali-farhadi, jaime-sevilla, max-tegmark, daniela-rus, jared-kaplan,
alex-atallah, andrew-moore, tuomas-sandholm, mitchell-baker
2026-06-25 21:44:25 +02:00
Gemäß [[../directives/pro-leben-directive.md]]:
ingest(youtube): fahd-mirza-kimi-k2.7-vs-glm-5.2
Fahd Mirza Head-to-Head in Hermes Agent (14.06.2026, 14 Min, 2659 views,
89 likes). Beide Modelle bekommen denselben Prompt, loesen denselben
Real-World-Task: Flask-App mit gepflanztem FIFA-Bug + Round-of-32-
Bracket-Feature mit Anti-Group-Rematch-Regel.
Test 1: Beide bestehen. Kimi schneller (~5 Min), innovativer
(zusaetzliche Progression-Previews). GLM: 97 tool calls, laenger.
Test 2 (Creative HTML, Siberian Wind): GLM staerker bei Animation +
Terrain-Detail; Kimi bei Stats + Geographie.
Konzept: Real-World-Showdown als Benchmark-Alternative zu statischen
Tests (HumanEval, MBPP, SWE-bench). Agent-Framework isoliert die
Modell-Variable sauber.
Direkte Implikation fuer OpenClaw:
- Sub-Task-spezifisches Coding-Routing (Kimi vs GLM je nach Task)
- Ensemble-Kandidaten: Kimi K2.7 + GLM-5.2 in Coding-Panels
- Real-World-Validierung statt nur Standard-Benchmarks fuer Production-
Pfade
- Hermes Agent als alternatives Agent-Framework zu AutoGen/CrewAI
Aenderungen:
- raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md (neu)
- wiki/concepts/real-world-coding-showdown.md (neu)
- wiki/tools/kimi-k2.7-code.md (Cross-References)
- wiki/architecture/model-routing.md (neue Sektion Coding-Modelle)
- wiki/index.md (neuer Concepts-Eintrag + Raw Sources-Eintrag)
- wiki/log.md (Eintrag)
Maximale Verlinkung gemaess AGENTS.md-Kardinalregel:
- 12 externe Verweise auf Modelle (Kimi, GLM, Hermes, Ollama, Z.ai)
- 9 Benchmark-/Methoden-Links (SWE-bench, HumanEval, MBPP, MCP, etc.)
- 7 Fahd-Mirza-Links (YT, Blog, LinkedIn, Substack, Ko-Fi)
- 5 Wiki-Cross-References (fusion, ai-agents, kimi-k2.7, model-routing, behavior-persistence)
2026-06-15 09:45:38 +02:00
**Gegen Mangelnarrativ** ("Wir sind abhängig von US-Frontier-Modellen"):
- 2026 ist das Jahr, in dem **chinesische Open-Source-Coding-Modelle Frontier-Nähe erreicht haben** — Kimi K2.7, GLM-5.2, DeepSeek-Varianten
- MIT-Lizenz für GLM-5.2 (Open Weights) ist ein handfester Schritt Richtung echter Offenheit
- Konkurrenz belebt das Feld — beide Modelle sind besser als eines allein
**Für Handlungsfähigkeit:**
- Wer Coding-Agents baut, kann heute zwischen mehreren starken Open-Source-Modellen wählen
feat: people-pages for all TODO institutions markers
- Created 27 new people-pages for all TODO-marked persons
- Replaced all TODO: people-page markers with wiki-links in institutions
- Cross-referenced back to institutions from each people-page
- 0 TODO markers remaining
New people-pages:
shayne-coplan, jim-zemlin, wang-changhu, yang-bingyang, demis-hassabis,
clement-delangue, thomas-kurian, fei-fei-li, christopher-manning,
sam-altman, ilya-sutskever, moritz-kaminski, elon-musk, nicolas-burtey,
elizabeth-stark, olaoluwa-osuntokun, jan-leike, oren-etzioni,
ali-farhadi, jaime-sevilla, max-tegmark, daniela-rus, jared-kaplan,
alex-atallah, andrew-moore, tuomas-sandholm, mitchell-baker
2026-06-25 21:44:25 +02:00
- Hermes Agent ist Open Source ([[../agents/ai-agents-2026.md]]-Pattern)
ingest(youtube): fahd-mirza-kimi-k2.7-vs-glm-5.2
Fahd Mirza Head-to-Head in Hermes Agent (14.06.2026, 14 Min, 2659 views,
89 likes). Beide Modelle bekommen denselben Prompt, loesen denselben
Real-World-Task: Flask-App mit gepflanztem FIFA-Bug + Round-of-32-
Bracket-Feature mit Anti-Group-Rematch-Regel.
Test 1: Beide bestehen. Kimi schneller (~5 Min), innovativer
(zusaetzliche Progression-Previews). GLM: 97 tool calls, laenger.
Test 2 (Creative HTML, Siberian Wind): GLM staerker bei Animation +
Terrain-Detail; Kimi bei Stats + Geographie.
Konzept: Real-World-Showdown als Benchmark-Alternative zu statischen
Tests (HumanEval, MBPP, SWE-bench). Agent-Framework isoliert die
Modell-Variable sauber.
Direkte Implikation fuer OpenClaw:
- Sub-Task-spezifisches Coding-Routing (Kimi vs GLM je nach Task)
- Ensemble-Kandidaten: Kimi K2.7 + GLM-5.2 in Coding-Panels
- Real-World-Validierung statt nur Standard-Benchmarks fuer Production-
Pfade
- Hermes Agent als alternatives Agent-Framework zu AutoGen/CrewAI
Aenderungen:
- raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md (neu)
- wiki/concepts/real-world-coding-showdown.md (neu)
- wiki/tools/kimi-k2.7-code.md (Cross-References)
- wiki/architecture/model-routing.md (neue Sektion Coding-Modelle)
- wiki/index.md (neuer Concepts-Eintrag + Raw Sources-Eintrag)
- wiki/log.md (Eintrag)
Maximale Verlinkung gemaess AGENTS.md-Kardinalregel:
- 12 externe Verweise auf Modelle (Kimi, GLM, Hermes, Ollama, Z.ai)
- 9 Benchmark-/Methoden-Links (SWE-bench, HumanEval, MBPP, MCP, etc.)
- 7 Fahd-Mirza-Links (YT, Blog, LinkedIn, Substack, Ko-Fi)
- 5 Wiki-Cross-References (fusion, ai-agents, kimi-k2.7, model-routing, behavior-persistence)
2026-06-15 09:45:38 +02:00
- Real-World-Tests sind machbar: App mit Bug + Feature bauen, beide Modelle dranlassen, vergleichen
**Realismus:**
- Beide Modelle haben **eigene Schwächen** (Kimi bei Animation, GLM bei Innovation)
- 1M Kontext (GLM) ist nicht immer nützlich — oft sind 256K (Kimi) praxisnäher
- "Neck to neck" = **beide gut genug für Production, aber nicht perfekt**
- Standard-Benchmarks (Kimi Code Bench v2, Program Bench) bleiben als erste Approximation sinnvoll — Real-World-Tests ergänzen, ersetzen aber nicht
## Verwandte Wiki-Seiten
feat: people-pages for all TODO institutions markers
- Created 27 new people-pages for all TODO-marked persons
- Replaced all TODO: people-page markers with wiki-links in institutions
- Cross-referenced back to institutions from each people-page
- 0 TODO markers remaining
New people-pages:
shayne-coplan, jim-zemlin, wang-changhu, yang-bingyang, demis-hassabis,
clement-delangue, thomas-kurian, fei-fei-li, christopher-manning,
sam-altman, ilya-sutskever, moritz-kaminski, elon-musk, nicolas-burtey,
elizabeth-stark, olaoluwa-osuntokun, jan-leike, oren-etzioni,
ali-farhadi, jaime-sevilla, max-tegmark, daniela-rus, jared-kaplan,
alex-atallah, andrew-moore, tuomas-sandholm, mitchell-baker
2026-06-25 21:44:25 +02:00
- [[llm-model-fusion-ensembles.md]] — Kimi K2.6 im Budget-Panel; Kimi K2.7 / GLM-5.2 als neue Ensemble-Kandidaten
- [[../agents/ai-agents-2026.md]] — Agent-Frameworks; Hermes Agent als alternatives Agent-Framework
- [[llm-behavior-persistence.md]] — Verhalten im Einzelmodell vs. Verhalten in Agent-Workflows
- [[../../tools/kimi-k2.7-code.md]] — existierende Wiki-Seite zu Kimi K2.7 (Benchmarks, Ollama Cloud)
- [[../../tools/anthropic-claude.md]] — Frontier-Konkurrenz (Opus 4.8 als Synthesizer in OpenRouter-Fusion)
- [[../../architecture/model-routing.md]] — Sub-Task-spezifische Modell-Zuweisung als Pattern
- [[llm-knowledge-base.md]] — Karpathy-Pattern: kuratierte Strukturen schlagen reine Inference
ingest(youtube): fahd-mirza-kimi-k2.7-vs-glm-5.2
Fahd Mirza Head-to-Head in Hermes Agent (14.06.2026, 14 Min, 2659 views,
89 likes). Beide Modelle bekommen denselben Prompt, loesen denselben
Real-World-Task: Flask-App mit gepflanztem FIFA-Bug + Round-of-32-
Bracket-Feature mit Anti-Group-Rematch-Regel.
Test 1: Beide bestehen. Kimi schneller (~5 Min), innovativer
(zusaetzliche Progression-Previews). GLM: 97 tool calls, laenger.
Test 2 (Creative HTML, Siberian Wind): GLM staerker bei Animation +
Terrain-Detail; Kimi bei Stats + Geographie.
Konzept: Real-World-Showdown als Benchmark-Alternative zu statischen
Tests (HumanEval, MBPP, SWE-bench). Agent-Framework isoliert die
Modell-Variable sauber.
Direkte Implikation fuer OpenClaw:
- Sub-Task-spezifisches Coding-Routing (Kimi vs GLM je nach Task)
- Ensemble-Kandidaten: Kimi K2.7 + GLM-5.2 in Coding-Panels
- Real-World-Validierung statt nur Standard-Benchmarks fuer Production-
Pfade
- Hermes Agent als alternatives Agent-Framework zu AutoGen/CrewAI
Aenderungen:
- raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md (neu)
- wiki/concepts/real-world-coding-showdown.md (neu)
- wiki/tools/kimi-k2.7-code.md (Cross-References)
- wiki/architecture/model-routing.md (neue Sektion Coding-Modelle)
- wiki/index.md (neuer Concepts-Eintrag + Raw Sources-Eintrag)
- wiki/log.md (Eintrag)
Maximale Verlinkung gemaess AGENTS.md-Kardinalregel:
- 12 externe Verweise auf Modelle (Kimi, GLM, Hermes, Ollama, Z.ai)
- 9 Benchmark-/Methoden-Links (SWE-bench, HumanEval, MBPP, MCP, etc.)
- 7 Fahd-Mirza-Links (YT, Blog, LinkedIn, Substack, Ko-Fi)
- 5 Wiki-Cross-References (fusion, ai-agents, kimi-k2.7, model-routing, behavior-persistence)
2026-06-15 09:45:38 +02:00
## Externe Ressourcen
### Video & Autor
- [YouTube: Kimi K2.7 vs GLM-5.2 Real Coding Showdown ](https://www.youtube.com/watch?v=X8C2CKMAYc0 )
- [Fahd Mirza YouTube Channel ](https://www.youtube.com/@fahdmirza )
- [Fahd Mirza Blog ](https://www.fahdmirza.com/ )
- [Fahd Mirza LinkedIn ](https://www.linkedin.com/in/fahdmirza/ )
- [Fahd Mirza Substack (Weekly AI Newsletter) ](https://fahadmirza.substack.com/ )
- [Fahd Mirza Ko-Fi ](https://ko-fi.com/fahdmirza )
### Modelle
- [Moonshot AI ](https://www.moonshot.cn/ ) — Hersteller Kimi
- [Zhipu AI / Z.ai ](https://z.ai/ ) — Hersteller GLM
- [GLM-5.2 auf chat.z.ai ](https://chat.z.ai ) — kostenloser Zugang
- [GLM-5 Open-Source Guide (nxcode.io) ](https://www.nxcode.io/resources/news/glm-5-open-source-744b-model-complete-guide-2026 )
feat: people-pages for all TODO institutions markers
- Created 27 new people-pages for all TODO-marked persons
- Replaced all TODO: people-page markers with wiki-links in institutions
- Cross-referenced back to institutions from each people-page
- 0 TODO markers remaining
New people-pages:
shayne-coplan, jim-zemlin, wang-changhu, yang-bingyang, demis-hassabis,
clement-delangue, thomas-kurian, fei-fei-li, christopher-manning,
sam-altman, ilya-sutskever, moritz-kaminski, elon-musk, nicolas-burtey,
elizabeth-stark, olaoluwa-osuntokun, jan-leike, oren-etzioni,
ali-farhadi, jaime-sevilla, max-tegmark, daniela-rus, jared-kaplan,
alex-atallah, andrew-moore, tuomas-sandholm, mitchell-baker
2026-06-25 21:44:25 +02:00
- [Ollama Cloud (Kimi K2.7) ](https://ollama.com/library/kimi-k2.7-code ) — siehe [[../../tools/kimi-k2.7-code.md]]
ingest(youtube): fahd-mirza-kimi-k2.7-vs-glm-5.2
Fahd Mirza Head-to-Head in Hermes Agent (14.06.2026, 14 Min, 2659 views,
89 likes). Beide Modelle bekommen denselben Prompt, loesen denselben
Real-World-Task: Flask-App mit gepflanztem FIFA-Bug + Round-of-32-
Bracket-Feature mit Anti-Group-Rematch-Regel.
Test 1: Beide bestehen. Kimi schneller (~5 Min), innovativer
(zusaetzliche Progression-Previews). GLM: 97 tool calls, laenger.
Test 2 (Creative HTML, Siberian Wind): GLM staerker bei Animation +
Terrain-Detail; Kimi bei Stats + Geographie.
Konzept: Real-World-Showdown als Benchmark-Alternative zu statischen
Tests (HumanEval, MBPP, SWE-bench). Agent-Framework isoliert die
Modell-Variable sauber.
Direkte Implikation fuer OpenClaw:
- Sub-Task-spezifisches Coding-Routing (Kimi vs GLM je nach Task)
- Ensemble-Kandidaten: Kimi K2.7 + GLM-5.2 in Coding-Panels
- Real-World-Validierung statt nur Standard-Benchmarks fuer Production-
Pfade
- Hermes Agent als alternatives Agent-Framework zu AutoGen/CrewAI
Aenderungen:
- raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md (neu)
- wiki/concepts/real-world-coding-showdown.md (neu)
- wiki/tools/kimi-k2.7-code.md (Cross-References)
- wiki/architecture/model-routing.md (neue Sektion Coding-Modelle)
- wiki/index.md (neuer Concepts-Eintrag + Raw Sources-Eintrag)
- wiki/log.md (Eintrag)
Maximale Verlinkung gemaess AGENTS.md-Kardinalregel:
- 12 externe Verweise auf Modelle (Kimi, GLM, Hermes, Ollama, Z.ai)
- 9 Benchmark-/Methoden-Links (SWE-bench, HumanEval, MBPP, MCP, etc.)
- 7 Fahd-Mirza-Links (YT, Blog, LinkedIn, Substack, Ko-Fi)
- 5 Wiki-Cross-References (fusion, ai-agents, kimi-k2.7, model-routing, behavior-persistence)
2026-06-15 09:45:38 +02:00
- [Open LLM Leaderboard (HuggingFace) ](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard )
### Hermes Agent
- [Hermes Agent GitHub (NousResearch) ](https://github.com/nousresearch/hermes-agent )
- [Hermes Agent Documentation ](https://hermes-agent.nousresearch.com/docs/ )
- [Nous Research ](https://nousresearch.com/ )
2026-06-22 13:34:01 +02:00
- [[../../tools/hermes-desktop.md]] — Offizielle Hermes Desktop App (Juni 2026)
ingest(youtube): fahd-mirza-kimi-k2.7-vs-glm-5.2
Fahd Mirza Head-to-Head in Hermes Agent (14.06.2026, 14 Min, 2659 views,
89 likes). Beide Modelle bekommen denselben Prompt, loesen denselben
Real-World-Task: Flask-App mit gepflanztem FIFA-Bug + Round-of-32-
Bracket-Feature mit Anti-Group-Rematch-Regel.
Test 1: Beide bestehen. Kimi schneller (~5 Min), innovativer
(zusaetzliche Progression-Previews). GLM: 97 tool calls, laenger.
Test 2 (Creative HTML, Siberian Wind): GLM staerker bei Animation +
Terrain-Detail; Kimi bei Stats + Geographie.
Konzept: Real-World-Showdown als Benchmark-Alternative zu statischen
Tests (HumanEval, MBPP, SWE-bench). Agent-Framework isoliert die
Modell-Variable sauber.
Direkte Implikation fuer OpenClaw:
- Sub-Task-spezifisches Coding-Routing (Kimi vs GLM je nach Task)
- Ensemble-Kandidaten: Kimi K2.7 + GLM-5.2 in Coding-Panels
- Real-World-Validierung statt nur Standard-Benchmarks fuer Production-
Pfade
- Hermes Agent als alternatives Agent-Framework zu AutoGen/CrewAI
Aenderungen:
- raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md (neu)
- wiki/concepts/real-world-coding-showdown.md (neu)
- wiki/tools/kimi-k2.7-code.md (Cross-References)
- wiki/architecture/model-routing.md (neue Sektion Coding-Modelle)
- wiki/index.md (neuer Concepts-Eintrag + Raw Sources-Eintrag)
- wiki/log.md (Eintrag)
Maximale Verlinkung gemaess AGENTS.md-Kardinalregel:
- 12 externe Verweise auf Modelle (Kimi, GLM, Hermes, Ollama, Z.ai)
- 9 Benchmark-/Methoden-Links (SWE-bench, HumanEval, MBPP, MCP, etc.)
- 7 Fahd-Mirza-Links (YT, Blog, LinkedIn, Substack, Ko-Fi)
- 5 Wiki-Cross-References (fusion, ai-agents, kimi-k2.7, model-routing, behavior-persistence)
2026-06-15 09:45:38 +02:00
### Coding-Benchmarks & Methoden
- [SWE-bench (Real-World Software Engineering) ](https://www.swebench.com/ ) — Real-World-Standard
- [HumanEval (OpenAI) ](https://github.com/openai/human-eval )
- [MBPP (Google Research) ](https://github.com/google-research/mbpp )
- [RealWorldEval (M-A-P) ](https://github.com/M-A-P/RealWorldEval )
- [MCP (Model Context Protocol) ](https://modelcontextprotocol.io/ ) — Standard für Tool-Calls
- [Aider Benchmark Suite ](https://aider.chat/docs/benchmarks.html ) — Coding-Agent-Benchmarks