Fahd Mirza Head-to-Head in Hermes Agent (14.06.2026, 14 Min, 2659 views, 89 likes). Beide Modelle bekommen denselben Prompt, loesen denselben Real-World-Task: Flask-App mit gepflanztem FIFA-Bug + Round-of-32- Bracket-Feature mit Anti-Group-Rematch-Regel. Test 1: Beide bestehen. Kimi schneller (~5 Min), innovativer (zusaetzliche Progression-Previews). GLM: 97 tool calls, laenger. Test 2 (Creative HTML, Siberian Wind): GLM staerker bei Animation + Terrain-Detail; Kimi bei Stats + Geographie. Konzept: Real-World-Showdown als Benchmark-Alternative zu statischen Tests (HumanEval, MBPP, SWE-bench). Agent-Framework isoliert die Modell-Variable sauber. Direkte Implikation fuer OpenClaw: - Sub-Task-spezifisches Coding-Routing (Kimi vs GLM je nach Task) - Ensemble-Kandidaten: Kimi K2.7 + GLM-5.2 in Coding-Panels - Real-World-Validierung statt nur Standard-Benchmarks fuer Production- Pfade - Hermes Agent als alternatives Agent-Framework zu AutoGen/CrewAI Aenderungen: - raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md (neu) - wiki/concepts/real-world-coding-showdown.md (neu) - wiki/tools/kimi-k2.7-code.md (Cross-References) - wiki/architecture/model-routing.md (neue Sektion Coding-Modelle) - wiki/index.md (neuer Concepts-Eintrag + Raw Sources-Eintrag) - wiki/log.md (Eintrag) Maximale Verlinkung gemaess AGENTS.md-Kardinalregel: - 12 externe Verweise auf Modelle (Kimi, GLM, Hermes, Ollama, Z.ai) - 9 Benchmark-/Methoden-Links (SWE-bench, HumanEval, MBPP, MCP, etc.) - 7 Fahd-Mirza-Links (YT, Blog, LinkedIn, Substack, Ko-Fi) - 5 Wiki-Cross-References (fusion, ai-agents, kimi-k2.7, model-routing, behavior-persistence)
155 lines
8.7 KiB
Markdown
155 lines
8.7 KiB
Markdown
---
|
||
type: youtube
|
||
source_url: https://www.youtube.com/watch?v=X8C2CKMAYc0
|
||
retrieved: 2026-06-15
|
||
channel: "Fahd Mirza"
|
||
duration_sec: 840
|
||
has_transcript: true
|
||
tags: [kimik27, glm52, hermes-agent, coding-agent, coding-benchmark, open-source-llm, china-ai, agentic-coding, real-world-comparison]
|
||
---
|
||
|
||
# Kimi K2.7 vs GLM-5.2: Real Coding Showdown in Hermes Agent
|
||
|
||
**Geteilt von:** @PWeber (Pit Weber / Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic
|
||
|
||
## Quelle
|
||
|
||
- **Titel:** Kimi K2.7 vs GLM-5.2: Real Coding Showdown in Hermes Agent
|
||
- **Channel:** [Fahd Mirza](https://www.youtube.com/@fahdmirza)
|
||
- **Hochgeladen:** 2026-06-14
|
||
- **Länge:** 14:00
|
||
- **Aufrufe:** 2659 | **Likes:** 89
|
||
- **URL:** https://www.youtube.com/watch?v=X8C2CKMAYc0
|
||
- **Beschreibung:** "GLM-5.2 vs Kimi K2.7 going head to head on real coding tasks, live in the Hermes Agent."
|
||
- **Tags:** #kimik27 #glm52
|
||
|
||
## Konzept: Real-World Agentic Coding Comparison
|
||
|
||
Ein **empirischer Showdown** zwischen zwei starken Open-Source-Coding-Modellen aus China, durchgeführt in einem **echten Anwendungskontext** (kein Toy-Benchmark, keine statischen Tests). Beide Modelle erhalten **denselben Prompt** in derselben Agent-Umgebung ([Hermes Agent](https://github.com/nousresearch/hermes-agent)).
|
||
|
||
**Methodische Stärke:** Statt Standard-Benchmarks wird ein **funktionales, nicht-triviales Web-App** mit echtem Bug + Feature-Anforderung verwendet. Bewertung erfolgt anhand von:
|
||
- **Korrektheit der Bug-Fix** (FIFA-Regel-konformes Ranking)
|
||
- **Vollständigkeit des neuen Features** (Round-of-32-Bracket mit Anti-Group-Rematch-Regel)
|
||
- **Inferenz-Zeit** und **Anzahl der Tool-Calls**
|
||
- **Kreativität / Innovation** (Eigeninitiative über die Anforderung hinaus)
|
||
|
||
## Die zwei Modelle
|
||
|
||
| Eigenschaft | Kimi K2.7 Code | GLM-5.2 |
|
||
|---|---|---|
|
||
| Hersteller | Moonshot AI | Zhipu AI (Z.ai / Jiefu) |
|
||
| Parameter | ~1T (1.04T) | 744B |
|
||
| Aktive Parameter | 32B (MoE) | Full |
|
||
| Architektur | Mixture-of-Experts | Dense |
|
||
| Kontext | 256K Tokens | 1M Tokens |
|
||
| Lizenz | Open | MIT (Open Weights, ab nächster Woche im Video-Zeitpunkt) |
|
||
| Tool-Calls (Test 1) | mehr (länger) | 97 |
|
||
| Test-1 Zeit | ~5 Min | länger |
|
||
|
||
**Existierende Wiki-Referenz:** [Kimi K2.7 Code](kimi-k2.7-code.md) (von Moonshot AI, auf Ollama Cloud verfügbar)
|
||
|
||
## Test 1: Bug-Fix + Feature-Build (World Cup 2026 Tracker)
|
||
|
||
**Setup:** Flask-App mit DB, CRUD, "hundreds of files". **Gepflanzter Bug:** Round-of-32-Ranking der besten Drittplatzierten ignoriert Goal Difference (Ghana mit 0 schlechter als Ecuador mit -3, sollte aber weiterkommen).
|
||
|
||
**Zusatz-Feature:** Round-of-32-Bracket bauen — 16 Matchups, gesetzt aus Final Standings, Group-Winner auf starker Seite, **kein Team spielt gegen einen aus seiner eigenen Gruppe**.
|
||
|
||
### Ergebnis
|
||
|
||
| Kriterium | Kimi K2.7 | GLM-5.2 |
|
||
|---|---|---|
|
||
| Bug-Fix korrekt (Ghana statt Ecuador) | ✅ | ✅ |
|
||
| Round-of-32-Bracket | ✅ | ✅ |
|
||
| Anti-Group-Rematch-Regel | ✅ | ✅ |
|
||
| Tool-Calls | mehr | 97 |
|
||
| Zeit | **~5 Min** (schneller) | länger |
|
||
| **Innovation** | **+** (zusätzliche "Future-Progression"-Features) | – |
|
||
|
||
**Mirzas Fazit Test 1:** Beide bestehen, **Kimi hat die Nase vorn** durch weniger Zeit + Innovation (Eigeninitiative beim Bracket-Design).
|
||
|
||
## Test 2: Single-File Creative HTML (Siberian Cold Wind)
|
||
|
||
**Prompt (an beide identisch):** "Build a single self-contained HTML file, no libraries, that simulates a Siberian cold wind traveling from Lake Baikal down to Murree Hills in Pakistan. Animated particle system, live map."
|
||
|
||
### Ergebnis
|
||
|
||
| Kriterium | Kimi K2.7 | GLM-5.2 |
|
||
|---|---|---|
|
||
| File generated | ✅ | ✅ |
|
||
| Geographie korrekt (Baikal → Zentralasien → Afghanistan → Pakistan) | ✅ | ✅ |
|
||
| Live-Stats (Wind, Nearest City) | ✅ | ✅ |
|
||
| **Animation/Simulation sichtbar** | ⚠️ sehr schwach | ✅ sichtbar (besser) |
|
||
| **Terrain-Detail** | ❌ "very plain" | ✅ sichtbar |
|
||
|
||
**Mirzas Fazit Test 2:** **GLM schlägt Kimi** bei kreativer Single-Shot-Generation mit Animation.
|
||
|
||
**Gesamtfazit Mirza:** "Both models are neck to neck. Test on your own use case." (Vorsicht vor subjektiver Bewertung.)
|
||
|
||
## Wichtige Lessons aus dem Video
|
||
|
||
### 1. Agent-Frameworks machen den Unterschied
|
||
|
||
Beide Modelle laufen im selben [Hermes Agent](https://github.com/nousresearch/hermes-agent) von [Nous Research](https://hermes-agent.nousresearch.com/docs/) — der "self-improving AI agent with built-in learning loop". Das isoliert die Modell-Variable: der Vergleich misst tatsächlich *Modell-Qualität im Agent-Use-Case*, nicht Agent-Framework-Qualität.
|
||
|
||
**→ OpenClaw-Implikation:** OpenClaw's eigene Agent-Architektur ([[concepts/ai-agents-2026.md]]) könnte ebenfalls von solch head-to-head-Tests profitieren — welches Modell ist für welche Sub-Tasks im OpenClaw-Setup am besten?
|
||
|
||
### 2. Benchmarks ≠ Real-World
|
||
|
||
Die Kimi-K2.7-Benchmarks im Wiki ([[tools/kimi-k2.7-code.md]]) zeigen Kimi unter GPT-5.5 und Claude Opus 4.8. Im Real-World-Test (Bug-Fix + Feature in 5 Min) sieht das Bild anders aus — Kimi ist schneller und innovativer als erwartet, GLM-5.2 (nicht in der Tabelle) zeigt dafür kreative Stärke.
|
||
|
||
**→ OpenClaw-Implikation:** Benchmarks (Program Bench, MCP Mark Verified) sind eine Approximation. Production-Pfade sollten mit realen Tasks validiert werden, nicht nur mit Standard-Benchmarks.
|
||
|
||
### 3. Open-Source-Vielfalt aus China
|
||
|
||
Sowohl Kimi K2.7 (Moonshot AI) als auch GLM-5.2 (Zhipu AI) sind **starke, agentisch nutzbare Open-Source-Modelle aus China** mit unterschiedlichen Architekturen (MoE vs Dense) und Trade-offs (Speed vs Detail).
|
||
|
||
**→ Direkt relevant für [[concepts/llm-model-fusion-ensembles.md]]** (OpenRouter Fusion): Kimi K2.6 war bereits im Budget-Panel-Experiment, Kimi K2.7 ist die nächste Generation; GLM-5.2 wäre ein neuer Panel-Kandidat. Die strukturelle Botschaft: **Es gibt in 2026 mehrere konkurrenzfähige Open-Coding-Modelle, die für Ensembles in Frage kommen.**
|
||
|
||
### 4. Anti-Group-Rematch als nicht-trivialer Test
|
||
|
||
Die Regel "kein Team spielt gegen einen aus seiner eigenen Gruppe" ist eine **Constraint-Satisfaction-Logik**, die viele LLMs falsch machen. Beide Modelle bestehen — was positiv für beide ist, aber auch zeigt, dass solche "nicht-offensichtlichen" Constraints ein guter Real-World-Test sind.
|
||
|
||
## Verwandte Wiki-Seiten
|
||
|
||
- [[concepts/llm-model-fusion-ensembles.md]] — Kimi K2.6 im Budget-Panel, Kimi K2.7 wäre direkter Nachfolger
|
||
- [[concepts/ai-agents-2026.md]] — Agent-Frameworks; Hermes Agent als alternatives Agent-Framework
|
||
- [[concepts/llm-behavior-persistence.md]] — komplementär: Verhalten einzelner Modelle vs. Verhalten in Agent-Workflows
|
||
- [[tools/kimi-k2.7-code.md]] — existierende Wiki-Seite zu Kimi K2.7 Code (Benchmarks, Ollama Cloud)
|
||
- [[tools/anthropic-claude.md]] — Konkurrenz-Kontext (Frontier vs Open-Source)
|
||
- [[concepts/llm-knowledge-base.md]] — Kuratierte Strukturen schlagen reine Inference (auch im Coding-Bereich)
|
||
|
||
## Externe Ressourcen
|
||
|
||
### Modelle
|
||
|
||
- [Fahd Mirza YouTube Channel](https://www.youtube.com/@fahdmirza) — Autor
|
||
- [Fahd Mirza Blog](https://www.fahdmirza.com/)
|
||
- [Fahd Mirza LinkedIn](https://www.linkedin.com/in/fahdmirza/)
|
||
- [Fahd Mirza Substack](https://fahadmirza.substack.com/) (Weekly AI Newsletter)
|
||
- [Kimi K2.7 Code (Ollama Cloud)](https://ollama.com/library/kimi-k2.7-code) — siehe existierende Wiki-Seite [[tools/kimi-k2.7-code.md]]
|
||
- [Moonshot AI](https://www.moonshot.cn/) — Hersteller Kimi
|
||
- [Zhipu AI / Z.ai](https://z.ai/) — Hersteller GLM
|
||
- [GLM-5.2 auf chat.z.ai](https://chat.z.ai) — kostenloser Zugang (Stand: Video, MIT-Lizenz für Open Weights)
|
||
- [GLM Coding Plan](https://z.ai/) — API-Pricing
|
||
- [GLM-5 744B Open-Source Guide (nxcode.io)](https://www.nxcode.io/resources/news/glm-5-open-source-744b-model-complete-guide-2026)
|
||
|
||
### Hermes Agent (Test-Framework)
|
||
|
||
- [Hermes Agent GitHub (NousResearch)](https://github.com/nousresearch/hermes-agent)
|
||
- [Hermes Agent Dokumentation](https://hermes-agent.nousresearch.com/docs/)
|
||
- [Nous Research](https://nousresearch.com/)
|
||
|
||
### Verwandte Coding-Benchmarks & Methoden
|
||
|
||
- [SWE-bench (Real-World Software Engineering Benchmark)](https://www.swebench.com/)
|
||
- [HumanEval (OpenAI)](https://github.com/openai/human-eval)
|
||
- [MBPP (Mostly Basic Python Problems)](https://github.com/google-research/mbpp)
|
||
- [Kimi Code Bench v2](https://github.com/MoonshotAI/) — siehe existierende Wiki-Seite
|
||
- [RealWorldEval (M-A-P)](https://github.com/M-A-P/RealWorldEval)
|
||
- [MCP (Model Context Protocol) Spec](https://modelcontextprotocol.io/) — relevant für Tool-Calls in Coding-Agents
|
||
|
||
### Verwandte Vergleiche
|
||
|
||
- [GPT-5.5 vs Claude Opus 4.8 vs Kimi K2.7 Benchmarks](https://x.com/) — siehe Wiki-Tabellen
|
||
- [Chinese Open-Source LLM Landscape 2026](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
|
||
- [Open LLM Leaderboard (HuggingFace)](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
|