Fahd Mirza Head-to-Head in Hermes Agent (14.06.2026, 14 Min, 2659 views, 89 likes). Beide Modelle bekommen denselben Prompt, loesen denselben Real-World-Task: Flask-App mit gepflanztem FIFA-Bug + Round-of-32- Bracket-Feature mit Anti-Group-Rematch-Regel. Test 1: Beide bestehen. Kimi schneller (~5 Min), innovativer (zusaetzliche Progression-Previews). GLM: 97 tool calls, laenger. Test 2 (Creative HTML, Siberian Wind): GLM staerker bei Animation + Terrain-Detail; Kimi bei Stats + Geographie. Konzept: Real-World-Showdown als Benchmark-Alternative zu statischen Tests (HumanEval, MBPP, SWE-bench). Agent-Framework isoliert die Modell-Variable sauber. Direkte Implikation fuer OpenClaw: - Sub-Task-spezifisches Coding-Routing (Kimi vs GLM je nach Task) - Ensemble-Kandidaten: Kimi K2.7 + GLM-5.2 in Coding-Panels - Real-World-Validierung statt nur Standard-Benchmarks fuer Production- Pfade - Hermes Agent als alternatives Agent-Framework zu AutoGen/CrewAI Aenderungen: - raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md (neu) - wiki/concepts/real-world-coding-showdown.md (neu) - wiki/tools/kimi-k2.7-code.md (Cross-References) - wiki/architecture/model-routing.md (neue Sektion Coding-Modelle) - wiki/index.md (neuer Concepts-Eintrag + Raw Sources-Eintrag) - wiki/log.md (Eintrag) Maximale Verlinkung gemaess AGENTS.md-Kardinalregel: - 12 externe Verweise auf Modelle (Kimi, GLM, Hermes, Ollama, Z.ai) - 9 Benchmark-/Methoden-Links (SWE-bench, HumanEval, MBPP, MCP, etc.) - 7 Fahd-Mirza-Links (YT, Blog, LinkedIn, Substack, Ko-Fi) - 5 Wiki-Cross-References (fusion, ai-agents, kimi-k2.7, model-routing, behavior-persistence)
8.7 KiB
| type | source_url | retrieved | channel | duration_sec | has_transcript | tags | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| youtube | https://www.youtube.com/watch?v=X8C2CKMAYc0 | 2026-06-15 | Fahd Mirza | 840 | true |
|
Kimi K2.7 vs GLM-5.2: Real Coding Showdown in Hermes Agent
Geteilt von: @PWeber (Pit Weber / Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic
Quelle
- Titel: Kimi K2.7 vs GLM-5.2: Real Coding Showdown in Hermes Agent
- Channel: Fahd Mirza
- Hochgeladen: 2026-06-14
- Länge: 14:00
- Aufrufe: 2659 | Likes: 89
- URL: https://www.youtube.com/watch?v=X8C2CKMAYc0
- Beschreibung: "GLM-5.2 vs Kimi K2.7 going head to head on real coding tasks, live in the Hermes Agent."
- Tags: #kimik27 #glm52
Konzept: Real-World Agentic Coding Comparison
Ein empirischer Showdown zwischen zwei starken Open-Source-Coding-Modellen aus China, durchgeführt in einem echten Anwendungskontext (kein Toy-Benchmark, keine statischen Tests). Beide Modelle erhalten denselben Prompt in derselben Agent-Umgebung (Hermes Agent).
Methodische Stärke: Statt Standard-Benchmarks wird ein funktionales, nicht-triviales Web-App mit echtem Bug + Feature-Anforderung verwendet. Bewertung erfolgt anhand von:
- Korrektheit der Bug-Fix (FIFA-Regel-konformes Ranking)
- Vollständigkeit des neuen Features (Round-of-32-Bracket mit Anti-Group-Rematch-Regel)
- Inferenz-Zeit und Anzahl der Tool-Calls
- Kreativität / Innovation (Eigeninitiative über die Anforderung hinaus)
Die zwei Modelle
| Eigenschaft | Kimi K2.7 Code | GLM-5.2 |
|---|---|---|
| Hersteller | Moonshot AI | Zhipu AI (Z.ai / Jiefu) |
| Parameter | ~1T (1.04T) | 744B |
| Aktive Parameter | 32B (MoE) | Full |
| Architektur | Mixture-of-Experts | Dense |
| Kontext | 256K Tokens | 1M Tokens |
| Lizenz | Open | MIT (Open Weights, ab nächster Woche im Video-Zeitpunkt) |
| Tool-Calls (Test 1) | mehr (länger) | 97 |
| Test-1 Zeit | ~5 Min | länger |
Existierende Wiki-Referenz: Kimi K2.7 Code (von Moonshot AI, auf Ollama Cloud verfügbar)
Test 1: Bug-Fix + Feature-Build (World Cup 2026 Tracker)
Setup: Flask-App mit DB, CRUD, "hundreds of files". Gepflanzter Bug: Round-of-32-Ranking der besten Drittplatzierten ignoriert Goal Difference (Ghana mit 0 schlechter als Ecuador mit -3, sollte aber weiterkommen).
Zusatz-Feature: Round-of-32-Bracket bauen — 16 Matchups, gesetzt aus Final Standings, Group-Winner auf starker Seite, kein Team spielt gegen einen aus seiner eigenen Gruppe.
Ergebnis
| Kriterium | Kimi K2.7 | GLM-5.2 |
|---|---|---|
| Bug-Fix korrekt (Ghana statt Ecuador) | ✅ | ✅ |
| Round-of-32-Bracket | ✅ | ✅ |
| Anti-Group-Rematch-Regel | ✅ | ✅ |
| Tool-Calls | mehr | 97 |
| Zeit | ~5 Min (schneller) | länger |
| Innovation | + (zusätzliche "Future-Progression"-Features) | – |
Mirzas Fazit Test 1: Beide bestehen, Kimi hat die Nase vorn durch weniger Zeit + Innovation (Eigeninitiative beim Bracket-Design).
Test 2: Single-File Creative HTML (Siberian Cold Wind)
Prompt (an beide identisch): "Build a single self-contained HTML file, no libraries, that simulates a Siberian cold wind traveling from Lake Baikal down to Murree Hills in Pakistan. Animated particle system, live map."
Ergebnis
| Kriterium | Kimi K2.7 | GLM-5.2 |
|---|---|---|
| File generated | ✅ | ✅ |
| Geographie korrekt (Baikal → Zentralasien → Afghanistan → Pakistan) | ✅ | ✅ |
| Live-Stats (Wind, Nearest City) | ✅ | ✅ |
| Animation/Simulation sichtbar | ⚠️ sehr schwach | ✅ sichtbar (besser) |
| Terrain-Detail | ❌ "very plain" | ✅ sichtbar |
Mirzas Fazit Test 2: GLM schlägt Kimi bei kreativer Single-Shot-Generation mit Animation.
Gesamtfazit Mirza: "Both models are neck to neck. Test on your own use case." (Vorsicht vor subjektiver Bewertung.)
Wichtige Lessons aus dem Video
1. Agent-Frameworks machen den Unterschied
Beide Modelle laufen im selben Hermes Agent von Nous Research — der "self-improving AI agent with built-in learning loop". Das isoliert die Modell-Variable: der Vergleich misst tatsächlich Modell-Qualität im Agent-Use-Case, nicht Agent-Framework-Qualität.
→ OpenClaw-Implikation: OpenClaw's eigene Agent-Architektur (concepts/ai-agents-2026.md) könnte ebenfalls von solch head-to-head-Tests profitieren — welches Modell ist für welche Sub-Tasks im OpenClaw-Setup am besten?
2. Benchmarks ≠ Real-World
Die Kimi-K2.7-Benchmarks im Wiki (tools/kimi-k2.7-code.md) zeigen Kimi unter GPT-5.5 und Claude Opus 4.8. Im Real-World-Test (Bug-Fix + Feature in 5 Min) sieht das Bild anders aus — Kimi ist schneller und innovativer als erwartet, GLM-5.2 (nicht in der Tabelle) zeigt dafür kreative Stärke.
→ OpenClaw-Implikation: Benchmarks (Program Bench, MCP Mark Verified) sind eine Approximation. Production-Pfade sollten mit realen Tasks validiert werden, nicht nur mit Standard-Benchmarks.
3. Open-Source-Vielfalt aus China
Sowohl Kimi K2.7 (Moonshot AI) als auch GLM-5.2 (Zhipu AI) sind starke, agentisch nutzbare Open-Source-Modelle aus China mit unterschiedlichen Architekturen (MoE vs Dense) und Trade-offs (Speed vs Detail).
→ Direkt relevant für concepts/llm-model-fusion-ensembles.md (OpenRouter Fusion): Kimi K2.6 war bereits im Budget-Panel-Experiment, Kimi K2.7 ist die nächste Generation; GLM-5.2 wäre ein neuer Panel-Kandidat. Die strukturelle Botschaft: Es gibt in 2026 mehrere konkurrenzfähige Open-Coding-Modelle, die für Ensembles in Frage kommen.
4. Anti-Group-Rematch als nicht-trivialer Test
Die Regel "kein Team spielt gegen einen aus seiner eigenen Gruppe" ist eine Constraint-Satisfaction-Logik, die viele LLMs falsch machen. Beide Modelle bestehen — was positiv für beide ist, aber auch zeigt, dass solche "nicht-offensichtlichen" Constraints ein guter Real-World-Test sind.
Verwandte Wiki-Seiten
- concepts/llm-model-fusion-ensembles.md — Kimi K2.6 im Budget-Panel, Kimi K2.7 wäre direkter Nachfolger
- concepts/ai-agents-2026.md — Agent-Frameworks; Hermes Agent als alternatives Agent-Framework
- concepts/llm-behavior-persistence.md — komplementär: Verhalten einzelner Modelle vs. Verhalten in Agent-Workflows
- tools/kimi-k2.7-code.md — existierende Wiki-Seite zu Kimi K2.7 Code (Benchmarks, Ollama Cloud)
- tools/anthropic-claude.md — Konkurrenz-Kontext (Frontier vs Open-Source)
- concepts/llm-knowledge-base.md — Kuratierte Strukturen schlagen reine Inference (auch im Coding-Bereich)
Externe Ressourcen
Modelle
- Fahd Mirza YouTube Channel — Autor
- Fahd Mirza Blog
- Fahd Mirza LinkedIn
- Fahd Mirza Substack (Weekly AI Newsletter)
- Kimi K2.7 Code (Ollama Cloud) — siehe existierende Wiki-Seite tools/kimi-k2.7-code.md
- Moonshot AI — Hersteller Kimi
- Zhipu AI / Z.ai — Hersteller GLM
- GLM-5.2 auf chat.z.ai — kostenloser Zugang (Stand: Video, MIT-Lizenz für Open Weights)
- GLM Coding Plan — API-Pricing
- GLM-5 744B Open-Source Guide (nxcode.io)
Hermes Agent (Test-Framework)
Verwandte Coding-Benchmarks & Methoden
- SWE-bench (Real-World Software Engineering Benchmark)
- HumanEval (OpenAI)
- MBPP (Mostly Basic Python Problems)
- Kimi Code Bench v2 — siehe existierende Wiki-Seite
- RealWorldEval (M-A-P)
- MCP (Model Context Protocol) Spec — relevant für Tool-Calls in Coding-Agents