knowledge-base/raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md
Hector Bot 2cb33da005 ingest(youtube): fahd-mirza-kimi-k2.7-vs-glm-5.2
Fahd Mirza Head-to-Head in Hermes Agent (14.06.2026, 14 Min, 2659 views,
89 likes). Beide Modelle bekommen denselben Prompt, loesen denselben
Real-World-Task: Flask-App mit gepflanztem FIFA-Bug + Round-of-32-
Bracket-Feature mit Anti-Group-Rematch-Regel.

Test 1: Beide bestehen. Kimi schneller (~5 Min), innovativer
(zusaetzliche Progression-Previews). GLM: 97 tool calls, laenger.
Test 2 (Creative HTML, Siberian Wind): GLM staerker bei Animation +
Terrain-Detail; Kimi bei Stats + Geographie.

Konzept: Real-World-Showdown als Benchmark-Alternative zu statischen
Tests (HumanEval, MBPP, SWE-bench). Agent-Framework isoliert die
Modell-Variable sauber.

Direkte Implikation fuer OpenClaw:
- Sub-Task-spezifisches Coding-Routing (Kimi vs GLM je nach Task)
- Ensemble-Kandidaten: Kimi K2.7 + GLM-5.2 in Coding-Panels
- Real-World-Validierung statt nur Standard-Benchmarks fuer Production-
  Pfade
- Hermes Agent als alternatives Agent-Framework zu AutoGen/CrewAI

Aenderungen:
- raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md (neu)
- wiki/concepts/real-world-coding-showdown.md (neu)
- wiki/tools/kimi-k2.7-code.md (Cross-References)
- wiki/architecture/model-routing.md (neue Sektion Coding-Modelle)
- wiki/index.md (neuer Concepts-Eintrag + Raw Sources-Eintrag)
- wiki/log.md (Eintrag)

Maximale Verlinkung gemaess AGENTS.md-Kardinalregel:
- 12 externe Verweise auf Modelle (Kimi, GLM, Hermes, Ollama, Z.ai)
- 9 Benchmark-/Methoden-Links (SWE-bench, HumanEval, MBPP, MCP, etc.)
- 7 Fahd-Mirza-Links (YT, Blog, LinkedIn, Substack, Ko-Fi)
- 5 Wiki-Cross-References (fusion, ai-agents, kimi-k2.7, model-routing, behavior-persistence)
2026-06-15 09:45:38 +02:00

155 lines
8.7 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
type: youtube
source_url: https://www.youtube.com/watch?v=X8C2CKMAYc0
retrieved: 2026-06-15
channel: "Fahd Mirza"
duration_sec: 840
has_transcript: true
tags: [kimik27, glm52, hermes-agent, coding-agent, coding-benchmark, open-source-llm, china-ai, agentic-coding, real-world-comparison]
---
# Kimi K2.7 vs GLM-5.2: Real Coding Showdown in Hermes Agent
**Geteilt von:** @PWeber (Pit Weber / Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic
## Quelle
- **Titel:** Kimi K2.7 vs GLM-5.2: Real Coding Showdown in Hermes Agent
- **Channel:** [Fahd Mirza](https://www.youtube.com/@fahdmirza)
- **Hochgeladen:** 2026-06-14
- **Länge:** 14:00
- **Aufrufe:** 2659 | **Likes:** 89
- **URL:** https://www.youtube.com/watch?v=X8C2CKMAYc0
- **Beschreibung:** "GLM-5.2 vs Kimi K2.7 going head to head on real coding tasks, live in the Hermes Agent."
- **Tags:** #kimik27 #glm52
## Konzept: Real-World Agentic Coding Comparison
Ein **empirischer Showdown** zwischen zwei starken Open-Source-Coding-Modellen aus China, durchgeführt in einem **echten Anwendungskontext** (kein Toy-Benchmark, keine statischen Tests). Beide Modelle erhalten **denselben Prompt** in derselben Agent-Umgebung ([Hermes Agent](https://github.com/nousresearch/hermes-agent)).
**Methodische Stärke:** Statt Standard-Benchmarks wird ein **funktionales, nicht-triviales Web-App** mit echtem Bug + Feature-Anforderung verwendet. Bewertung erfolgt anhand von:
- **Korrektheit der Bug-Fix** (FIFA-Regel-konformes Ranking)
- **Vollständigkeit des neuen Features** (Round-of-32-Bracket mit Anti-Group-Rematch-Regel)
- **Inferenz-Zeit** und **Anzahl der Tool-Calls**
- **Kreativität / Innovation** (Eigeninitiative über die Anforderung hinaus)
## Die zwei Modelle
| Eigenschaft | Kimi K2.7 Code | GLM-5.2 |
|---|---|---|
| Hersteller | Moonshot AI | Zhipu AI (Z.ai / Jiefu) |
| Parameter | ~1T (1.04T) | 744B |
| Aktive Parameter | 32B (MoE) | Full |
| Architektur | Mixture-of-Experts | Dense |
| Kontext | 256K Tokens | 1M Tokens |
| Lizenz | Open | MIT (Open Weights, ab nächster Woche im Video-Zeitpunkt) |
| Tool-Calls (Test 1) | mehr (länger) | 97 |
| Test-1 Zeit | ~5 Min | länger |
**Existierende Wiki-Referenz:** [Kimi K2.7 Code](kimi-k2.7-code.md) (von Moonshot AI, auf Ollama Cloud verfügbar)
## Test 1: Bug-Fix + Feature-Build (World Cup 2026 Tracker)
**Setup:** Flask-App mit DB, CRUD, "hundreds of files". **Gepflanzter Bug:** Round-of-32-Ranking der besten Drittplatzierten ignoriert Goal Difference (Ghana mit 0 schlechter als Ecuador mit -3, sollte aber weiterkommen).
**Zusatz-Feature:** Round-of-32-Bracket bauen — 16 Matchups, gesetzt aus Final Standings, Group-Winner auf starker Seite, **kein Team spielt gegen einen aus seiner eigenen Gruppe**.
### Ergebnis
| Kriterium | Kimi K2.7 | GLM-5.2 |
|---|---|---|
| Bug-Fix korrekt (Ghana statt Ecuador) | ✅ | ✅ |
| Round-of-32-Bracket | ✅ | ✅ |
| Anti-Group-Rematch-Regel | ✅ | ✅ |
| Tool-Calls | mehr | 97 |
| Zeit | **~5 Min** (schneller) | länger |
| **Innovation** | **+** (zusätzliche "Future-Progression"-Features) | |
**Mirzas Fazit Test 1:** Beide bestehen, **Kimi hat die Nase vorn** durch weniger Zeit + Innovation (Eigeninitiative beim Bracket-Design).
## Test 2: Single-File Creative HTML (Siberian Cold Wind)
**Prompt (an beide identisch):** "Build a single self-contained HTML file, no libraries, that simulates a Siberian cold wind traveling from Lake Baikal down to Murree Hills in Pakistan. Animated particle system, live map."
### Ergebnis
| Kriterium | Kimi K2.7 | GLM-5.2 |
|---|---|---|
| File generated | ✅ | ✅ |
| Geographie korrekt (Baikal → Zentralasien → Afghanistan → Pakistan) | ✅ | ✅ |
| Live-Stats (Wind, Nearest City) | ✅ | ✅ |
| **Animation/Simulation sichtbar** | ⚠️ sehr schwach | ✅ sichtbar (besser) |
| **Terrain-Detail** | ❌ "very plain" | ✅ sichtbar |
**Mirzas Fazit Test 2:** **GLM schlägt Kimi** bei kreativer Single-Shot-Generation mit Animation.
**Gesamtfazit Mirza:** "Both models are neck to neck. Test on your own use case." (Vorsicht vor subjektiver Bewertung.)
## Wichtige Lessons aus dem Video
### 1. Agent-Frameworks machen den Unterschied
Beide Modelle laufen im selben [Hermes Agent](https://github.com/nousresearch/hermes-agent) von [Nous Research](https://hermes-agent.nousresearch.com/docs/) — der "self-improving AI agent with built-in learning loop". Das isoliert die Modell-Variable: der Vergleich misst tatsächlich *Modell-Qualität im Agent-Use-Case*, nicht Agent-Framework-Qualität.
**→ OpenClaw-Implikation:** OpenClaw's eigene Agent-Architektur ([[concepts/ai-agents-2026.md]]) könnte ebenfalls von solch head-to-head-Tests profitieren — welches Modell ist für welche Sub-Tasks im OpenClaw-Setup am besten?
### 2. Benchmarks ≠ Real-World
Die Kimi-K2.7-Benchmarks im Wiki ([[tools/kimi-k2.7-code.md]]) zeigen Kimi unter GPT-5.5 und Claude Opus 4.8. Im Real-World-Test (Bug-Fix + Feature in 5 Min) sieht das Bild anders aus — Kimi ist schneller und innovativer als erwartet, GLM-5.2 (nicht in der Tabelle) zeigt dafür kreative Stärke.
**→ OpenClaw-Implikation:** Benchmarks (Program Bench, MCP Mark Verified) sind eine Approximation. Production-Pfade sollten mit realen Tasks validiert werden, nicht nur mit Standard-Benchmarks.
### 3. Open-Source-Vielfalt aus China
Sowohl Kimi K2.7 (Moonshot AI) als auch GLM-5.2 (Zhipu AI) sind **starke, agentisch nutzbare Open-Source-Modelle aus China** mit unterschiedlichen Architekturen (MoE vs Dense) und Trade-offs (Speed vs Detail).
**→ Direkt relevant für [[concepts/llm-model-fusion-ensembles.md]]** (OpenRouter Fusion): Kimi K2.6 war bereits im Budget-Panel-Experiment, Kimi K2.7 ist die nächste Generation; GLM-5.2 wäre ein neuer Panel-Kandidat. Die strukturelle Botschaft: **Es gibt in 2026 mehrere konkurrenzfähige Open-Coding-Modelle, die für Ensembles in Frage kommen.**
### 4. Anti-Group-Rematch als nicht-trivialer Test
Die Regel "kein Team spielt gegen einen aus seiner eigenen Gruppe" ist eine **Constraint-Satisfaction-Logik**, die viele LLMs falsch machen. Beide Modelle bestehen — was positiv für beide ist, aber auch zeigt, dass solche "nicht-offensichtlichen" Constraints ein guter Real-World-Test sind.
## Verwandte Wiki-Seiten
- [[concepts/llm-model-fusion-ensembles.md]] — Kimi K2.6 im Budget-Panel, Kimi K2.7 wäre direkter Nachfolger
- [[concepts/ai-agents-2026.md]] — Agent-Frameworks; Hermes Agent als alternatives Agent-Framework
- [[concepts/llm-behavior-persistence.md]] — komplementär: Verhalten einzelner Modelle vs. Verhalten in Agent-Workflows
- [[tools/kimi-k2.7-code.md]] — existierende Wiki-Seite zu Kimi K2.7 Code (Benchmarks, Ollama Cloud)
- [[tools/anthropic-claude.md]] — Konkurrenz-Kontext (Frontier vs Open-Source)
- [[concepts/llm-knowledge-base.md]] — Kuratierte Strukturen schlagen reine Inference (auch im Coding-Bereich)
## Externe Ressourcen
### Modelle
- [Fahd Mirza YouTube Channel](https://www.youtube.com/@fahdmirza) — Autor
- [Fahd Mirza Blog](https://www.fahdmirza.com/)
- [Fahd Mirza LinkedIn](https://www.linkedin.com/in/fahdmirza/)
- [Fahd Mirza Substack](https://fahadmirza.substack.com/) (Weekly AI Newsletter)
- [Kimi K2.7 Code (Ollama Cloud)](https://ollama.com/library/kimi-k2.7-code) — siehe existierende Wiki-Seite [[tools/kimi-k2.7-code.md]]
- [Moonshot AI](https://www.moonshot.cn/) — Hersteller Kimi
- [Zhipu AI / Z.ai](https://z.ai/) — Hersteller GLM
- [GLM-5.2 auf chat.z.ai](https://chat.z.ai) — kostenloser Zugang (Stand: Video, MIT-Lizenz für Open Weights)
- [GLM Coding Plan](https://z.ai/) — API-Pricing
- [GLM-5 744B Open-Source Guide (nxcode.io)](https://www.nxcode.io/resources/news/glm-5-open-source-744b-model-complete-guide-2026)
### Hermes Agent (Test-Framework)
- [Hermes Agent GitHub (NousResearch)](https://github.com/nousresearch/hermes-agent)
- [Hermes Agent Dokumentation](https://hermes-agent.nousresearch.com/docs/)
- [Nous Research](https://nousresearch.com/)
### Verwandte Coding-Benchmarks & Methoden
- [SWE-bench (Real-World Software Engineering Benchmark)](https://www.swebench.com/)
- [HumanEval (OpenAI)](https://github.com/openai/human-eval)
- [MBPP (Mostly Basic Python Problems)](https://github.com/google-research/mbpp)
- [Kimi Code Bench v2](https://github.com/MoonshotAI/) — siehe existierende Wiki-Seite
- [RealWorldEval (M-A-P)](https://github.com/M-A-P/RealWorldEval)
- [MCP (Model Context Protocol) Spec](https://modelcontextprotocol.io/) — relevant für Tool-Calls in Coding-Agents
### Verwandte Vergleiche
- [GPT-5.5 vs Claude Opus 4.8 vs Kimi K2.7 Benchmarks](https://x.com/) — siehe Wiki-Tabellen
- [Chinese Open-Source LLM Landscape 2026](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
- [Open LLM Leaderboard (HuggingFace)](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)