156 lines
8.7 KiB
Markdown
156 lines
8.7 KiB
Markdown
|
|
---
|
|||
|
|
type: youtube
|
|||
|
|
source_url: https://www.youtube.com/watch?v=X8C2CKMAYc0
|
|||
|
|
retrieved: 2026-06-15
|
|||
|
|
channel: "Fahd Mirza"
|
|||
|
|
duration_sec: 840
|
|||
|
|
has_transcript: true
|
|||
|
|
tags: [kimik27, glm52, hermes-agent, coding-agent, coding-benchmark, open-source-llm, china-ai, agentic-coding, real-world-comparison]
|
|||
|
|
---
|
|||
|
|
|
|||
|
|
# Kimi K2.7 vs GLM-5.2: Real Coding Showdown in Hermes Agent
|
|||
|
|
|
|||
|
|
**Geteilt von:** @PWeber (Pit Weber / Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic
|
|||
|
|
|
|||
|
|
## Quelle
|
|||
|
|
|
|||
|
|
- **Titel:** Kimi K2.7 vs GLM-5.2: Real Coding Showdown in Hermes Agent
|
|||
|
|
- **Channel:** [Fahd Mirza](https://www.youtube.com/@fahdmirza)
|
|||
|
|
- **Hochgeladen:** 2026-06-14
|
|||
|
|
- **Länge:** 14:00
|
|||
|
|
- **Aufrufe:** 2659 | **Likes:** 89
|
|||
|
|
- **URL:** https://www.youtube.com/watch?v=X8C2CKMAYc0
|
|||
|
|
- **Beschreibung:** "GLM-5.2 vs Kimi K2.7 going head to head on real coding tasks, live in the Hermes Agent."
|
|||
|
|
- **Tags:** #kimik27 #glm52
|
|||
|
|
|
|||
|
|
## Konzept: Real-World Agentic Coding Comparison
|
|||
|
|
|
|||
|
|
Ein **empirischer Showdown** zwischen zwei starken Open-Source-Coding-Modellen aus China, durchgeführt in einem **echten Anwendungskontext** (kein Toy-Benchmark, keine statischen Tests). Beide Modelle erhalten **denselben Prompt** in derselben Agent-Umgebung ([Hermes Agent](https://github.com/nousresearch/hermes-agent)).
|
|||
|
|
|
|||
|
|
**Methodische Stärke:** Statt Standard-Benchmarks wird ein **funktionales, nicht-triviales Web-App** mit echtem Bug + Feature-Anforderung verwendet. Bewertung erfolgt anhand von:
|
|||
|
|
- **Korrektheit der Bug-Fix** (FIFA-Regel-konformes Ranking)
|
|||
|
|
- **Vollständigkeit des neuen Features** (Round-of-32-Bracket mit Anti-Group-Rematch-Regel)
|
|||
|
|
- **Inferenz-Zeit** und **Anzahl der Tool-Calls**
|
|||
|
|
- **Kreativität / Innovation** (Eigeninitiative über die Anforderung hinaus)
|
|||
|
|
|
|||
|
|
## Die zwei Modelle
|
|||
|
|
|
|||
|
|
| Eigenschaft | Kimi K2.7 Code | GLM-5.2 |
|
|||
|
|
|---|---|---|
|
|||
|
|
| Hersteller | Moonshot AI | Zhipu AI (Z.ai / Jiefu) |
|
|||
|
|
| Parameter | ~1T (1.04T) | 744B |
|
|||
|
|
| Aktive Parameter | 32B (MoE) | Full |
|
|||
|
|
| Architektur | Mixture-of-Experts | Dense |
|
|||
|
|
| Kontext | 256K Tokens | 1M Tokens |
|
|||
|
|
| Lizenz | Open | MIT (Open Weights, ab nächster Woche im Video-Zeitpunkt) |
|
|||
|
|
| Tool-Calls (Test 1) | mehr (länger) | 97 |
|
|||
|
|
| Test-1 Zeit | ~5 Min | länger |
|
|||
|
|
|
|||
|
|
**Existierende Wiki-Referenz:** [Kimi K2.7 Code](kimi-k2.7-code.md) (von Moonshot AI, auf Ollama Cloud verfügbar)
|
|||
|
|
|
|||
|
|
## Test 1: Bug-Fix + Feature-Build (World Cup 2026 Tracker)
|
|||
|
|
|
|||
|
|
**Setup:** Flask-App mit DB, CRUD, "hundreds of files". **Gepflanzter Bug:** Round-of-32-Ranking der besten Drittplatzierten ignoriert Goal Difference (Ghana mit 0 schlechter als Ecuador mit -3, sollte aber weiterkommen).
|
|||
|
|
|
|||
|
|
**Zusatz-Feature:** Round-of-32-Bracket bauen — 16 Matchups, gesetzt aus Final Standings, Group-Winner auf starker Seite, **kein Team spielt gegen einen aus seiner eigenen Gruppe**.
|
|||
|
|
|
|||
|
|
### Ergebnis
|
|||
|
|
|
|||
|
|
| Kriterium | Kimi K2.7 | GLM-5.2 |
|
|||
|
|
|---|---|---|
|
|||
|
|
| Bug-Fix korrekt (Ghana statt Ecuador) | ✅ | ✅ |
|
|||
|
|
| Round-of-32-Bracket | ✅ | ✅ |
|
|||
|
|
| Anti-Group-Rematch-Regel | ✅ | ✅ |
|
|||
|
|
| Tool-Calls | mehr | 97 |
|
|||
|
|
| Zeit | **~5 Min** (schneller) | länger |
|
|||
|
|
| **Innovation** | **+** (zusätzliche "Future-Progression"-Features) | – |
|
|||
|
|
|
|||
|
|
**Mirzas Fazit Test 1:** Beide bestehen, **Kimi hat die Nase vorn** durch weniger Zeit + Innovation (Eigeninitiative beim Bracket-Design).
|
|||
|
|
|
|||
|
|
## Test 2: Single-File Creative HTML (Siberian Cold Wind)
|
|||
|
|
|
|||
|
|
**Prompt (an beide identisch):** "Build a single self-contained HTML file, no libraries, that simulates a Siberian cold wind traveling from Lake Baikal down to Murree Hills in Pakistan. Animated particle system, live map."
|
|||
|
|
|
|||
|
|
### Ergebnis
|
|||
|
|
|
|||
|
|
| Kriterium | Kimi K2.7 | GLM-5.2 |
|
|||
|
|
|---|---|---|
|
|||
|
|
| File generated | ✅ | ✅ |
|
|||
|
|
| Geographie korrekt (Baikal → Zentralasien → Afghanistan → Pakistan) | ✅ | ✅ |
|
|||
|
|
| Live-Stats (Wind, Nearest City) | ✅ | ✅ |
|
|||
|
|
| **Animation/Simulation sichtbar** | ⚠️ sehr schwach | ✅ sichtbar (besser) |
|
|||
|
|
| **Terrain-Detail** | ❌ "very plain" | ✅ sichtbar |
|
|||
|
|
|
|||
|
|
**Mirzas Fazit Test 2:** **GLM schlägt Kimi** bei kreativer Single-Shot-Generation mit Animation.
|
|||
|
|
|
|||
|
|
**Gesamtfazit Mirza:** "Both models are neck to neck. Test on your own use case." (Vorsicht vor subjektiver Bewertung.)
|
|||
|
|
|
|||
|
|
## Wichtige Lessons aus dem Video
|
|||
|
|
|
|||
|
|
### 1. Agent-Frameworks machen den Unterschied
|
|||
|
|
|
|||
|
|
Beide Modelle laufen im selben [Hermes Agent](https://github.com/nousresearch/hermes-agent) von [Nous Research](https://hermes-agent.nousresearch.com/docs/) — der "self-improving AI agent with built-in learning loop". Das isoliert die Modell-Variable: der Vergleich misst tatsächlich *Modell-Qualität im Agent-Use-Case*, nicht Agent-Framework-Qualität.
|
|||
|
|
|
|||
|
|
**→ OpenClaw-Implikation:** OpenClaw's eigene Agent-Architektur ([[concepts/ai-agents-2026.md]]) könnte ebenfalls von solch head-to-head-Tests profitieren — welches Modell ist für welche Sub-Tasks im OpenClaw-Setup am besten?
|
|||
|
|
|
|||
|
|
### 2. Benchmarks ≠ Real-World
|
|||
|
|
|
|||
|
|
Die Kimi-K2.7-Benchmarks im Wiki ([[tools/kimi-k2.7-code.md]]) zeigen Kimi unter GPT-5.5 und Claude Opus 4.8. Im Real-World-Test (Bug-Fix + Feature in 5 Min) sieht das Bild anders aus — Kimi ist schneller und innovativer als erwartet, GLM-5.2 (nicht in der Tabelle) zeigt dafür kreative Stärke.
|
|||
|
|
|
|||
|
|
**→ OpenClaw-Implikation:** Benchmarks (Program Bench, MCP Mark Verified) sind eine Approximation. Production-Pfade sollten mit realen Tasks validiert werden, nicht nur mit Standard-Benchmarks.
|
|||
|
|
|
|||
|
|
### 3. Open-Source-Vielfalt aus China
|
|||
|
|
|
|||
|
|
Sowohl Kimi K2.7 (Moonshot AI) als auch GLM-5.2 (Zhipu AI) sind **starke, agentisch nutzbare Open-Source-Modelle aus China** mit unterschiedlichen Architekturen (MoE vs Dense) und Trade-offs (Speed vs Detail).
|
|||
|
|
|
|||
|
|
**→ Direkt relevant für [[concepts/llm-model-fusion-ensembles.md]]** (OpenRouter Fusion): Kimi K2.6 war bereits im Budget-Panel-Experiment, Kimi K2.7 ist die nächste Generation; GLM-5.2 wäre ein neuer Panel-Kandidat. Die strukturelle Botschaft: **Es gibt in 2026 mehrere konkurrenzfähige Open-Coding-Modelle, die für Ensembles in Frage kommen.**
|
|||
|
|
|
|||
|
|
### 4. Anti-Group-Rematch als nicht-trivialer Test
|
|||
|
|
|
|||
|
|
Die Regel "kein Team spielt gegen einen aus seiner eigenen Gruppe" ist eine **Constraint-Satisfaction-Logik**, die viele LLMs falsch machen. Beide Modelle bestehen — was positiv für beide ist, aber auch zeigt, dass solche "nicht-offensichtlichen" Constraints ein guter Real-World-Test sind.
|
|||
|
|
|
|||
|
|
## Verwandte Wiki-Seiten
|
|||
|
|
|
|||
|
|
- [[concepts/llm-model-fusion-ensembles.md]] — Kimi K2.6 im Budget-Panel, Kimi K2.7 wäre direkter Nachfolger
|
|||
|
|
- [[concepts/ai-agents-2026.md]] — Agent-Frameworks; Hermes Agent als alternatives Agent-Framework
|
|||
|
|
- [[concepts/llm-behavior-persistence.md]] — komplementär: Verhalten einzelner Modelle vs. Verhalten in Agent-Workflows
|
|||
|
|
- [[tools/kimi-k2.7-code.md]] — existierende Wiki-Seite zu Kimi K2.7 Code (Benchmarks, Ollama Cloud)
|
|||
|
|
- [[tools/anthropic-claude.md]] — Konkurrenz-Kontext (Frontier vs Open-Source)
|
|||
|
|
- [[concepts/llm-knowledge-base.md]] — Kuratierte Strukturen schlagen reine Inference (auch im Coding-Bereich)
|
|||
|
|
|
|||
|
|
## Externe Ressourcen
|
|||
|
|
|
|||
|
|
### Modelle
|
|||
|
|
|
|||
|
|
- [Fahd Mirza YouTube Channel](https://www.youtube.com/@fahdmirza) — Autor
|
|||
|
|
- [Fahd Mirza Blog](https://www.fahdmirza.com/)
|
|||
|
|
- [Fahd Mirza LinkedIn](https://www.linkedin.com/in/fahdmirza/)
|
|||
|
|
- [Fahd Mirza Substack](https://fahadmirza.substack.com/) (Weekly AI Newsletter)
|
|||
|
|
- [Kimi K2.7 Code (Ollama Cloud)](https://ollama.com/library/kimi-k2.7-code) — siehe existierende Wiki-Seite [[tools/kimi-k2.7-code.md]]
|
|||
|
|
- [Moonshot AI](https://www.moonshot.cn/) — Hersteller Kimi
|
|||
|
|
- [Zhipu AI / Z.ai](https://z.ai/) — Hersteller GLM
|
|||
|
|
- [GLM-5.2 auf chat.z.ai](https://chat.z.ai) — kostenloser Zugang (Stand: Video, MIT-Lizenz für Open Weights)
|
|||
|
|
- [GLM Coding Plan](https://z.ai/) — API-Pricing
|
|||
|
|
- [GLM-5 744B Open-Source Guide (nxcode.io)](https://www.nxcode.io/resources/news/glm-5-open-source-744b-model-complete-guide-2026)
|
|||
|
|
|
|||
|
|
### Hermes Agent (Test-Framework)
|
|||
|
|
|
|||
|
|
- [Hermes Agent GitHub (NousResearch)](https://github.com/nousresearch/hermes-agent)
|
|||
|
|
- [Hermes Agent Dokumentation](https://hermes-agent.nousresearch.com/docs/)
|
|||
|
|
- [Nous Research](https://nousresearch.com/)
|
|||
|
|
|
|||
|
|
### Verwandte Coding-Benchmarks & Methoden
|
|||
|
|
|
|||
|
|
- [SWE-bench (Real-World Software Engineering Benchmark)](https://www.swebench.com/)
|
|||
|
|
- [HumanEval (OpenAI)](https://github.com/openai/human-eval)
|
|||
|
|
- [MBPP (Mostly Basic Python Problems)](https://github.com/google-research/mbpp)
|
|||
|
|
- [Kimi Code Bench v2](https://github.com/MoonshotAI/) — siehe existierende Wiki-Seite
|
|||
|
|
- [RealWorldEval (M-A-P)](https://github.com/M-A-P/RealWorldEval)
|
|||
|
|
- [MCP (Model Context Protocol) Spec](https://modelcontextprotocol.io/) — relevant für Tool-Calls in Coding-Agents
|
|||
|
|
|
|||
|
|
### Verwandte Vergleiche
|
|||
|
|
|
|||
|
|
- [GPT-5.5 vs Claude Opus 4.8 vs Kimi K2.7 Benchmarks](https://x.com/) — siehe Wiki-Tabellen
|
|||
|
|
- [Chinese Open-Source LLM Landscape 2026](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
|
|||
|
|
- [Open LLM Leaderboard (HuggingFace)](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
|