knowledge-base/wiki/concepts/llm/real-world-coding-showdown.md
Hector 0e02fdbd59 feat: people-pages for all TODO institutions markers
- Created 27 new people-pages for all TODO-marked persons
- Replaced all TODO: people-page markers with wiki-links in institutions
- Cross-referenced back to institutions from each people-page
- 0 TODO markers remaining

New people-pages:
  shayne-coplan, jim-zemlin, wang-changhu, yang-bingyang, demis-hassabis,
  clement-delangue, thomas-kurian, fei-fei-li, christopher-manning,
  sam-altman, ilya-sutskever, moritz-kaminski, elon-musk, nicolas-burtey,
  elizabeth-stark, olaoluwa-osuntokun, jan-leike, oren-etzioni,
  ali-farhadi, jaime-sevilla, max-tegmark, daniela-rus, jared-kaplan,
  alex-atallah, andrew-moore, tuomas-sandholm, mitchell-baker
2026-06-25 21:44:25 +02:00

171 lines
9.3 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-06-15
updated: 2026-06-15
sources: [youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md]
tags: [concept, coding-agents, hermes-agent, kimi-k2.7, glm-5.2, real-world-benchmark, open-source, china-ai, agentic-coding]
---
# Real-World Coding-Agent Showdowns — Methodik jenseits von Standard-Benchmarks
> **Quelle des Konzepts:** YouTube-Video "Kimi K2.7 vs GLM-5.2: Real Coding Showdown in Hermes Agent" (Fahd Mirza, 14.06.2026, 14 Min, 2659 Aufrufe, 89 Likes). Geteilt von @PWeber (Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic.
## Kernidee
**Statt statischer Code-Benchmarks (HumanEval, MBPP, SWE-bench) → head-to-head-Vergleich zweier Modelle in derselben Agent-Umgebung, mit echtem Bug + Feature-Anforderung in einer nicht-trivialen App.**
Das Video von [Fahd Mirza](https://www.youtube.com/@fahdmirza) demonstriert eine **alternative Evaluationsmethode** für Coding-Modelle: Beide Modelle erhalten denselben Prompt in derselben [Hermes Agent](https://github.com/nousresearch/hermes-agent)-Instanz, lösen denselben realistischen Task (Bug-Fix + Feature-Build in einer Flask-App), und werden anhand konkreter Output-Qualität, Zeit und Tool-Call-Effizienz verglichen.
## Die Methodik
### Setup
| Element | Details |
|---|---|
| **Test-App** | Flask-Webanwendung (World Cup 2026 Tracker), DB + CRUD, "hundreds of files" |
| **Gepflanzter Bug** | Round-of-32-Ranking der besten Drittplatzierten ignoriert Goal Difference — verstößt gegen FIFA-Regel |
| **Feature-Anforderung** | Round-of-32-Bracket: 16 Matchups, Group-Winner auf starker Seite, **kein Team spielt gegen einen aus seiner eigenen Gruppe** |
| **Test-Framework** | [Hermes Agent](https://github.com/nousresearch/hermes-agent) von [Nous Research](https://nousresearch.com/) (selber Agent für beide Modelle) |
| **Hardware** | Ubuntu-System, beide Modelle als Inference-Backends |
| **Prompt** | Identisch für beide Modelle, One-Shot mit echtem Use-Case |
| **Bewertungsdimensionen** | Korrektheit, Vollständigkeit, Zeit, Tool-Call-Anzahl, Innovation |
### Bewertung — Kriterien-Katalog (extrapoliert)
1. **Bug-Fix Korrektheit** — wird der FIFA-Regel-konforme Goal-Difference-Fix korrekt umgesetzt?
2. **Feature-Vollständigkeit** — funktioniert das Round-of-32-Bracket mit allen 16 Matchups?
3. **Constraint-Satisfaction** — Anti-Group-Rematch-Regel eingehalten?
4. **Tool-Call-Effizienz** — wie viele Tool-Calls für die Lösung?
5. **Zeit-Effizienz** — Inferenz-Zeit für die Gesamtaufgabe?
6. **Innovation** — Eigeninitiative über die Anforderung hinaus (z.B. zusätzliche UI-Features)
7. **Kreativität (zweiter Test)** — Fähigkeit zu Single-File-Creative-Coding mit Animation, Geographie, Live-Stats
## Ergebnisse (Video)
### Test 1: Real Coding (Bug-Fix + Feature)
| Kriterium | Kimi K2.7 | GLM-5.2 |
|---|---|---|
| Bug-Fix korrekt | ✅ | ✅ |
| Bracket-Feature | ✅ | ✅ |
| Anti-Group-Rematch | ✅ | ✅ |
| Tool-Calls | mehr | 97 |
| Zeit | **~5 Min** | länger |
| **Innovation** | **+** (z.B. Progression-Previews) | |
**Fazit Test 1:** Beide bestehen, **Kimi vorn** durch Geschwindigkeit + Innovation.
### Test 2: Creative HTML (Siberian Wind Simulation)
| Kriterium | Kimi K2.7 | GLM-5.2 |
|---|---|---|
| Geographie korrekt | ✅ | ✅ |
| Live-Stats (Wind, City) | ✅ | ✅ |
| **Animation sichtbar** | ⚠️ sehr schwach | ✅ |
| **Terrain-Detail** | ❌ "plain" | ✅ sichtbar |
**Fazit Test 2:** **GLM vorn** bei kreativer Animation + Detail.
**Gesamtfazit Mirza:** "Both models are neck to neck. Test on your own use case." (Subjektivität anerkannt.)
## Warum diese Methodik wertvoll ist
### 1. Statische Benchmarks haben Grenzen
Standard-Coding-Benchmarks messen **eng definierte Code-Generierung** (Funktion schreiben, Bug fixieren). Real-World-Coding-Agents brauchen mehr:
- **Multi-File-Reasoning** über hunderte Dateien
- **Tool-Use** (Shell, Browser, DB, Git)
- **Constraint-Satisfaction** mit nicht-offensichtlichen Regeln
- **Eigeninitiative** (User will "Bracket", aber gute Lösung antizipiert Edge-Cases)
- **Kombiniertes Bug-Fix + Feature-Build** in einem Shot
Der Hermes-Showdown testet all das **implizit** — ohne explizit dafür designte Benchmarks.
### 2. Agent-Framework isolieren
Indem **beide Modelle im selben Agent-Framework** laufen (Hermes Agent), wird die Modell-Variable sauber isoliert. Der Vergleich misst: *Was kann das Modell XY in einem realen Agent-Workflow?* — nicht: *Was kann Agent A vs Agent B?*
**→ Direkter Implikat für OpenClaw:** Eine vergleichbare Showdown-Methodik mit [[../agents/ai-agents-2026.md]]-Setups würde zeigen, welches Modell für welchen Sub-Task im OpenClaw-Setup am besten passt.
### 3. Open-Source-Realität 2026
**Sowohl Kimi K2.7 (Moonshot AI) als auch GLM-5.2 (Zhipu AI) sind konkurrenzfähige Open-Source-Coding-Modelle** mit unterschiedlichen Trade-offs:
| Dimension | Kimi K2.7 | GLM-5.2 |
|---|---|---|
| Architektur | MoE (1T total, 32B active) | Dense (744B) |
| Kontext | 256K | **1M** |
| Lizenz | Open | **MIT** |
| Stärke (Test 1) | Speed, Innovation | Konsistenz |
| Stärke (Test 2) | Stats, Geographie | **Animation, Detail** |
**→ Direkter Implikat für [[llm-model-fusion-ensembles.md]]:** In der OpenRouter-Fusion-Demo war Kimi K2.6 im Budget-Panel. Kimi K2.7 ist die nächste Generation und GLM-5.2 ein weiterer Kandidat. Beide könnten in heterogenen Coding-Panels Synergieeffekte erzeugen.
### 4. Sub-Task-Spezialisierung als Schlüssel
Statt "ein Modell für alles" zeigt der Showdown: **Beide Modelle sind kompetent, aber in verschiedenen Dimensionen stark.** Praktisch heißt das: in einer Ensemble-Architektur (Fusion) sollte man nicht nur diverse Modelle kombinieren, sondern auch **Sub-Task-spezifisch zuweisen**.
## Pro-Leben-Perspektive
Gemäß [[../directives/pro-leben-directive.md]]:
**Gegen Mangelnarrativ** ("Wir sind abhängig von US-Frontier-Modellen"):
- 2026 ist das Jahr, in dem **chinesische Open-Source-Coding-Modelle Frontier-Nähe erreicht haben** — Kimi K2.7, GLM-5.2, DeepSeek-Varianten
- MIT-Lizenz für GLM-5.2 (Open Weights) ist ein handfester Schritt Richtung echter Offenheit
- Konkurrenz belebt das Feld — beide Modelle sind besser als eines allein
**Für Handlungsfähigkeit:**
- Wer Coding-Agents baut, kann heute zwischen mehreren starken Open-Source-Modellen wählen
- Hermes Agent ist Open Source ([[../agents/ai-agents-2026.md]]-Pattern)
- Real-World-Tests sind machbar: App mit Bug + Feature bauen, beide Modelle dranlassen, vergleichen
**Realismus:**
- Beide Modelle haben **eigene Schwächen** (Kimi bei Animation, GLM bei Innovation)
- 1M Kontext (GLM) ist nicht immer nützlich — oft sind 256K (Kimi) praxisnäher
- "Neck to neck" = **beide gut genug für Production, aber nicht perfekt**
- Standard-Benchmarks (Kimi Code Bench v2, Program Bench) bleiben als erste Approximation sinnvoll — Real-World-Tests ergänzen, ersetzen aber nicht
## Verwandte Wiki-Seiten
- [[llm-model-fusion-ensembles.md]] — Kimi K2.6 im Budget-Panel; Kimi K2.7 / GLM-5.2 als neue Ensemble-Kandidaten
- [[../agents/ai-agents-2026.md]] — Agent-Frameworks; Hermes Agent als alternatives Agent-Framework
- [[llm-behavior-persistence.md]] — Verhalten im Einzelmodell vs. Verhalten in Agent-Workflows
- [[../../tools/kimi-k2.7-code.md]] — existierende Wiki-Seite zu Kimi K2.7 (Benchmarks, Ollama Cloud)
- [[../../tools/anthropic-claude.md]] — Frontier-Konkurrenz (Opus 4.8 als Synthesizer in OpenRouter-Fusion)
- [[../../architecture/model-routing.md]] — Sub-Task-spezifische Modell-Zuweisung als Pattern
- [[llm-knowledge-base.md]] — Karpathy-Pattern: kuratierte Strukturen schlagen reine Inference
## Externe Ressourcen
### Video & Autor
- [YouTube: Kimi K2.7 vs GLM-5.2 Real Coding Showdown](https://www.youtube.com/watch?v=X8C2CKMAYc0)
- [Fahd Mirza YouTube Channel](https://www.youtube.com/@fahdmirza)
- [Fahd Mirza Blog](https://www.fahdmirza.com/)
- [Fahd Mirza LinkedIn](https://www.linkedin.com/in/fahdmirza/)
- [Fahd Mirza Substack (Weekly AI Newsletter)](https://fahadmirza.substack.com/)
- [Fahd Mirza Ko-Fi](https://ko-fi.com/fahdmirza)
### Modelle
- [Moonshot AI](https://www.moonshot.cn/) — Hersteller Kimi
- [Zhipu AI / Z.ai](https://z.ai/) — Hersteller GLM
- [GLM-5.2 auf chat.z.ai](https://chat.z.ai) — kostenloser Zugang
- [GLM-5 Open-Source Guide (nxcode.io)](https://www.nxcode.io/resources/news/glm-5-open-source-744b-model-complete-guide-2026)
- [Ollama Cloud (Kimi K2.7)](https://ollama.com/library/kimi-k2.7-code) — siehe [[../../tools/kimi-k2.7-code.md]]
- [Open LLM Leaderboard (HuggingFace)](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
### Hermes Agent
- [Hermes Agent GitHub (NousResearch)](https://github.com/nousresearch/hermes-agent)
- [Hermes Agent Documentation](https://hermes-agent.nousresearch.com/docs/)
- [Nous Research](https://nousresearch.com/)
- [[../../tools/hermes-desktop.md]] — Offizielle Hermes Desktop App (Juni 2026)
### Coding-Benchmarks & Methoden
- [SWE-bench (Real-World Software Engineering)](https://www.swebench.com/) — Real-World-Standard
- [HumanEval (OpenAI)](https://github.com/openai/human-eval)
- [MBPP (Google Research)](https://github.com/google-research/mbpp)
- [RealWorldEval (M-A-P)](https://github.com/M-A-P/RealWorldEval)
- [MCP (Model Context Protocol)](https://modelcontextprotocol.io/) — Standard für Tool-Calls
- [Aider Benchmark Suite](https://aider.chat/docs/benchmarks.html) — Coding-Agent-Benchmarks