diff --git a/raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md b/raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md new file mode 100644 index 0000000..658d9ce --- /dev/null +++ b/raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md @@ -0,0 +1,155 @@ +--- +type: youtube +source_url: https://www.youtube.com/watch?v=X8C2CKMAYc0 +retrieved: 2026-06-15 +channel: "Fahd Mirza" +duration_sec: 840 +has_transcript: true +tags: [kimik27, glm52, hermes-agent, coding-agent, coding-benchmark, open-source-llm, china-ai, agentic-coding, real-world-comparison] +--- + +# Kimi K2.7 vs GLM-5.2: Real Coding Showdown in Hermes Agent + +**Geteilt von:** @PWeber (Pit Weber / Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic + +## Quelle + +- **Titel:** Kimi K2.7 vs GLM-5.2: Real Coding Showdown in Hermes Agent +- **Channel:** [Fahd Mirza](https://www.youtube.com/@fahdmirza) +- **Hochgeladen:** 2026-06-14 +- **Länge:** 14:00 +- **Aufrufe:** 2659 | **Likes:** 89 +- **URL:** https://www.youtube.com/watch?v=X8C2CKMAYc0 +- **Beschreibung:** "GLM-5.2 vs Kimi K2.7 going head to head on real coding tasks, live in the Hermes Agent." +- **Tags:** #kimik27 #glm52 + +## Konzept: Real-World Agentic Coding Comparison + +Ein **empirischer Showdown** zwischen zwei starken Open-Source-Coding-Modellen aus China, durchgeführt in einem **echten Anwendungskontext** (kein Toy-Benchmark, keine statischen Tests). Beide Modelle erhalten **denselben Prompt** in derselben Agent-Umgebung ([Hermes Agent](https://github.com/nousresearch/hermes-agent)). + +**Methodische Stärke:** Statt Standard-Benchmarks wird ein **funktionales, nicht-triviales Web-App** mit echtem Bug + Feature-Anforderung verwendet. Bewertung erfolgt anhand von: +- **Korrektheit der Bug-Fix** (FIFA-Regel-konformes Ranking) +- **Vollständigkeit des neuen Features** (Round-of-32-Bracket mit Anti-Group-Rematch-Regel) +- **Inferenz-Zeit** und **Anzahl der Tool-Calls** +- **Kreativität / Innovation** (Eigeninitiative über die Anforderung hinaus) + +## Die zwei Modelle + +| Eigenschaft | Kimi K2.7 Code | GLM-5.2 | +|---|---|---| +| Hersteller | Moonshot AI | Zhipu AI (Z.ai / Jiefu) | +| Parameter | ~1T (1.04T) | 744B | +| Aktive Parameter | 32B (MoE) | Full | +| Architektur | Mixture-of-Experts | Dense | +| Kontext | 256K Tokens | 1M Tokens | +| Lizenz | Open | MIT (Open Weights, ab nächster Woche im Video-Zeitpunkt) | +| Tool-Calls (Test 1) | mehr (länger) | 97 | +| Test-1 Zeit | ~5 Min | länger | + +**Existierende Wiki-Referenz:** [Kimi K2.7 Code](kimi-k2.7-code.md) (von Moonshot AI, auf Ollama Cloud verfügbar) + +## Test 1: Bug-Fix + Feature-Build (World Cup 2026 Tracker) + +**Setup:** Flask-App mit DB, CRUD, "hundreds of files". **Gepflanzter Bug:** Round-of-32-Ranking der besten Drittplatzierten ignoriert Goal Difference (Ghana mit 0 schlechter als Ecuador mit -3, sollte aber weiterkommen). + +**Zusatz-Feature:** Round-of-32-Bracket bauen — 16 Matchups, gesetzt aus Final Standings, Group-Winner auf starker Seite, **kein Team spielt gegen einen aus seiner eigenen Gruppe**. + +### Ergebnis + +| Kriterium | Kimi K2.7 | GLM-5.2 | +|---|---|---| +| Bug-Fix korrekt (Ghana statt Ecuador) | ✅ | ✅ | +| Round-of-32-Bracket | ✅ | ✅ | +| Anti-Group-Rematch-Regel | ✅ | ✅ | +| Tool-Calls | mehr | 97 | +| Zeit | **~5 Min** (schneller) | länger | +| **Innovation** | **+** (zusätzliche "Future-Progression"-Features) | – | + +**Mirzas Fazit Test 1:** Beide bestehen, **Kimi hat die Nase vorn** durch weniger Zeit + Innovation (Eigeninitiative beim Bracket-Design). + +## Test 2: Single-File Creative HTML (Siberian Cold Wind) + +**Prompt (an beide identisch):** "Build a single self-contained HTML file, no libraries, that simulates a Siberian cold wind traveling from Lake Baikal down to Murree Hills in Pakistan. Animated particle system, live map." + +### Ergebnis + +| Kriterium | Kimi K2.7 | GLM-5.2 | +|---|---|---| +| File generated | ✅ | ✅ | +| Geographie korrekt (Baikal → Zentralasien → Afghanistan → Pakistan) | ✅ | ✅ | +| Live-Stats (Wind, Nearest City) | ✅ | ✅ | +| **Animation/Simulation sichtbar** | ⚠️ sehr schwach | ✅ sichtbar (besser) | +| **Terrain-Detail** | ❌ "very plain" | ✅ sichtbar | + +**Mirzas Fazit Test 2:** **GLM schlägt Kimi** bei kreativer Single-Shot-Generation mit Animation. + +**Gesamtfazit Mirza:** "Both models are neck to neck. Test on your own use case." (Vorsicht vor subjektiver Bewertung.) + +## Wichtige Lessons aus dem Video + +### 1. Agent-Frameworks machen den Unterschied + +Beide Modelle laufen im selben [Hermes Agent](https://github.com/nousresearch/hermes-agent) von [Nous Research](https://hermes-agent.nousresearch.com/docs/) — der "self-improving AI agent with built-in learning loop". Das isoliert die Modell-Variable: der Vergleich misst tatsächlich *Modell-Qualität im Agent-Use-Case*, nicht Agent-Framework-Qualität. + +**→ OpenClaw-Implikation:** OpenClaw's eigene Agent-Architektur ([[concepts/ai-agents-2026.md]]) könnte ebenfalls von solch head-to-head-Tests profitieren — welches Modell ist für welche Sub-Tasks im OpenClaw-Setup am besten? + +### 2. Benchmarks ≠ Real-World + +Die Kimi-K2.7-Benchmarks im Wiki ([[tools/kimi-k2.7-code.md]]) zeigen Kimi unter GPT-5.5 und Claude Opus 4.8. Im Real-World-Test (Bug-Fix + Feature in 5 Min) sieht das Bild anders aus — Kimi ist schneller und innovativer als erwartet, GLM-5.2 (nicht in der Tabelle) zeigt dafür kreative Stärke. + +**→ OpenClaw-Implikation:** Benchmarks (Program Bench, MCP Mark Verified) sind eine Approximation. Production-Pfade sollten mit realen Tasks validiert werden, nicht nur mit Standard-Benchmarks. + +### 3. Open-Source-Vielfalt aus China + +Sowohl Kimi K2.7 (Moonshot AI) als auch GLM-5.2 (Zhipu AI) sind **starke, agentisch nutzbare Open-Source-Modelle aus China** mit unterschiedlichen Architekturen (MoE vs Dense) und Trade-offs (Speed vs Detail). + +**→ Direkt relevant für [[concepts/llm-model-fusion-ensembles.md]]** (OpenRouter Fusion): Kimi K2.6 war bereits im Budget-Panel-Experiment, Kimi K2.7 ist die nächste Generation; GLM-5.2 wäre ein neuer Panel-Kandidat. Die strukturelle Botschaft: **Es gibt in 2026 mehrere konkurrenzfähige Open-Coding-Modelle, die für Ensembles in Frage kommen.** + +### 4. Anti-Group-Rematch als nicht-trivialer Test + +Die Regel "kein Team spielt gegen einen aus seiner eigenen Gruppe" ist eine **Constraint-Satisfaction-Logik**, die viele LLMs falsch machen. Beide Modelle bestehen — was positiv für beide ist, aber auch zeigt, dass solche "nicht-offensichtlichen" Constraints ein guter Real-World-Test sind. + +## Verwandte Wiki-Seiten + +- [[concepts/llm-model-fusion-ensembles.md]] — Kimi K2.6 im Budget-Panel, Kimi K2.7 wäre direkter Nachfolger +- [[concepts/ai-agents-2026.md]] — Agent-Frameworks; Hermes Agent als alternatives Agent-Framework +- [[concepts/llm-behavior-persistence.md]] — komplementär: Verhalten einzelner Modelle vs. Verhalten in Agent-Workflows +- [[tools/kimi-k2.7-code.md]] — existierende Wiki-Seite zu Kimi K2.7 Code (Benchmarks, Ollama Cloud) +- [[tools/anthropic-claude.md]] — Konkurrenz-Kontext (Frontier vs Open-Source) +- [[concepts/llm-knowledge-base.md]] — Kuratierte Strukturen schlagen reine Inference (auch im Coding-Bereich) + +## Externe Ressourcen + +### Modelle + +- [Fahd Mirza YouTube Channel](https://www.youtube.com/@fahdmirza) — Autor +- [Fahd Mirza Blog](https://www.fahdmirza.com/) +- [Fahd Mirza LinkedIn](https://www.linkedin.com/in/fahdmirza/) +- [Fahd Mirza Substack](https://fahadmirza.substack.com/) (Weekly AI Newsletter) +- [Kimi K2.7 Code (Ollama Cloud)](https://ollama.com/library/kimi-k2.7-code) — siehe existierende Wiki-Seite [[tools/kimi-k2.7-code.md]] +- [Moonshot AI](https://www.moonshot.cn/) — Hersteller Kimi +- [Zhipu AI / Z.ai](https://z.ai/) — Hersteller GLM +- [GLM-5.2 auf chat.z.ai](https://chat.z.ai) — kostenloser Zugang (Stand: Video, MIT-Lizenz für Open Weights) +- [GLM Coding Plan](https://z.ai/) — API-Pricing +- [GLM-5 744B Open-Source Guide (nxcode.io)](https://www.nxcode.io/resources/news/glm-5-open-source-744b-model-complete-guide-2026) + +### Hermes Agent (Test-Framework) + +- [Hermes Agent GitHub (NousResearch)](https://github.com/nousresearch/hermes-agent) +- [Hermes Agent Dokumentation](https://hermes-agent.nousresearch.com/docs/) +- [Nous Research](https://nousresearch.com/) + +### Verwandte Coding-Benchmarks & Methoden + +- [SWE-bench (Real-World Software Engineering Benchmark)](https://www.swebench.com/) +- [HumanEval (OpenAI)](https://github.com/openai/human-eval) +- [MBPP (Mostly Basic Python Problems)](https://github.com/google-research/mbpp) +- [Kimi Code Bench v2](https://github.com/MoonshotAI/) — siehe existierende Wiki-Seite +- [RealWorldEval (M-A-P)](https://github.com/M-A-P/RealWorldEval) +- [MCP (Model Context Protocol) Spec](https://modelcontextprotocol.io/) — relevant für Tool-Calls in Coding-Agents + +### Verwandte Vergleiche + +- [GPT-5.5 vs Claude Opus 4.8 vs Kimi K2.7 Benchmarks](https://x.com/) — siehe Wiki-Tabellen +- [Chinese Open-Source LLM Landscape 2026](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) +- [Open LLM Leaderboard (HuggingFace)](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) diff --git a/wiki/architecture/model-routing.md b/wiki/architecture/model-routing.md index af41c6b..642446b 100644 --- a/wiki/architecture/model-routing.md +++ b/wiki/architecture/model-routing.md @@ -35,4 +35,15 @@ openrouter/auto Sequentielles Routing (Fallback) ist nicht das einzige Pattern. OpenRouter bietet **Fusion** — parallele Model-Panels mit Judge-Synthese. Siehe [[llm-model-fusion-ensembles.md]] für Details und DRACO-Benchmark-Ergebnisse. -**Aktuell offene Frage:** Soll OpenClaws Quality-kritische Pfade (z.B. Subconscious Hard Synthesis) um eine parallele Pre-Routing-Schicht erweitert werden? Trade-off: höhere Latenz + Kosten vs. bessere Qualität durch Modell-Heterogenität. \ No newline at end of file +**Aktuell offene Frage:** Soll OpenClaws Quality-kritische Pfade (z.B. Subconscious Hard Synthesis) um eine parallele Pre-Routing-Schicht erweitert werden? Trade-off: höhere Latenz + Kosten vs. bessere Qualität durch Modell-Heterogenität. + +## Coding-Modelle: Kimi K2.7 & GLM-5.2 + +Im Juni 2026 haben sich zwei starke Open-Source-Coding-Modelle aus China etabliert: + +- **Kimi K2.7** (Moonshot AI) — siehe [[kimi-k2.7-code.md]]. MoE 1T/32B, 256K Kontext, schnell im Real-Coding-Showdown. +- **GLM-5.2** (Zhipu AI / Z.ai) — 744B Dense, 1M Kontext, MIT-Lizenz, stark bei kreativer Generation und Animation. + +Head-to-Head-Vergleich in Hermes Agent: siehe [[real-world-coding-showdown.md]]. + +**Implikation für Routing:** In Sub-Task-Spezialisierung (Coding vs. Creative vs. Long-Context) sind beide als Sub-Routing-Knoten sinnvoll — nicht als Ersatz der Primary-Fallback-Chain, sondern als **spezialisierte Side-Branches** für Coding-Tasks. \ No newline at end of file diff --git a/wiki/concepts/real-world-coding-showdown.md b/wiki/concepts/real-world-coding-showdown.md new file mode 100644 index 0000000..da5fb9e --- /dev/null +++ b/wiki/concepts/real-world-coding-showdown.md @@ -0,0 +1,170 @@ +--- +created: 2026-06-15 +updated: 2026-06-15 +sources: [youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md] +tags: [concept, coding-agents, hermes-agent, kimi-k2.7, glm-5.2, real-world-benchmark, open-source, china-ai, agentic-coding] +--- + +# Real-World Coding-Agent Showdowns — Methodik jenseits von Standard-Benchmarks + +> **Quelle des Konzepts:** YouTube-Video "Kimi K2.7 vs GLM-5.2: Real Coding Showdown in Hermes Agent" (Fahd Mirza, 14.06.2026, 14 Min, 2659 Aufrufe, 89 Likes). Geteilt von @PWeber (Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic. + +## Kernidee + +**Statt statischer Code-Benchmarks (HumanEval, MBPP, SWE-bench) → head-to-head-Vergleich zweier Modelle in derselben Agent-Umgebung, mit echtem Bug + Feature-Anforderung in einer nicht-trivialen App.** + +Das Video von [Fahd Mirza](https://www.youtube.com/@fahdmirza) demonstriert eine **alternative Evaluationsmethode** für Coding-Modelle: Beide Modelle erhalten denselben Prompt in derselben [Hermes Agent](https://github.com/nousresearch/hermes-agent)-Instanz, lösen denselben realistischen Task (Bug-Fix + Feature-Build in einer Flask-App), und werden anhand konkreter Output-Qualität, Zeit und Tool-Call-Effizienz verglichen. + +## Die Methodik + +### Setup + +| Element | Details | +|---|---| +| **Test-App** | Flask-Webanwendung (World Cup 2026 Tracker), DB + CRUD, "hundreds of files" | +| **Gepflanzter Bug** | Round-of-32-Ranking der besten Drittplatzierten ignoriert Goal Difference — verstößt gegen FIFA-Regel | +| **Feature-Anforderung** | Round-of-32-Bracket: 16 Matchups, Group-Winner auf starker Seite, **kein Team spielt gegen einen aus seiner eigenen Gruppe** | +| **Test-Framework** | [Hermes Agent](https://github.com/nousresearch/hermes-agent) von [Nous Research](https://nousresearch.com/) (selber Agent für beide Modelle) | +| **Hardware** | Ubuntu-System, beide Modelle als Inference-Backends | +| **Prompt** | Identisch für beide Modelle, One-Shot mit echtem Use-Case | +| **Bewertungsdimensionen** | Korrektheit, Vollständigkeit, Zeit, Tool-Call-Anzahl, Innovation | + +### Bewertung — Kriterien-Katalog (extrapoliert) + +1. **Bug-Fix Korrektheit** — wird der FIFA-Regel-konforme Goal-Difference-Fix korrekt umgesetzt? +2. **Feature-Vollständigkeit** — funktioniert das Round-of-32-Bracket mit allen 16 Matchups? +3. **Constraint-Satisfaction** — Anti-Group-Rematch-Regel eingehalten? +4. **Tool-Call-Effizienz** — wie viele Tool-Calls für die Lösung? +5. **Zeit-Effizienz** — Inferenz-Zeit für die Gesamtaufgabe? +6. **Innovation** — Eigeninitiative über die Anforderung hinaus (z.B. zusätzliche UI-Features) +7. **Kreativität (zweiter Test)** — Fähigkeit zu Single-File-Creative-Coding mit Animation, Geographie, Live-Stats + +## Ergebnisse (Video) + +### Test 1: Real Coding (Bug-Fix + Feature) + +| Kriterium | Kimi K2.7 | GLM-5.2 | +|---|---|---| +| Bug-Fix korrekt | ✅ | ✅ | +| Bracket-Feature | ✅ | ✅ | +| Anti-Group-Rematch | ✅ | ✅ | +| Tool-Calls | mehr | 97 | +| Zeit | **~5 Min** | länger | +| **Innovation** | **+** (z.B. Progression-Previews) | – | + +**Fazit Test 1:** Beide bestehen, **Kimi vorn** durch Geschwindigkeit + Innovation. + +### Test 2: Creative HTML (Siberian Wind Simulation) + +| Kriterium | Kimi K2.7 | GLM-5.2 | +|---|---|---| +| Geographie korrekt | ✅ | ✅ | +| Live-Stats (Wind, City) | ✅ | ✅ | +| **Animation sichtbar** | ⚠️ sehr schwach | ✅ | +| **Terrain-Detail** | ❌ "plain" | ✅ sichtbar | + +**Fazit Test 2:** **GLM vorn** bei kreativer Animation + Detail. + +**Gesamtfazit Mirza:** "Both models are neck to neck. Test on your own use case." (Subjektivität anerkannt.) + +## Warum diese Methodik wertvoll ist + +### 1. Statische Benchmarks haben Grenzen + +Standard-Coding-Benchmarks messen **eng definierte Code-Generierung** (Funktion schreiben, Bug fixieren). Real-World-Coding-Agents brauchen mehr: +- **Multi-File-Reasoning** über hunderte Dateien +- **Tool-Use** (Shell, Browser, DB, Git) +- **Constraint-Satisfaction** mit nicht-offensichtlichen Regeln +- **Eigeninitiative** (User will "Bracket", aber gute Lösung antizipiert Edge-Cases) +- **Kombiniertes Bug-Fix + Feature-Build** in einem Shot + +Der Hermes-Showdown testet all das **implizit** — ohne explizit dafür designte Benchmarks. + +### 2. Agent-Framework isolieren + +Indem **beide Modelle im selben Agent-Framework** laufen (Hermes Agent), wird die Modell-Variable sauber isoliert. Der Vergleich misst: *Was kann das Modell XY in einem realen Agent-Workflow?* — nicht: *Was kann Agent A vs Agent B?* + +**→ Direkter Implikat für OpenClaw:** Eine vergleichbare Showdown-Methodik mit [[concepts/ai-agents-2026.md]]-Setups würde zeigen, welches Modell für welchen Sub-Task im OpenClaw-Setup am besten passt. + +### 3. Open-Source-Realität 2026 + +**Sowohl Kimi K2.7 (Moonshot AI) als auch GLM-5.2 (Zhipu AI) sind konkurrenzfähige Open-Source-Coding-Modelle** mit unterschiedlichen Trade-offs: + +| Dimension | Kimi K2.7 | GLM-5.2 | +|---|---|---| +| Architektur | MoE (1T total, 32B active) | Dense (744B) | +| Kontext | 256K | **1M** | +| Lizenz | Open | **MIT** | +| Stärke (Test 1) | Speed, Innovation | Konsistenz | +| Stärke (Test 2) | Stats, Geographie | **Animation, Detail** | + +**→ Direkter Implikat für [[concepts/llm-model-fusion-ensembles.md]]:** In der OpenRouter-Fusion-Demo war Kimi K2.6 im Budget-Panel. Kimi K2.7 ist die nächste Generation und GLM-5.2 ein weiterer Kandidat. Beide könnten in heterogenen Coding-Panels Synergieeffekte erzeugen. + +### 4. Sub-Task-Spezialisierung als Schlüssel + +Statt "ein Modell für alles" zeigt der Showdown: **Beide Modelle sind kompetent, aber in verschiedenen Dimensionen stark.** Praktisch heißt das: in einer Ensemble-Architektur (Fusion) sollte man nicht nur diverse Modelle kombinieren, sondern auch **Sub-Task-spezifisch zuweisen**. + +## Pro-Leben-Perspektive + +Gemäß [[concepts/pro-leben-directive.md]]: + +**Gegen Mangelnarrativ** ("Wir sind abhängig von US-Frontier-Modellen"): +- 2026 ist das Jahr, in dem **chinesische Open-Source-Coding-Modelle Frontier-Nähe erreicht haben** — Kimi K2.7, GLM-5.2, DeepSeek-Varianten +- MIT-Lizenz für GLM-5.2 (Open Weights) ist ein handfester Schritt Richtung echter Offenheit +- Konkurrenz belebt das Feld — beide Modelle sind besser als eines allein + +**Für Handlungsfähigkeit:** +- Wer Coding-Agents baut, kann heute zwischen mehreren starken Open-Source-Modellen wählen +- Hermes Agent ist Open Source ([[concepts/ai-agents-2026.md]]-Pattern) +- Real-World-Tests sind machbar: App mit Bug + Feature bauen, beide Modelle dranlassen, vergleichen + +**Realismus:** +- Beide Modelle haben **eigene Schwächen** (Kimi bei Animation, GLM bei Innovation) +- 1M Kontext (GLM) ist nicht immer nützlich — oft sind 256K (Kimi) praxisnäher +- "Neck to neck" = **beide gut genug für Production, aber nicht perfekt** +- Standard-Benchmarks (Kimi Code Bench v2, Program Bench) bleiben als erste Approximation sinnvoll — Real-World-Tests ergänzen, ersetzen aber nicht + +## Verwandte Wiki-Seiten + +- [[concepts/llm-model-fusion-ensembles.md]] — Kimi K2.6 im Budget-Panel; Kimi K2.7 / GLM-5.2 als neue Ensemble-Kandidaten +- [[concepts/ai-agents-2026.md]] — Agent-Frameworks; Hermes Agent als alternatives Agent-Framework +- [[concepts/llm-behavior-persistence.md]] — Verhalten im Einzelmodell vs. Verhalten in Agent-Workflows +- [[tools/kimi-k2.7-code.md]] — existierende Wiki-Seite zu Kimi K2.7 (Benchmarks, Ollama Cloud) +- [[tools/anthropic-claude.md]] — Frontier-Konkurrenz (Opus 4.8 als Synthesizer in OpenRouter-Fusion) +- [[architecture/model-routing.md]] — Sub-Task-spezifische Modell-Zuweisung als Pattern +- [[concepts/llm-knowledge-base.md]] — Karpathy-Pattern: kuratierte Strukturen schlagen reine Inference + +## Externe Ressourcen + +### Video & Autor + +- [YouTube: Kimi K2.7 vs GLM-5.2 Real Coding Showdown](https://www.youtube.com/watch?v=X8C2CKMAYc0) +- [Fahd Mirza YouTube Channel](https://www.youtube.com/@fahdmirza) +- [Fahd Mirza Blog](https://www.fahdmirza.com/) +- [Fahd Mirza LinkedIn](https://www.linkedin.com/in/fahdmirza/) +- [Fahd Mirza Substack (Weekly AI Newsletter)](https://fahadmirza.substack.com/) +- [Fahd Mirza Ko-Fi](https://ko-fi.com/fahdmirza) + +### Modelle + +- [Moonshot AI](https://www.moonshot.cn/) — Hersteller Kimi +- [Zhipu AI / Z.ai](https://z.ai/) — Hersteller GLM +- [GLM-5.2 auf chat.z.ai](https://chat.z.ai) — kostenloser Zugang +- [GLM-5 Open-Source Guide (nxcode.io)](https://www.nxcode.io/resources/news/glm-5-open-source-744b-model-complete-guide-2026) +- [Ollama Cloud (Kimi K2.7)](https://ollama.com/library/kimi-k2.7-code) — siehe [[tools/kimi-k2.7-code.md]] +- [Open LLM Leaderboard (HuggingFace)](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) + +### Hermes Agent + +- [Hermes Agent GitHub (NousResearch)](https://github.com/nousresearch/hermes-agent) +- [Hermes Agent Documentation](https://hermes-agent.nousresearch.com/docs/) +- [Nous Research](https://nousresearch.com/) + +### Coding-Benchmarks & Methoden + +- [SWE-bench (Real-World Software Engineering)](https://www.swebench.com/) — Real-World-Standard +- [HumanEval (OpenAI)](https://github.com/openai/human-eval) +- [MBPP (Google Research)](https://github.com/google-research/mbpp) +- [RealWorldEval (M-A-P)](https://github.com/M-A-P/RealWorldEval) +- [MCP (Model Context Protocol)](https://modelcontextprotocol.io/) — Standard für Tool-Calls +- [Aider Benchmark Suite](https://aider.chat/docs/benchmarks.html) — Coding-Agent-Benchmarks diff --git a/wiki/index.md b/wiki/index.md index df80619..199bf3b 100644 --- a/wiki/index.md +++ b/wiki/index.md @@ -2,7 +2,7 @@ *Auto-generated: 2026-06-15* -*Letzte Aktualisierung: 2026-06-15 (5. Update)* +*Letzte Aktualisierung: 2026-06-15 (6. Update)* ## Architecture @@ -38,6 +38,7 @@ | [Semantic Similarity Rating (SSR)](concepts/semantic-similarity-rating-ssr.md) | LLM-basierte Kaufintentions-Vorhersage mit 90% Korrelation | xpost/2026-06-11_colgate-llm-purchase-intent-ssr.md | | [LLM Behavior Persistence](concepts/llm-behavior-persistence.md) | Sleeper Agents, Backdoor-Persistenz, Unlearning-Grenzen, Bias-Transfer, Catastrophic Forgetting | xpost/2026-06-14_lieselweppen-open-source-llm-backdoors.md | | [LLM Model Fusion & Ensembles](concepts/llm-model-fusion-ensembles.md) | OpenRouter Fusion, DRACO-Benchmark, Model-Panels, Self-Fusion, Budget-Panels, Anti-Contamination | blog/2026-06-12_openrouter-fusion-beats-frontier.md | +| [Real-World Coding Showdown](concepts/real-world-coding-showdown.md) | Head-to-Head-Methodik jenseits statischer Benchmarks, Kimi K2.7 vs GLM-5.2 in Hermes Agent, Sub-Task-Spezialisierung | youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md | ## Decisions @@ -68,3 +69,4 @@ | `raw/xpost/2026-06-13_roemmele-anthropic-selfdestruct.md` | xpost | Brian Roemmele: Anthropic's Selbstzerstörung | | `raw/xpost/2026-06-14_lieselweppen-open-source-llm-backdoors.md` | xpost | Liesel Weppen: Open Source bei LLMs ist "Marketing BS" — Belege aus Sleeper-Agent-/Unlearning-Forschung | | `raw/blog/2026-06-12_openrouter-fusion-beats-frontier.md` | blog | OpenRouter Fusion: Surpassing Frontier Performance with Model Panels (DRACO-Benchmark) | +| `raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md` | youtube | Fahd Mirza: Kimi K2.7 vs GLM-5.2 Real Coding Showdown in Hermes Agent | diff --git a/wiki/log.md b/wiki/log.md index b1039af..5e5cee6 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -166,3 +166,19 @@ - Self-Fusion als Pre-Routing-Layer für Quality-kritische Tasks? - Ensemble-Pattern für Subconscious-Agent Hard-Synthesis? - Excluded-Domains für eigene Evals + Subconscious-Crawls (Self-Referenz-Loops vermeiden) + +## [2026-06-15] Ingest | Kimi K2.7 vs GLM-5.2 Real Coding Showdown (Fahd Mirza) +**Type:** ingest | **Scope:** raw/youtube, wiki/concepts, wiki/tools, wiki/architecture +**Source:** @PWeber (Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic +**Actions:** +- raw: `raw/youtube/2026-06-14_fahd-mirza-kimi-k2.7-vs-glm-5.2.md` (created — Fahd Mirza YouTube-Video 14.06.2026, 14 Min, 2659 Aufrufe, 89 Likes; Head-to-Head in Hermes Agent mit Bug-Fix + Feature-Build in Flask-App) +- wiki: `concepts/real-world-coding-showdown.md` (created — Konzeptseite zu alternativer Coding-Evaluation: statische Benchmarks (HumanEval/MBPP/SWE-bench) vs. Real-World-Head-to-Head mit echtem Bug + Constraint-Satisfaction; methodische Lessons, Sub-Task-Spezialisierung, Pro-Leben-Perspektive) +- wiki: `tools/kimi-k2.7-code.md` (updated — Cross-Reference zu real-world-coding-showdown + llm-model-fusion-ensembles) +- wiki: `architecture/model-routing.md` (updated — neue Sektion "Coding-Modelle: Kimi K2.7 & GLM-5.2" mit Implikation für Sub-Task-Spezialisierung im Routing) +- index: updated (neuer Concepts-Eintrag "Real-World Coding Showdown" + Raw Sources-Eintrag) +- log: updated +**Kernkonzept:** +- Real-World-Showdown als Benchmark-Alternative: Beide Modelle, identischer Agent, identischer Prompt, komplexe Real-App mit Bug + Feature +- Kimi K2.7: schnell (~5 Min), innovativ; GLM-5.2: stark bei Animation/Detail, 1M Kontext, MIT-Lizenz +- "Neck to neck" = beide production-ready, aber Sub-Task-spezifisch optimal +- Direkter Implikat für OpenClaw: Sub-Task-Routing für Coding-Tasks, Ensemble-Pattern mit Coding-Modellen, Real-World-Validierung statt nur Standard-Benchmarks diff --git a/wiki/tools/kimi-k2.7-code.md b/wiki/tools/kimi-k2.7-code.md index 110e04e..63f720a 100644 --- a/wiki/tools/kimi-k2.7-code.md +++ b/wiki/tools/kimi-k2.7-code.md @@ -52,4 +52,6 @@ ollama run kimi-k2.7-code:cloud ## Verwandte Seiten - [Model Routing](../architecture/model-routing.md) — Fallback-Chain enthält kimi-k2.5 -- [Ecosystem Tools](ecosystem-tools-april-2026.md) — Tool-Ökosystem-Kontext \ No newline at end of file +- [Ecosystem Tools](ecosystem-tools-april-2026.md) — Tool-Ökosystem-Kontext +- [Real-World Coding Showdown](../concepts/real-world-coding-showdown.md) — Head-to-Head-Vergleich Kimi K2.7 vs GLM-5.2 in Hermes Agent (Fahd Mirza, 14.06.2026) +- [LLM Model Fusion & Ensembles](../concepts/llm-model-fusion-ensembles.md) — Kimi K2.6 im Budget-Panel; Kimi K2.7 als Nachfolger-Kandidat \ No newline at end of file