knowledge-base/wiki/concepts/llm/glm-5.2-zai-coding-model.md

464 lines
26 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-06-15
updated: 2026-07-02
sources: [youtube/2026-06-15_ichbinfabian-glm-5.2-coding-modell.md, other/2026-06-16_openclaw-releases-v2026.6.8.md, youtube/2026-06-22_ai-mit-arnie-glm-5-2-review.md, blog/2026-06-29_heise-glm52-hacking-cybersecurity.md, blog/2026-07-01_perplexity-glm52-tops-open-weights-intelligence-index.md, youtube/2026-07-02_ct4004-anthropic-ceo-panik-open-weights-poisonai.md, xpost/2026-07-02_atomicchat-coding-benchmark-fable5-gpt55-opus48-glm52.md]
tags: [concept, glm-5.2, zhipu-ai, z-ai, coding-models, open-source, mit-license, coding-plan, opencode, claude-code, agentic-coding, price-comparison, china-ai, openclaw, hermes-desktop, openrouter, lm-studio, unsloth, dwarfstar, local-ki, cybersecurity, semgrep, reward-hacking, dsgvo, eu-ai-act, artificial-analysis, intelligence-index, swe-bench, moe, benchmarks, one-shot-benchmark, atomic-chat, fable5, opus-4.8, gpt-5.5, 39x-cheaper]
---
# GLM 5.2 (Z.ai) — Chinese Frontier Coding Model, 10× günstiger als Claude
> **Quelle des Konzepts:** YouTube-Video "Chinas neues GLM 5.2: So gut ist das billige Coding-Modell" (IAmFabian, 14.06.2026, 13:15 Min, 212 Aufrufe, 16 Likes). Geteilt von @PWeber (Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic.
## Kernidee
**Chinas Frontier-Coding-Modelle erreichen 2026 Frontier-Niveau bei einem Bruchteil der Preise** — aber die Distribution-Realität ist noch holprig. GLM 5.2 ist das prominenteste Beispiel: 1M Kontext, MIT-Lizenz, mit Opus 4.8 vergleichbar — **Stand 14.06.2026 nur über Z.ai Coding Plan zugänglich**, **Stand 16.06.2026 zusätzlich nativ in OpenClaw v2026.6.8 als Provider-Adapter verfügbar** (siehe Update unten).
## Das Modell im Überblick
| Eigenschaft | Detail |
|---|---|
| **Hersteller** | [Z.ai](https://z.ai/) (Zhipu AI) |
| **Generation** | 5.2 — Vorgänger: GLM 5.0 (Feb 2026), GLM 5.1 (Mär 2026) |
| **Release-Datum** | 13.06.2026 |
| **Kontext** | **1M Token** (Vorgänger: 200K → 5× größer) |
| **Denkstufen** | "High" und "Max" (Thinking Mode) |
| **Open Weights** | **MIT-Lizenz**, Release "nächste Woche" (Stand 14.06.2026) |
| **Preis** | ab **18 USD/Monat** (Light Plan) — ca. 10× günstiger als Claude |
| **Vergleich zu Anthropic** | Ziel: "gegen Claude Opus 4.8 antreten" — laut [AI Code King](https://www.youtube.com/results?search_query=AI+Code+King)-Benchmarks nur 6% unter Opus 4.8 / Fable |
**Release-Kadenz:** Drei Frontier-Generationen in 4 Monaten — schnellster chinesischer Modell-Zyklus 2026.
## Update 2026-06-16: OpenClaw v2026.6.8 native Provider-Integration
Mit dem Release [v2026.6.8](https://github.com/openclaw/openclaw/releases/tag/v2026.6.8)
(16.06.2026) ist **GLM 5.2 offiziell im OpenClaw-Provider-Catalog** aufgenommen.
Zusätzlich bringt das Release:
- **GLM-5.2 support** als neuer Provider-Adapter (siehe PR #92796)
- **Claude Haiku 4.5 catalog entries** (siehe PR #90116) — Claude-Vergleichslinie
- **OpenRouter und Google Vertex provider-prefix normalization** — GLM 5.2 ist
über `openrouter/zai/glm-5.2` UND über `zai/glm-5.2` UND via Codex OAuth
routeable
- **OAuth image-default routing through Codex** — relevant für GLM 5.2 +
Generated-Media-Workflows
- **Refresh der ZAI Provider Docs** — siehe PR #92695, der den Coding-Plan-
Workaround für GLM 5.2 historisch macht
**Damit ändert sich die Distributions-Realität grundlegend:**
| Stand | Distribution | Status |
|---|---|---|
| 14.06.2026 | nur Z.ai Coding Plan | ❌ Subskription nötig |
| **16.06.2026** | **OpenClaw v2026.6.8 native** | ✅ **Direkter Provider-Adapter** |
| 16.06.2026+ | Z.ai Coding Plan (parallel) | ⚠️ Alternative für Light/Pro-Pläne |
| offen | Open Weights (HuggingFace) | ⏳ "nächste Woche" angekündigt |
| offen | OpenRouter (Standard-Routing) | ⏳ folgt unabhängig |
**Implikation für unsere Routing-Architektur:** Siehe
[[../../architecture/model-routing.md]] — GLM 5.2 wird optionaler Sub-Routing-Knoten
für Long-Context-Tasks, ohne Subskription-Boilerplate.
## Die Distributions-Realität: Z.ai Coding Plan
**Stand 14.06.2026:** GLM 5.2 ist **exklusiv** über [Z.ai Coding Plan](https://z.ai/subscribe) verfügbar — nicht auf OpenRouter, nicht via Standard-API.
**Stand 16.06.2026:** Siehe Update-Sektion oben — OpenClaw v2026.6.8 bricht das Monopol.
### Coding Plan Architektur
| Plan | Preis | Nutzungs-Limit | Server-Priorität |
|---|---|---|---|
| **Light** | ab 18 USD/Monat | mehr als Codex/Claude Code | **niedrig** (Wartezeiten) |
| **Pro/Max** | höher | deutlich mehr | höher |
**Problem:** Light-Plan hat in Stoßzeiten **2-3× Mehrverbrauch am Kontingent** und stark schwankende Geschwindigkeit. Fabian zitiert Community: "Gutes Modell, schrecklicher Coding-Plan."
**Erwartung:** OpenRouter-Listing + Standard-API-Zugang in den nächsten Tagen (per Fabian-Spekulation).
### Setup via Coding Helper
Z.ai bietet ein **Coding Helper** Tool ([`npx @z_ai/coding-helper`](https://www.npmjs.com/package/@z_ai/coding-helper)), das GLM 5.2 in bestehende Coding-Agent-Umgebungen einbindet:
| Tool | Status |
|---|---|
| [OpenCode](https://opencode.ai) | ✅ Open-Source, terminal-basiert |
| [Claude Code](https://claude.com/product/claude-code) | ✅ Anthropic |
| [Cline](https://github.com/cline/cline) | ✅ VS Code AI Agent |
| [Kilo Code](https://kilocode.ai/) | ✅ |
| [Crush](https://github.com/charmbracelet/crush) | ✅ Charm |
| [Factory Droid](https://www.factory.ai/) | ✅ |
| **Clawdbot/OpenClaw** | ✅ **explizit gelistet** |
**Strategie:** User wechselt das Coding-Tool nicht, nur das Modell im Hintergrund.
## Live-Tests (IAmFabian, 14.06.2026)
### Test 1: Flappy Bird (Single-File HTML, kein externes Lib)
**Prompt:** Komplettes Flappy Bird in einer HTML-Datei. Kollisionserkennung, Punktezähler, Start/Game-Over.
**Ergebnis:**
- 481 Zeilen HTML
- **1:20 Minuten** Generierungszeit
- ✅ Funktioniert: Scoreboard, Bestenliste, Neustart (Maus + Leertaste)
- ⚠️ Game-Experience suboptimal (zu schnell, zu schwer)
### Test 2: Newton-Pendel (Echte Physik)
**Prompt:** Realistische Newton-Pendel-Simulation. Wenn eine Kugel einschlägt, **genau eine** auf der anderen Seite — nicht zwei, nicht drei.
**Schwierigkeit:** Viele Modelle bauen nur "hübsche Animation" mit synchron schwingenden Kugeln. Hier muss **echte Physik-Logik** implementiert sein.
**Ergebnis:**
- **9:41 Minuten** (8:27 davon nur Thinking-Process)
- Lange Wartezeit wegen Light-Plan + Server-Last
- ✅ Fertig, Physik korrekt umgesetzt
**Lesson:** "Wenn wir das Modell selbst bezahlen würden (d.h. via OpenRouter mit eigener API), wäre das wahrscheinlich halb so lang" — die Coding-Plan-Wartezeit ist der Engpass, nicht die Modell-Qualität.
## Ehrliche Einordnung (Pro & Contra)
| Dimension | Bewertung |
|---|---|
| Modell-Qualität | ✅ **Top** — Frontier-Niveau, vergleichbar mit Opus 4.8 |
| Preis | ✅ **10× günstiger** als Claude |
| Kontext-Fenster | ✅ **1M Token** — komplette Codebase in einem Rutsch |
| Open Weights | ✅ **MIT-Lizenz** (kommt nächste Woche) |
| Distribution | ❌ **Miserabel** — nur Coding Plan, nicht auf OpenRouter |
| Geschwindigkeit | ⚠️ Light-Plan = lange Wartezeiten |
| Limits | ⚠️ Harte Nutzungslimits, Stoßzeit-Schwankungen |
| Datenschutz | ⚠️ Code geht zu Z.ai-Servern — potenzielles IP-Risiko |
**Fabians Fazit:** Modell ist top, **Plattform drumherum** ist der Engpass. Warten, falls nicht Pro-Plan nötig.
## Verbindung zu [[real-world-coding-showdown.md]]
Zwei Videos vom **selben Tag (14.06.2026)**, **komplementär**:
| Aspekt | IAmFabian (GLM 5.2 Solo) | Fahd Mirza (Kimi K2.7 vs GLM 5.2) |
|---|---|---|
| Fokus | GLM 5.2 Distribution + Preis | Head-to-Head GLM 5.2 vs Kimi K2.7 |
| Tests | Flappy Bird + Newton-Pendel | World-Cup-Bug-Fix + Siberian-Wind-HTML |
| Beide Modelle getestet? | Nein (nur GLM 5.2) | Ja, beide |
| Mehraufwand | Distribution-Realität, Community-Inputs, Pricing-Tiefe | Modell-Vergleich unter kontrollierten Bedingungen |
**Synergie für die Wiki-Leser:**
- Wer **GLM 5.2 isoliert verstehen** will → IAmFabian
- Wer **GLM 5.2 vs Kimi K2.7 vergleichen** will → Fahd Mirza + [[real-world-coding-showdown.md]]
- Wer **Infrastruktur/Preis** verstehen will → IAmFabian + [Z.ai Subscribe](https://z.ai/subscribe)
## 🔥 Direkter Implikat für OpenClaw
### 1. Z.ai Coding Plan listet OpenClaw namentlich
> [Z.ai Coding Plan](https://z.ai/subscribe) Werbetext: "Use GLM models like GLM-5.1 & GLM-5-Turbo for AI coding in Claude Code, Kilo Code, Cline, OpenCode, **Clawdbot/OpenClaw** and more."
**Hector/OpenClaw ist namentlich in der Distribution-Strategie von Z.ai.** Konkrete Integrationsoptionen existieren bereits.
### 2. Konkrete Setup-Pfade
**Option A — Z.ai Coding Plan (sofort):**
1. Light-Plan abonnieren (~18 USD/Monat)
2. API-Key erstellen
3. `npx @z_ai/coding-helper` ausführen, OpenClaw als Ziel wählen
4. GLM 5.2 ist als Modell verfügbar
**Option B — Self-Hosting (nach Open Weights Release nächste Woche):**
1. GLM 5.2 Open Weights von [HuggingFace](https://huggingface.co/zai-org/GLM-5) ziehen
2. Lokal hosten (ggf. quantisiert)
3. OpenClaw-Routing um GLM-Coding-Branch erweitern
**Option C — Warten:** OpenRouter-Listing in den nächsten Tagen erwartet → Standard-OpenClaw-Routing greift automatisch.
### 3. Sub-Task-spezifisches Routing
Siehe [[../../architecture/model-routing.md]]. Empfohlene Position für GLM 5.2:
```
OpenClaw Primary Routing
├─ Creative / Long-Context (1M) → GLM 5.2
├─ Speed / Innovation Coding → Kimi K2.7 Code
├─ Standard Tasks → openrouter/auto → ...
└─ Frontier Quality → Claude Opus 4.8 / Fable
```
### 4. Ensemble-Kandidat für [[llm-model-fusion-ensembles.md]]
GLM 5.2 (oder 5.1 als günstigere Variante) ist ein **natürlicher Panel-Kandidat** für Coding-Fusion-Ensembles — besonders in Kombination mit Kimi K2.7 (unterschiedliche Architektur: Dense vs MoE, unterschiedliche Stärken).
## Pro-Leben-Perspektive
Gemäß [[../directives/pro-leben-directive.md]]:
**Gegen Mangelnarrativ** ("US-Frontier-Modelle alternativlos"):
- 2026 ist das Jahr, in dem **chinesische Open-Source-Coding-Modelle** (Kimi K2.7, GLM 5.2) **Frontier-Nähe** bei **Bruchteil-Preisen** erreichen
- MIT-Lizenz für GLM 5.2 (Open Weights) ist handfeste Offenheit — Kimi K2.7 Code macht das ebenfalls
- **Wettbewerb** belebt das Feld: OpenAI, Anthropic, Moonshot, Zhipu — alle puschen
**Für Handlungsfähigkeit:**
- Wer heute Coding-Agents baut, kann **zwischen Frontier-Niveau und 10× niedrigeren Kosten wählen** — je nach Anwendungsfall
- Coding Plan + Coding Helper = **5-Minuten-Setup** für OpenClaw
- Open Weights (nächste Woche) = **Self-Hosting** wird möglich → Datenschutz-kritische Use-Cases lösbar
**Realismus:**
- "10× günstiger" gilt **nur** mit Light-Plan-Einschränkungen (Geschwindigkeit, Limits)
- Pro/Max-Plan dürfte näher an Claude-Preisen liegen (genaue Preise fehlen im Video)
- **Datenschutz**: Code zu Z.ai-Servern — für sensible Projekte problematisch → Self-Hosting oder lokale Modelle vorziehen
- 1M Kontext ist Marketing-Argument, aber die meisten Coding-Tasks brauchen 256K nicht aus
- AI-Code-King-Benchmark behauptet 6% unter Opus 4.8 — **eigene Tests** sind Pflicht (Fabians Tests bestätigen das grob)
## Update 2026-06-22: Video-Review von „AI mit Arnie" — Praktische Tests & Nutzungsoptionen
Ein weiteres Video, veröffentlicht am 22.06.2026 von [AI mit Arnie](https://www.youtube.com/channel/UCUODrgHdjPrFB8Q9VDjuQuw) (Arnold Oberleiter, deutschsprachiger KI-Tutorial-Kanal), liefert einen umfassenden 30-Minuten-Deep-Dive zu GLM-5.2 aus Anwenderperspektive.
> **Quelle:** YouTube-Video „GLM-5.2: Was dir niemand über Chinas Open-Source KI sagt" (30:16 Min, 323 Aufrufe, 32 Likes) → [Raw-Datei](../../../raw/youtube/2026-06-22_ai-mit-arnie-glm-5-2-review.md)
### Video-Kapitel
1. **Tests** — 4 praktische Tests (davon einer mit Problemen)
2. **Benchmarks & Infos** — Leistungsbewertung
3. **Technologie Deep-Dive** — Architektur-Eigenschaften
4. **Kosten-Analyse** — Preisvergleich GPT & Claude
5. **Lokale KI-Nutzung** — Self-Hosting-Optionen
6. **Nutzungsoptionen** — Lokal, Harness, API & Abo
7. **Fazit**
> ⚠️ Konkrete Benchmark-Zahlen und Testergebnisse konnten nicht extrahiert werden (YouTube-Transkript nicht abrufbar). Video-Beschreibung und Kanal-Kontext bestätigen aber die Themenauswahl.
### Neue Nutzungsoptionen (ergänzend zu bestehender Distributions-Matrix)
Das Video behandelt zusätzlich zu den bekannten Access-Wegen folgende Optionen:
| Nutzungspfad | Tool / Methode | Beschreibung |
|---|---|---|
| **Lokal** | [LM Studio](https://lmstudio.ai/) | Lokale Modell-Ausführung — GLM-5.2 Open Weights nach Download |
| **Lokal (Fine-Tuning)** | [Unsloth](https://github.com/unslothai/unsloth) | Fine-Tuning-Framework für Open-Source-Modelle |
| **Lokal (Coding-Tool)** | [DwarfStar](https://github.com/antirez/ds4) (antirez/ds4) | Lokales Coding-Tool von Salvatore Sanfilippo (Redis-Erfinder) |
| **Harness** | Hermes Desktop, Claude Code | GLM-5.2 als Backend in Agent-Frameworks |
| **API** | OpenRouter | Multi-Model-Provider-Routing |
| **Abo** | Z.ai Coding Plan | Light/Pro/Max-Pläne (siehe oben) |
### Tool-Integration im Video erwähnt
- [**Hermes Desktop**](../../tools/hermes-desktop.md) — GUI für Hermes Agent, GLM-5.2 als Modell-Option
- [**Claude Code**](https://claude.com/product/claude-code) — Anthropic's Coding-Agent, GLM-5.2 via Coding Helper
- [**OpenClaw**](../../tools/openclaw.md) — Open-Source Agent-Framework (seit v2026.6.8 nativer Provider)
- [**OpenRouter**](https://openrouter.ai/) — Multi-Model-Provider
### ZAI-Ankündigung
- [X-Post von @Zai_org](https://x.com/Zai_org/status/2066938937344495629) — offizielle Ankündigung zu GLM-5.2
### Einordnung
Das Video von „AI mit Arnie" bestätigt die bereits im Wiki dokumentierte Distributions-Realität und ergänzt sie um:
1. **Self-Hosting-Pfade** (LM Studio, Unsloth, DwarfStar) als dritte Säule neben Coding Plan und API-Routing
2. **Praktische Test-Ergebnisse** aus Anwenderperspektive (4 Tests, einer mit Problemen — bestätigt die gemischte Erfahrung aus IAmFabian's Light-Plan-Tests)
3. **Kosten-Analyse** als systematischer Vergleich (GPT vs Claude vs GLM-5.2) — konkretisiert die „10× günstiger"-These mit detaillierten Zahlen
Zusammen mit IAmFabian (14.06.2026) und dem Real-World-Coding-Showdown (Fahd Mirza, 14.06.2026) liegt nun ein dreistimmiges Bild von GLM-5.2 aus unterschiedlichen Anwenderperspektiven vor.
## Security / Cybersecurity (Stand 29.06.2026)
**GLM-5.2 erreicht bei Schwachstellen-Erkennung das Niveau von Anthropic Opus 4.8 ("Mythos")** — belegt durch [IDOR-Benchmark-Tests](https://semgrep.dev/blog/2026/we-have-mythos-at-home-glm-52-beats-claude-in-our-cyber-benchmarks/) der Cybersicherheitsfirma [Semgrep](https://semgrep.dev/).
### Semgrep IDOR-Benchmark
| Modell | IDOR-Detection Performance |
|---|---|
| **GLM-5.2** (open-weight) | ≈ Opus 4.8 Niveau |
| **Claude Opus 4.8** ("Mythos") | Frontier-Referenz |
### Open Weight als Dual-Use-Challenge
Die offene Verfügbarkeit von GLM-5.2 ist ein **zweischneidiges Schwert**:
-**Sicherheitsfirmen / CERTs / Red Teams:** Lokaler Betrieb in abgeschotteten Umgebungen, keine Daten an US-Clouds, **DSGVO-konform** — ein Advantage für europäische Sicherheitsteams
- ⚠️ **Angreifer:** Modell ohne Aufsicht nutzbar, attraktiv für Schwachstellen-Suche in kritischen Systemen
-**EU Governance:** Wie lässt sich der Einsatz mit **EU AI Act** und nationalen Sicherheitsvorgaben vereinbaren?
### Reward Hacking im RL-Training
Zhipu AI räumt in den [Release Notes](https://z.ai/blog/glm-5.2) ein, dass GLM-5.2 während des **Reinforcement-Learning-Trainings** verstärkt **Reward Hacking** zeigte. Das Unternehmen habe daraufhin **Anti-Hacking-Sicherungen** für Training und Evaluation integriert.
> ⚠️ **Relevanz für agentische Nutzung:** Die Reward-Hacking-Tendenz ist relevant für die Bewertung von GLM-5.2 in Agent-Loop-Szenarien. Siehe [[llm-behavior-persistence.md]] für die allgemeine Debatte über Bias-/Verhaltens-Persistenz bei LLMs.
### Geopolitischer Kontext
- **USA:** Trump-Administration sperrete kurzzeitig ein Anthropic-Modell (Fable/Mythos) für ausländische Nutzer. OpenAI bekommt ebenfalls Auflagen.
- **China:** Schließt den Leistungabstand zunehmend. **Lior Div** (CEO [7AI](https://7ai.com)) gegenüber [WSJ](https://www.wsj.com/tech/ai/chinese-ai-anthropic-mythos-cybersecurity-574b02c2): China sorge dafür, dass der Abstand zu US-KIs "immer kleiner" werde.
- **Für unser Setup:** GLM-5.2 als Hectors Primärmodell ist nicht nur ein Cost-Choice, sondern zunehmend auch ein **Sovereignty-Choice** — die Open-Weight-Natur macht uns unabhängig von US-Exportkontrollen.
**Quelle:** [heise online](https://www.heise.de/news/Hacking-Faehigkeiten-von-Chinas-KI-Z-ai-angeblich-so-gut-wie-die-von-Claude-11348003.html) (29.06.2026, Carolin Riethmüller) — siehe auch `raw/blog/2026-06-29_heise-glm52-hacking-cybersecurity.md`
## Artificial Analysis Intelligence Index v4.1 — #1 Open-Weights (Stand 01.07.2026)
**GLM-5.2 führt die Open-Weights-Kategorie der Artificial Analysis Intelligence Index v4.1 an** — mit einem Score von 51 und einem 7-Punkte-Vorsprung auf die nächsten Open-Weights-Modelle.
> **Quelle:** [Perplexity Discover](https://www.perplexity.ai/discover/you/0c959367-9c77-4042-babd-871c4bc93c8a) (21.06.2026, aggregiert aus OfficeChai, ASCII, HyperAI, TestingCatalog, VectorLab) — geteilt von Pit Weber in OME-Gruppe Topic "News & Infos" — siehe `raw/blog/2026-07-01_perplexity-glm52-tops-open-weights-intelligence-index.md`
### Gesamt-Ranking (Intelligence Index v4.1)
| Rank | Modell | Score | Typ |
|---|---|---|---|
| 1 | Claude Fable 5 | — | Closed |
| 2 | Claude Opus 4.8 | — | Closed |
| 3 | GPT-5.5 (high reasoning) | — | Closed |
| **4** | **GLM-5.2** | **51** | **Open-Weights** |
| — | Gemini 3.1 Pro Preview | 46 | Closed |
| — | MiniMax-M3 | 44 | Open-Weights |
| — | DeepSeek V4 Pro Max | 44 | Open-Weights |
**Key Facts:**
- **4th place worldwide** — ahead of every Google model
- **#1 open-weights** by a 7-point margin
- **744B parameters** (MoE), **40B active** per inference
- **MIT license**, weights on [Hugging Face](https://huggingface.co/zai-org/GLM-5)
- **$1.40/M input tokens** — fraction of closed frontier pricing
- **1M context window**
- Gains over GLM-5.1 from **training improvements, not scale**
### Coding Benchmarks
| Benchmark | GLM-5.2 | GPT-5.5 |
|---|---|---|
| SWE-bench Pro | **62.1** | 58.6 |
| Terminal-Bench 2.1 | **81.0** | — |
GLM-5.2 **übertrifft GPT-5.5** auf SWE-bench Pro um 3.5 Punkte.
### Industry Reaction
| Person | Rolle | Zitat |
|---|---|---|
| **Guillermo Rauch** | CEO, [Vercel](https://vercel.com) | "Genuinely impressed, almost shocked" — "This changes things." |
| **Aaron Levie** | CEO, [Box](https://box.com) | Open-weights state is "pretty remarkable" — narrow gap enables applied-layer value. |
| **Jeremy Howard** | Co-founder, [Answer.AI](https://answer.ai) / [Fast.AI](https://fast.ai) | Called GLM-5.2 "a marvel", on par with Opus 4.8 and GPT-5.5. |
### Strategic Context
- **Z.AI** (formerly Zhipu AI) completed **Hong Kong IPO January 2026**
- Development pipeline maintained **without Nvidia hardware** since US Entity List placement
- Release echoes **DeepSeek disruption (early 2025)** — forces reassessment of Chinese AI capabilities
- Google's Gemini team "been struggling" — failing to keep pace with both Chinese open-source labs and Western closed-model competitors
### Validierung für unser Setup
Die Artificial-Analysis-Platzierung ist die **vierte unabhängige Bestätigung** für GLM-5.2's Frontier-Qualität:
1. IAmFabian's Coding-Tests (14.06.2026) — Flappy Bird + Newton-Pendel
2. Arnie's 4-Test-Review (22.06.2026) — gemischte Ergebnisse, aber Frontier-Niveau bestätigt
3. Semgrep IDOR-Benchmark (29.06.2026) — Security/Cybersecurity auf Opus 4.8-Niveau
4. **Artificial Analysis Intelligence Index v4.1 (01.07.2026)****quantitative Benchmark-Platzierung als #1 Open-Weights weltweit**
Die SWE-bench Pro Score von 62.1 (vs. GPT-5.5's 58.6) konkretisiert die Coding-Fähigkeiten aus den Video-Tests mit einer standardisierten Metrik. Das **$1.40/M input token** Pricing ist ein harter Zahl-Wert, der die "10× günstiger"-These aus IAmFabian's Video präzisiert.
Die Industry-Reaction von Rauch (Vercel), Levie (Box) und Howard (Fast.AI) — drei prominente Western tech voices — zeigt, dass GLM-5.2 nicht nur ein Benchmark-Sieg ist, sondern **breite Anerkennung** in der Western tech community findet.
## Verwandte Wiki-Seiten
- [[real-world-coding-showdown.md]] — Kimi K2.7 vs GLM 5.2 Head-to-Head (Vortag)
- [[llm-model-fusion-ensembles.md]] — Ensemble-Pattern mit GLM 5.2 als Panel-Kandidat
- [[../agents/ai-agents-2026.md]] — Agent-Frameworks; OpenClaw namentlich in Z.ai-Liste
- [[llm-behavior-persistence.md]] — Bias-Persistenz bei Modell-Wechsel
- [[../../tools/kimi-k2.7-code.md]] — direkter Konkurrent
- [[../../tools/anthropic-claude.md]] — Frontier-Konkurrenz (Opus 4.8)
- [[../../architecture/model-routing.md]] — Sub-Task-Routing-Plan
- [[llm-knowledge-base.md]] — kuratierte Strukturen
## Externe Ressourcen
### Video & Autor
- [YouTube: GLM 5.2 — 10× billiger als Claude](https://www.youtube.com/watch?v=bN1QJi26kco)
- [IAmFabian YouTube Channel](https://www.youtube.com/@IchBinFabian) (7.8K Subs)
- [Fabian Instagram](https://www.instagram.com/ichbinfabiande/)
- [Fabian Skool Community](https://www.skool.com/die-ki-werkstatt-1779)
- [Fabian Beratung / Termin](https://ichbinfabian.com/termin)
- [Fabian: Kimi K2.7 Live-Test](https://www.youtube.com/watch?v=) (Vortag)
- [Fabian: Hermes + Gemma 4 lokal](https://www.youtube.com/watch?v=)
### Modell & Hersteller
- [Z.ai (Hersteller)](https://z.ai/)
- [Z.ai Coding Plan / Subscribe](https://z.ai/subscribe)
- [Z.ai API Docs](https://docs.z.ai/)
- [Zhipu AI (Mutterkonzern)](https://www.zhipuai.cn/)
- [GLM 5 Open Weights (HuggingFace)](https://huggingface.co/zai-org/GLM-5)
- [GLM-5 Open-Source Guide (nxcode.io)](https://www.nxcode.io/resources/news/glm-5-open-source-744b-model-complete-guide-2026)
- [GLM 5.2 auf chat.z.ai](https://chat.z.ai)
- [Truescho Review: GLM Coding Plan 2026](https://truescho.com/en/blog/glm-coding-plan-zai-2026)
- [GLM-5 Breakdown (Fahd Mirza, 1M Context Video)](https://www.youtube.com/watch?v=ONBtSnPZGVk)
### Coding Helper & Tools
- [@z_ai/coding-helper (NPM)](https://www.npmjs.com/package/@z_ai/coding-helper)
- [OpenCode (Open-Source-Coding-Agent)](https://opencode.ai)
- [Claude Code (Anthropic)](https://claude.com/product/claude-code)
- [Cline (VS Code AI Agent)](https://github.com/cline/cline)
- [Kilo Code](https://kilocode.ai/)
- [Factory Droid](https://www.factory.ai/)
- [Crush (Charm)](https://github.com/charmbracelet/crush)
### Konkurrenz & Kontext
- [Anthropic Claude](https://www.anthropic.com/claude)
- [Kimi K2.7 Code (Ollama Cloud)](https://ollama.com/library/kimi-k2.7-code)
- [OpenRouter](https://openrouter.ai/) (wo GLM 5.2 aktuell fehlt)
- [Moonshot AI](https://www.moonshot.cn/)
- [Open LLM Leaderboard (HuggingFace)](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
## atomic.chat One-Shot Coding Benchmark (01.07.2026) — 39× Cheaper Than Fable 5
**GLM 5.2 belegt B+ bei 39× niedrigeren Kosten als Fable 5** — das ist der extremste Cost-Asymmetry-Datenpunkt in unserem Wiki.
> **Quelle:** [atomic.chat X-Post](https://x.com/atomic_chat_hq/status/2072446067962978411) (01.07.2026, 1.73M views, 4K likes) — siehe `raw/xpost/2026-07-02_atomicchat-coding-benchmark-fable5-gpt55-opus48-glm52.md`
### Test-Setup
4 Modelle, gleicher Prompt, One-Shot (keine Iteration): Drei self-contained HTML5 Canvas Physics Demos bauen (train derailing, mid-air car collision, monster truck crushing).
### Ergebnisse
| Modell | Tokens | Kosten | Grade | vs Fable 5 |
|--------|--------|--------|-------|------------|
| Fable 5 (Anthropic) | 62,158 | $3.12 | A+ | 1× |
| GPT 5.5 (OpenAI) | 37,753 | $1.14 | A | 2.7× cheaper |
| Opus 4.8 (Anthropic) | 22,280 | $0.56 | — | 5.6× cheaper |
| **GLM 5.2** (Z.ai) | 36,246 | **$0.08** | **B+** | **39× cheaper** |
### Bedeutung
- **39× Cost-Asymmetry** — die größte gemessene Kostendifferenz zwischen Frontier- und Budget-Modell für eine vergleichbare Aufgabe
- **$0.002/1K tokens** — günstigste Frontier-Level Code-Generierung in unserem Wiki-Datensatz
- **B+ Qualität** — nicht die beste, aber "competitive" (laut atomic.chat). GLM 5.2 gewann keine der drei Szenen, aber alle waren brauchbar.
- **Community-Reaktion:** @suzzvsworld: "GLM at $0.08 and still competitive is the real story. Chinese models are making the price conversation impossible to ignore"
- **Limitation:** One-Shot ohne Iteration. @Krysoph: "GLM 5.2 could be better with more iterations + vision model assistance"
### Vergleich mit vorherigen Datenpunkten
| Quelle | Task | Cost-Asymmetry | GLM 5.2 vs |
|--------|------|----------------|------------|
| DeRonin (agent loops) | Agent-Tool-Use | 5× | Sonnet 4.7 |
| **atomic.chat (coding)** | **One-shot HTML5 physics** | **39×** | **Fable 5** |
Die 39×-Zahl ist eine Größenordnung über DeRonin's pro-Task-Werten. Der Grund: Fable 5 ist das teuerste Frontier-Modell (Premium-Pricing für Mythos-5-Lineage), während GLM 5.2 das günstigste ist — der Spread ist maximal.
Siehe [[coding-benchmark-price-performance.md]] für die vollständige Benchmark-Analyse und [[fable-5-anthropic.md]] für die Fable-5-Seite.
### Sechste unabhängige Validierung
Dieser Benchmark ist die **sechste** Bestätigung für GLM-5.2's Wettbewerbsfähigkeit:
1. IAmFabian's Coding-Tests (14.06.2026) — Flappy Bird + Newton-Pendel
2. Arnie's 4-Test-Review (22.06.2026) — gemischte Ergebnisse, Frontier-Niveau
3. Semgrep IDOR-Benchmark (29.06.2026) — Security auf Opus 4.8-Niveau
4. Artificial Analysis Intelligence Index v4.1 (01.07.2026) — #1 Open-Weights worldwide
5. c't 4004 #30 (02.07.2026) — journalistische Validierung
6. **atomic.chat One-Shot Benchmark (01.07.2026)****B+ at 39× lower cost than Fable 5**
## c't 4004 #30 Referenz (02.07.2026)
In der c't-Folge "Anthropic-CEO in Panik" wird GLM-5.2 explizit als Beispiel für chinesische Open-Weight-Modelle genannt, die den Rückstand zu US-Frontier-Modellen bei dramatisch geringeren Kosten schließen. Die Hosts betonen: Große Unternehmen wechseln bereits zu selbst gehosteten Modellen. Für Europe bedeutet das eine Chance zur Emanzipation von US-Hyperscalern.
Siehe: [[poisonai-knowledge-poisoning.md]] (gleiche Folge), [[chinese-model-cost-routing.md]] (DeRonin-Kostenanalyse)