knowledge-base/wiki/concepts/llm/glm-5.3-z-ai.md

171 lines
11 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-08-14
updated: 2026-09-08
sources: [youtube/2026-08-14_glm-5.3-aicodeking.md, xpost/2026-08-26_zai-glm53-flash-release.md, podcast/2026-09-08_agentstack-daily-ep111-openclaw-91.md, other/2026-09-17_ollama-benchmarks-glm-53-flash-vs-deepseek-v41-flash.md]
tags: [concept, glm-5.3, glm-5.3-flash, z-ai, zhipu-ai, coding-models, chinese-ai, benchmarks, aicodeking, moe, multimodal, mit-license, ox-alpha]
---
# GLM 5.3 (Z.ai) — Neue Generation der GLM-Serie
> **Quelle des Konzepts:** YouTube-Video "GLM-5.3 (Fully Tested): I GOT EARLY ACCESS & IT'S #1 ON MY BENCH!" (AICodeKing, 2026-08-14). Geteilt von @PWeber (Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic.
## Kernidee
**AICodeKing hat Early Access zu GLM 5.3 erhalten und platziert es auf Platz #1 seines eigenen Benchmarks** ("I GOT EARLY ACCESS & IT'S #1 ON MY BENCH!"). GLM 5.3 ist eine neue Generation der GLM-Serie von [[../../institutions/z-ai.md|Z.ai (Zhipu AI)]].
## Einordnung in die GLM-Familie
| Generation | Release | Kontext | Quelle |
|---|---|---|---|
| GLM 5.0 | Feb 2026 | Vorgänger | — |
| GLM 5.1 | Mär 2026 | Vorgänger | — |
| **GLM 5.2** | 13.06.2026 | 1M Kontext, MIT-Lizenz, 10× günstiger als Claude | [[glm-5.2-zai-coding-model.md]] |
| **GLM 5.3** | getestet Aug 2026 | Early Access, AICodeKing-Benchmark #1 | diese Seite |
| GLM 5.5 | angekündigt 20.07.2026 | >1 Bio. Parameter, 1M Kontext, Launch erwartet Aug 2026 | [[glm-5.5-z-ai.md]] |
**Release-Kadenz:** Vier Generationen in ~7 Monaten — die schnellste Frontier-Modell-Kadenz der Branche. GLM 5.2 und 5.3 überschneiden sich mit dem angekündigten GLM 5.5 (mehrere Parallel-Tracks bei Z.ai).
## Einordnung
- **"Fully Tested"-Review** von AICodeKing — gleicher Kanal wie das DeepSeek-V4-Pro-0813-Review ([[../../people/aicodeking.md|AICodeKing]])
- Titel behauptet **Platz #1 auf AICodeKings eigenem Benchmark** — deutet auf starke Coding-Performance
- **Early Access** — GLM 5.3 war zum Zeitpunkt des Videos noch nicht öffentlich breit verfügbar
- Verortung in der chinesischen Open-Weight-Welle ([[../chinese-ai-wave-july-2026.md]])
## Konkrete Bench-Zahlen (nachgezogen 2026-08-14)
> Quelle: HermanButlerBot-Zusammenfassung in OME Topic 13 (2026-08-14), basierend auf AICodeKings Video. Original-Transkript nicht abrufbar (Bot-Cookies).
| Bench | Ergebnis | Kontext |
|---|---|---|
| **Kingbench 3** | **73/80 = 91,25% → Platz 1** | über Fable 5 (82,5), Kimi K3 + Opus 5 (je 77,5). GLM 5.2 lag vor 2 Monaten bei 75% — Sprung **75 → 91,25** bei gleichen Parametern |
**Kernbefunde des Reviews:**
- **Security-Spezialisierung als Booster:** Wer Code auditieren kann, versteht Code tief — zeigte sich im gesamten Coding-Bench.
- **"Open-Source Shield Initiative":** Defensive Fähigkeiten offen, gefährliche Seite per Layered Safeguards / Trusted Access gegated — vom Reviewer als vernünftig für ein Open Model bewertet.
- **Bench-Highlights:** Kontaktlinsen-Behälter in 3JS (3→8), Klapptisch (10, schlägt Fable), Panda-SVG (10, "bestes Panda-Burger-SVG ever"), autonomes Feintuning einer Gemma 2B inkl. Web-UI (10), schwerste Aufgabe — funktionierende 3D-GMT-Uhr mit Echtzeit-Zeigern (7, bestes je vergebenes; Fable: 4, Opus 5: 3).
- **Ehrliches Fazit:** schlägt Fable in den meisten Fällen; Fable behält Vorteile bei extrem langen, komplexen Horizonten. Frontend UND Backend stark — für ein Open Model ungewöhnlich ("UI sieht nicht nach 2023 aus").
**Warum es zählt:** 2 Monate zwischen Releases, gleiche Architektur, trotzdem großer Sprung — plus ein chinesisches Open Model, das auf einem Coding-Bench die Frontier-Labs schlägt. Setzt US-Labore unter Druck.
## Relevanz für Hectors Stack
- **GLM-5.2 ist das Primary-Modell** in OpenClaw (`ollama/glm-5.2:cloud`) — GLM 5.3 ist die natürliche Nachfolgegeneration
- Falls GLM 5.3 über Ollama Cloud / Z.ai verfügbar wird, könnte es das Routing-Konzept ([[../../architecture/model-routing.md]]) erweitern
> **Update 26.08.2026:** GLM-5.3-Flash offiziell released — siehe neuen Abschnitt [„GLM-5.3-Flash: Offizieller Release (26.08.2026)"](#glm-53-flash-offizieller-release-26082026) unten. Das Modell war zuvor als anonymes „Ox Alpha" auf OpenRouter im Stealth-Preview; Z.ai hat dies im Release-Announcement explizit bestätigt („Previously previewed as Ox Alpha"). Siehe [[ox-alpha-anonymous-model.md]] für die vollständige Stealth-Historie und Auflösung.
## GLM-5.3-Flash: Offizieller Release (26.08.2026)
Z.ai hat GLM-5.3-Flash am 26.08.2026 offiziell released — das erste **nativ multimodale** Modell der GLM-5-Serie. Ankündigung: https://x.com/Zai_org/status/2092616204787626030 — HuggingFace-Weights: https://huggingface.co/zai-org/GLM-5.3-Flash — geteilt von Kai (@PWeber) in OME Topic 13 (#12787).
### Spezifikationen
| Eigenschaft | Wert |
|---|---|
| Architektur | 320B total / 18B aktiv pro Token (MoE) |
| Kontextfenster | 1.048.576 Tokens (1M) |
| Modalität | nativ multimodal (Text + Bild + Video → Text) |
| Lizenz | MIT |
| Training | auf chinesischen KI-Chips |
| Pre-Training-Corpus | 30T Tokens (multimodal) |
| Architektur-Neuerung | Hybrid Sparse + Linear Attention (erste in GLM-Serie), Manifold-Constrained Hyper-Connections (mHC) |
| Base Model | neu trainiert (kein Incremental-Update von 5.2) |
### API-Pricing (per 1M Tokens)
| Token-Typ | Preis |
|---|---|
| Input | $0.15 |
| Output | $0.50 |
| Cached Input | $0.03 |
### Benchmark-Tabelle (Ollama-Modellseite, abgerufen 17.09.2026)
> Quelle: https://ollama.com/library/glm-5.3-flash — Hersteller-Selbstauskunft (Z.ai), nicht unabhängig nachgemessen. Vollständige Tabelle inkl. Vision-Block: `raw/other/2026-09-17_ollama-benchmarks-glm-53-flash-vs-deepseek-v41-flash.md`.
| Benchmark | GLM-5.3-Flash | GLM-5.2 |
|---|---|---|
| Terminal Bench 2.1 | 84,3 | 81,0 |
| DeepSWE v1.1 | 63,4 | 46,2 |
| NL2Repo | 56,3 | 48,9 |
| Toolathlon Verified | 78,4 | 59,9 |
| AutomationBench v1.0.6 | 48,8 | 26,2 |
| Agents Last Exam | 26,3 | 20,4 |
| HLE w/ Tools | 55,3 | 54,7 |
| GDPval-AA v2 | 1773 | 1504 |
| OfficeQA Pro | 62,4 | — |
| CharXiv Reasoning w/ Tools | 89,4 | — |
| Chartography w/ Tools | 78,0 | — |
| BabyVision | 53,4 | — |
| MVBench | 77,8 | — |
| MMVU | 80,5 | — |
### Flash gegen Flash: GLM-5.3-Flash vs. DeepSeek-V4.1-Flash
> ⚠️ **Spaltenbeschriftungs-Falle:** Die Vergleichstabelle auf `ollama.com/library/deepseek-v4.1-flash` beschriftet ihre GLM-Spalte im HTML mit **„GLM-5.3"**, nicht „GLM-5.3-Flash". Ein Flash-gegen-Flash-Vergleich über diese Spalte vergleicht also das große Geschwister mit. Beide Modelle haben eigene Tabellen — die sind die richtige Quelle.
| Benchmark | GLM-5.3-Flash | DS-V4.1-Flash | Vorsprung |
|---|---|---|---|
| DeepSWE v1.1 | 63,4 | 74,2 | DeepSeek +17 % |
| Terminal Bench 2.1 | 84,3 | 90,6 | DeepSeek |
| NL2Repo | 56,3 | 64,0 | DeepSeek +14 % |
| AutomationBench | 48,8 | 54,8 | DeepSeek +12 % |
| Agents Last Exam | 26,3 | 31,8 | DeepSeek +21 % |
| HLE w/ Tools | 55,3 | 63,9 | DeepSeek +16 % |
| Toolathlon Verified | 78,4 | — | GLM (kein DS-Wert) |
| Terminal Bench 4.0 | — (nicht gelistet) | 31,2 | — |
| Vision-Block (MVBench/MMVU) | 77,8 / 80,5 | — (kein MVBench; BabyVision 89,6) | gemischt |
**Lesehilfe:** Auf den Agentic- und Coding-Benchmarks liegt DeepSeek durchweg vorn. GLM-5.3-Flash hat seinen eigenen Schwerpunkt im Vision-Block und beim Toolathlon. Für Tool-Ketten, Repo-Arbeit und Automatisierung sprechen die Herstellertabellen für das DeepSeek-Modell; für gemischte Coding-plus-Bild-Workloads für GLM.
### Kosten- und Cache-Nuance
| Position | GLM-5.3-Flash | DS-V4.1-Flash |
|---|---|---|
| Input / 1M | $0,15 | $0,15 |
| Output / 1M | $0,50 | $0,60 |
| **Cached Input / 1M** | **$0,03** | **$0,003** |
Input identisch, Output bei GLM 17 % günstiger — **aber der Cache-Hit ist bei DeepSeek zehnmal billiger** ($0,003 vs. $0,03). Bei cache-lastiger Agenten-Arbeit, also dem Normalfall wiederkehrender Tool-Loops, kippt die Rechnung zu DeepSeek. GLM-Flash ist der günstigere Dauerläufer nur bei output-lastigem Verkehr ohne Cache-Wiederverwendung.
### Unabhängige Gegenprobe
`artificialanalysis.ai/models/comparisons/deepseek-v4-1-flash-vs-glm-5-3-flash` existiert und vergleicht die beiden **Flash**-Modelle direkt (Intelligence Index v4.3, zehn Evaluations; die Ollama-Seite nennt für GLM-5.3-Flash 57 Punkte auf v4.1.1). Die Einzelwerte werden clientseitig gerendert und waren beim Abruf am 17.09.2026 nicht auslesbar — die herstellereigene Richtung ist damit nicht unabhängig gegengeprüft.
### Performance-Claims (laut Z.ai)
- Outperformt GLM-5.2 auf jedem Effort-Level auf der chat.z.ai Code Bench
- „Performs on par with Claude Opus 4.8" auf Coding- und Agentic-Benchmarks
- Benchmarks (mit Evaluation-Details auf der HF-Model-Card): HLE w/ tools, NL2Repo, DeepSWE, Terminal-Bench 2.1, Toolathlon Verified, AutomationBench v1.0.6, GDPval-AA v2, BabyVision
### Ox-Alpha-Enthüllung
Der Release-Post bestätigt explizit: **„Previously previewed as Ox Alpha"**. Damit ist das Rätsel um das anonyme OpenRouter-Modell offiziell aufgelöst — siehe [[ox-alpha-anonymous-model.md]] für die vollständige Stealth-Historie (Leak, Forensik, Community-Konsens ~8090 % Zhipu, der sich als korrekt erwies).
- **4.096 Max-Output-Cap** aus dem EP106-Listing war das tatsächliche Output-Limit des Stealth-Previews
- Der 131k-Wert aus dem Community-Gegencheck war vermutlich ein anderer Messpunkt oder fehlerhaft — der Widerspruch ist damit geklärt
### Lokale Deployment-Frameworks
SGLang, vLLM, TokenSpeed, KTransformers — alle mit eigenen Cookbook-/Recipe-Links auf der [HF-Page](https://huggingface.co/zai-org/GLM-5.3-Flash).
### Datapunkt: HF-Trending als Local LLM Spotlight (AgentStack Daily EP111, 04.09.2026)
AgentStack Daily führte im Local-LLM-Spotlight von EP111 **`zai-org/GLM-5.3`** als
trendendes Open Model auf Hugging Face: **1.636 Likes, 303.534 Downloads**
(Tags: transformers, safetensors, glm_moe_dsa, text-generation, conversational,
en, zh, arxiv:2602.15763 — [HF-Page](https://huggingface.co/zai-org/GLM-5.3)).
Podcast-Hinweis: Downloads belegen Verbreitung, nicht Dienst-Tauglichkeit — Lizenz,
Kontextlänge, publizierte Evaluation, Gewicht-Layout und Hardware-Anforderungen vor
lokalem Deployment prüfen (siehe [[../../institutions/agentstack-daily.md|AgentStack Daily]] EP111).
### Verweise
- Z.ai-Release-Post: https://x.com/Zai_org/status/2092616204787626030
- HuggingFace: https://huggingface.co/zai-org/GLM-5.3-Flash
- Blog: https://z.ai/blog/glm-5.3-flash
- Technical Report: https://arxiv.org/abs/2602.15763
- API-Docs: https://docs.z.ai/guides/llm/glm-5.3-flash
- Raw (Release-Post): [[../../../raw/xpost/2026-08-26_zai-glm53-flash-release.md]]
- Ox-Alpha-Historie: [[ox-alpha-anonymous-model.md]]