171 lines
11 KiB
Markdown
171 lines
11 KiB
Markdown
---
|
||
created: 2026-08-14
|
||
updated: 2026-09-08
|
||
sources: [youtube/2026-08-14_glm-5.3-aicodeking.md, xpost/2026-08-26_zai-glm53-flash-release.md, podcast/2026-09-08_agentstack-daily-ep111-openclaw-91.md, other/2026-09-17_ollama-benchmarks-glm-53-flash-vs-deepseek-v41-flash.md]
|
||
tags: [concept, glm-5.3, glm-5.3-flash, z-ai, zhipu-ai, coding-models, chinese-ai, benchmarks, aicodeking, moe, multimodal, mit-license, ox-alpha]
|
||
---
|
||
|
||
# GLM 5.3 (Z.ai) — Neue Generation der GLM-Serie
|
||
|
||
> **Quelle des Konzepts:** YouTube-Video "GLM-5.3 (Fully Tested): I GOT EARLY ACCESS & IT'S #1 ON MY BENCH!" (AICodeKing, 2026-08-14). Geteilt von @PWeber (Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic.
|
||
|
||
## Kernidee
|
||
|
||
**AICodeKing hat Early Access zu GLM 5.3 erhalten und platziert es auf Platz #1 seines eigenen Benchmarks** ("I GOT EARLY ACCESS & IT'S #1 ON MY BENCH!"). GLM 5.3 ist eine neue Generation der GLM-Serie von [[../../institutions/z-ai.md|Z.ai (Zhipu AI)]].
|
||
|
||
## Einordnung in die GLM-Familie
|
||
|
||
| Generation | Release | Kontext | Quelle |
|
||
|---|---|---|---|
|
||
| GLM 5.0 | Feb 2026 | Vorgänger | — |
|
||
| GLM 5.1 | Mär 2026 | Vorgänger | — |
|
||
| **GLM 5.2** | 13.06.2026 | 1M Kontext, MIT-Lizenz, 10× günstiger als Claude | [[glm-5.2-zai-coding-model.md]] |
|
||
| **GLM 5.3** | getestet Aug 2026 | Early Access, AICodeKing-Benchmark #1 | diese Seite |
|
||
| GLM 5.5 | angekündigt 20.07.2026 | >1 Bio. Parameter, 1M Kontext, Launch erwartet Aug 2026 | [[glm-5.5-z-ai.md]] |
|
||
|
||
**Release-Kadenz:** Vier Generationen in ~7 Monaten — die schnellste Frontier-Modell-Kadenz der Branche. GLM 5.2 und 5.3 überschneiden sich mit dem angekündigten GLM 5.5 (mehrere Parallel-Tracks bei Z.ai).
|
||
|
||
## Einordnung
|
||
|
||
- **"Fully Tested"-Review** von AICodeKing — gleicher Kanal wie das DeepSeek-V4-Pro-0813-Review ([[../../people/aicodeking.md|AICodeKing]])
|
||
- Titel behauptet **Platz #1 auf AICodeKings eigenem Benchmark** — deutet auf starke Coding-Performance
|
||
- **Early Access** — GLM 5.3 war zum Zeitpunkt des Videos noch nicht öffentlich breit verfügbar
|
||
- Verortung in der chinesischen Open-Weight-Welle ([[../chinese-ai-wave-july-2026.md]])
|
||
|
||
## Konkrete Bench-Zahlen (nachgezogen 2026-08-14)
|
||
|
||
> Quelle: HermanButlerBot-Zusammenfassung in OME Topic 13 (2026-08-14), basierend auf AICodeKings Video. Original-Transkript nicht abrufbar (Bot-Cookies).
|
||
|
||
| Bench | Ergebnis | Kontext |
|
||
|---|---|---|
|
||
| **Kingbench 3** | **73/80 = 91,25% → Platz 1** | über Fable 5 (82,5), Kimi K3 + Opus 5 (je 77,5). GLM 5.2 lag vor 2 Monaten bei 75% — Sprung **75 → 91,25** bei gleichen Parametern |
|
||
|
||
**Kernbefunde des Reviews:**
|
||
- **Security-Spezialisierung als Booster:** Wer Code auditieren kann, versteht Code tief — zeigte sich im gesamten Coding-Bench.
|
||
- **"Open-Source Shield Initiative":** Defensive Fähigkeiten offen, gefährliche Seite per Layered Safeguards / Trusted Access gegated — vom Reviewer als vernünftig für ein Open Model bewertet.
|
||
- **Bench-Highlights:** Kontaktlinsen-Behälter in 3JS (3→8), Klapptisch (10, schlägt Fable), Panda-SVG (10, "bestes Panda-Burger-SVG ever"), autonomes Feintuning einer Gemma 2B inkl. Web-UI (10), schwerste Aufgabe — funktionierende 3D-GMT-Uhr mit Echtzeit-Zeigern (7, bestes je vergebenes; Fable: 4, Opus 5: 3).
|
||
- **Ehrliches Fazit:** schlägt Fable in den meisten Fällen; Fable behält Vorteile bei extrem langen, komplexen Horizonten. Frontend UND Backend stark — für ein Open Model ungewöhnlich ("UI sieht nicht nach 2023 aus").
|
||
|
||
**Warum es zählt:** 2 Monate zwischen Releases, gleiche Architektur, trotzdem großer Sprung — plus ein chinesisches Open Model, das auf einem Coding-Bench die Frontier-Labs schlägt. Setzt US-Labore unter Druck.
|
||
|
||
## Relevanz für Hectors Stack
|
||
|
||
- **GLM-5.2 ist das Primary-Modell** in OpenClaw (`ollama/glm-5.2:cloud`) — GLM 5.3 ist die natürliche Nachfolgegeneration
|
||
- Falls GLM 5.3 über Ollama Cloud / Z.ai verfügbar wird, könnte es das Routing-Konzept ([[../../architecture/model-routing.md]]) erweitern
|
||
|
||
> **Update 26.08.2026:** GLM-5.3-Flash offiziell released — siehe neuen Abschnitt [„GLM-5.3-Flash: Offizieller Release (26.08.2026)"](#glm-53-flash-offizieller-release-26082026) unten. Das Modell war zuvor als anonymes „Ox Alpha" auf OpenRouter im Stealth-Preview; Z.ai hat dies im Release-Announcement explizit bestätigt („Previously previewed as Ox Alpha"). Siehe [[ox-alpha-anonymous-model.md]] für die vollständige Stealth-Historie und Auflösung.
|
||
|
||
## GLM-5.3-Flash: Offizieller Release (26.08.2026)
|
||
|
||
Z.ai hat GLM-5.3-Flash am 26.08.2026 offiziell released — das erste **nativ multimodale** Modell der GLM-5-Serie. Ankündigung: https://x.com/Zai_org/status/2092616204787626030 — HuggingFace-Weights: https://huggingface.co/zai-org/GLM-5.3-Flash — geteilt von Kai (@PWeber) in OME Topic 13 (#12787).
|
||
|
||
### Spezifikationen
|
||
|
||
| Eigenschaft | Wert |
|
||
|---|---|
|
||
| Architektur | 320B total / 18B aktiv pro Token (MoE) |
|
||
| Kontextfenster | 1.048.576 Tokens (1M) |
|
||
| Modalität | nativ multimodal (Text + Bild + Video → Text) |
|
||
| Lizenz | MIT |
|
||
| Training | auf chinesischen KI-Chips |
|
||
| Pre-Training-Corpus | 30T Tokens (multimodal) |
|
||
| Architektur-Neuerung | Hybrid Sparse + Linear Attention (erste in GLM-Serie), Manifold-Constrained Hyper-Connections (mHC) |
|
||
| Base Model | neu trainiert (kein Incremental-Update von 5.2) |
|
||
|
||
### API-Pricing (per 1M Tokens)
|
||
|
||
| Token-Typ | Preis |
|
||
|---|---|
|
||
| Input | $0.15 |
|
||
| Output | $0.50 |
|
||
| Cached Input | $0.03 |
|
||
|
||
### Benchmark-Tabelle (Ollama-Modellseite, abgerufen 17.09.2026)
|
||
|
||
> Quelle: https://ollama.com/library/glm-5.3-flash — Hersteller-Selbstauskunft (Z.ai), nicht unabhängig nachgemessen. Vollständige Tabelle inkl. Vision-Block: `raw/other/2026-09-17_ollama-benchmarks-glm-53-flash-vs-deepseek-v41-flash.md`.
|
||
|
||
| Benchmark | GLM-5.3-Flash | GLM-5.2 |
|
||
|---|---|---|
|
||
| Terminal Bench 2.1 | 84,3 | 81,0 |
|
||
| DeepSWE v1.1 | 63,4 | 46,2 |
|
||
| NL2Repo | 56,3 | 48,9 |
|
||
| Toolathlon Verified | 78,4 | 59,9 |
|
||
| AutomationBench v1.0.6 | 48,8 | 26,2 |
|
||
| Agents’ Last Exam | 26,3 | 20,4 |
|
||
| HLE w/ Tools | 55,3 | 54,7 |
|
||
| GDPval-AA v2 | 1773 | 1504 |
|
||
| OfficeQA Pro | 62,4 | — |
|
||
| CharXiv Reasoning w/ Tools | 89,4 | — |
|
||
| Chartography w/ Tools | 78,0 | — |
|
||
| BabyVision | 53,4 | — |
|
||
| MVBench | 77,8 | — |
|
||
| MMVU | 80,5 | — |
|
||
|
||
### Flash gegen Flash: GLM-5.3-Flash vs. DeepSeek-V4.1-Flash
|
||
|
||
> ⚠️ **Spaltenbeschriftungs-Falle:** Die Vergleichstabelle auf `ollama.com/library/deepseek-v4.1-flash` beschriftet ihre GLM-Spalte im HTML mit **„GLM-5.3"**, nicht „GLM-5.3-Flash". Ein Flash-gegen-Flash-Vergleich über diese Spalte vergleicht also das große Geschwister mit. Beide Modelle haben eigene Tabellen — die sind die richtige Quelle.
|
||
|
||
| Benchmark | GLM-5.3-Flash | DS-V4.1-Flash | Vorsprung |
|
||
|---|---|---|---|
|
||
| DeepSWE v1.1 | 63,4 | 74,2 | DeepSeek +17 % |
|
||
| Terminal Bench 2.1 | 84,3 | 90,6 | DeepSeek |
|
||
| NL2Repo | 56,3 | 64,0 | DeepSeek +14 % |
|
||
| AutomationBench | 48,8 | 54,8 | DeepSeek +12 % |
|
||
| Agents’ Last Exam | 26,3 | 31,8 | DeepSeek +21 % |
|
||
| HLE w/ Tools | 55,3 | 63,9 | DeepSeek +16 % |
|
||
| Toolathlon Verified | 78,4 | — | GLM (kein DS-Wert) |
|
||
| Terminal Bench 4.0 | — (nicht gelistet) | 31,2 | — |
|
||
| Vision-Block (MVBench/MMVU) | 77,8 / 80,5 | — (kein MVBench; BabyVision 89,6) | gemischt |
|
||
|
||
**Lesehilfe:** Auf den Agentic- und Coding-Benchmarks liegt DeepSeek durchweg vorn. GLM-5.3-Flash hat seinen eigenen Schwerpunkt im Vision-Block und beim Toolathlon. Für Tool-Ketten, Repo-Arbeit und Automatisierung sprechen die Herstellertabellen für das DeepSeek-Modell; für gemischte Coding-plus-Bild-Workloads für GLM.
|
||
|
||
### Kosten- und Cache-Nuance
|
||
|
||
| Position | GLM-5.3-Flash | DS-V4.1-Flash |
|
||
|---|---|---|
|
||
| Input / 1M | $0,15 | $0,15 |
|
||
| Output / 1M | $0,50 | $0,60 |
|
||
| **Cached Input / 1M** | **$0,03** | **$0,003** |
|
||
|
||
Input identisch, Output bei GLM 17 % günstiger — **aber der Cache-Hit ist bei DeepSeek zehnmal billiger** ($0,003 vs. $0,03). Bei cache-lastiger Agenten-Arbeit, also dem Normalfall wiederkehrender Tool-Loops, kippt die Rechnung zu DeepSeek. GLM-Flash ist der günstigere Dauerläufer nur bei output-lastigem Verkehr ohne Cache-Wiederverwendung.
|
||
|
||
### Unabhängige Gegenprobe
|
||
|
||
`artificialanalysis.ai/models/comparisons/deepseek-v4-1-flash-vs-glm-5-3-flash` existiert und vergleicht die beiden **Flash**-Modelle direkt (Intelligence Index v4.3, zehn Evaluations; die Ollama-Seite nennt für GLM-5.3-Flash 57 Punkte auf v4.1.1). Die Einzelwerte werden clientseitig gerendert und waren beim Abruf am 17.09.2026 nicht auslesbar — die herstellereigene Richtung ist damit nicht unabhängig gegengeprüft.
|
||
|
||
### Performance-Claims (laut Z.ai)
|
||
|
||
- Outperformt GLM-5.2 auf jedem Effort-Level auf der chat.z.ai Code Bench
|
||
- „Performs on par with Claude Opus 4.8" auf Coding- und Agentic-Benchmarks
|
||
- Benchmarks (mit Evaluation-Details auf der HF-Model-Card): HLE w/ tools, NL2Repo, DeepSWE, Terminal-Bench 2.1, Toolathlon Verified, AutomationBench v1.0.6, GDPval-AA v2, BabyVision
|
||
|
||
### Ox-Alpha-Enthüllung
|
||
|
||
Der Release-Post bestätigt explizit: **„Previously previewed as Ox Alpha"**. Damit ist das Rätsel um das anonyme OpenRouter-Modell offiziell aufgelöst — siehe [[ox-alpha-anonymous-model.md]] für die vollständige Stealth-Historie (Leak, Forensik, Community-Konsens ~80–90 % Zhipu, der sich als korrekt erwies).
|
||
|
||
- **4.096 Max-Output-Cap** aus dem EP106-Listing war das tatsächliche Output-Limit des Stealth-Previews
|
||
- Der 131k-Wert aus dem Community-Gegencheck war vermutlich ein anderer Messpunkt oder fehlerhaft — der Widerspruch ist damit geklärt
|
||
|
||
### Lokale Deployment-Frameworks
|
||
|
||
SGLang, vLLM, TokenSpeed, KTransformers — alle mit eigenen Cookbook-/Recipe-Links auf der [HF-Page](https://huggingface.co/zai-org/GLM-5.3-Flash).
|
||
|
||
### Datapunkt: HF-Trending als Local LLM Spotlight (AgentStack Daily EP111, 04.09.2026)
|
||
|
||
AgentStack Daily führte im Local-LLM-Spotlight von EP111 **`zai-org/GLM-5.3`** als
|
||
trendendes Open Model auf Hugging Face: **1.636 Likes, 303.534 Downloads**
|
||
(Tags: transformers, safetensors, glm_moe_dsa, text-generation, conversational,
|
||
en, zh, arxiv:2602.15763 — [HF-Page](https://huggingface.co/zai-org/GLM-5.3)).
|
||
Podcast-Hinweis: Downloads belegen Verbreitung, nicht Dienst-Tauglichkeit — Lizenz,
|
||
Kontextlänge, publizierte Evaluation, Gewicht-Layout und Hardware-Anforderungen vor
|
||
lokalem Deployment prüfen (siehe [[../../institutions/agentstack-daily.md|AgentStack Daily]] EP111).
|
||
|
||
### Verweise
|
||
|
||
- Z.ai-Release-Post: https://x.com/Zai_org/status/2092616204787626030
|
||
- HuggingFace: https://huggingface.co/zai-org/GLM-5.3-Flash
|
||
- Blog: https://z.ai/blog/glm-5.3-flash
|
||
- Technical Report: https://arxiv.org/abs/2602.15763
|
||
- API-Docs: https://docs.z.ai/guides/llm/glm-5.3-flash
|
||
- Raw (Release-Post): [[../../../raw/xpost/2026-08-26_zai-glm53-flash-release.md]]
|
||
- Ox-Alpha-Historie: [[ox-alpha-anonymous-model.md]]
|