knowledge-base/wiki/concepts/llm/glm-5.3-z-ai.md

6.7 KiB
Raw Blame History

created updated sources tags
2026-08-14 2026-08-26
youtube/2026-08-14_glm-5.3-aicodeking.md
xpost/2026-08-26_zai-glm53-flash-release.md
concept
glm-5.3
glm-5.3-flash
z-ai
zhipu-ai
coding-models
chinese-ai
benchmarks
aicodeking
moe
multimodal
mit-license
ox-alpha

GLM 5.3 (Z.ai) — Neue Generation der GLM-Serie

Quelle des Konzepts: YouTube-Video "GLM-5.3 (Fully Tested): I GOT EARLY ACCESS & IT'S #1 ON MY BENCH!" (AICodeKing, 2026-08-14). Geteilt von @PWeber (Kai) in OME-Gruppe "News & Infos (X/YT/Substack etc.)"-Topic.

Kernidee

AICodeKing hat Early Access zu GLM 5.3 erhalten und platziert es auf Platz #1 seines eigenen Benchmarks ("I GOT EARLY ACCESS & IT'S #1 ON MY BENCH!"). GLM 5.3 ist eine neue Generation der GLM-Serie von ../../institutions/z-ai.md.

Einordnung in die GLM-Familie

Generation Release Kontext Quelle
GLM 5.0 Feb 2026 Vorgänger
GLM 5.1 Mär 2026 Vorgänger
GLM 5.2 13.06.2026 1M Kontext, MIT-Lizenz, 10× günstiger als Claude glm-5.2-zai-coding-model.md
GLM 5.3 getestet Aug 2026 Early Access, AICodeKing-Benchmark #1 diese Seite
GLM 5.5 angekündigt 20.07.2026 >1 Bio. Parameter, 1M Kontext, Launch erwartet Aug 2026 glm-5.5-z-ai.md

Release-Kadenz: Vier Generationen in ~7 Monaten — die schnellste Frontier-Modell-Kadenz der Branche. GLM 5.2 und 5.3 überschneiden sich mit dem angekündigten GLM 5.5 (mehrere Parallel-Tracks bei Z.ai).

Einordnung

  • "Fully Tested"-Review von AICodeKing — gleicher Kanal wie das DeepSeek-V4-Pro-0813-Review (../../people/aicodeking.md)
  • Titel behauptet Platz #1 auf AICodeKings eigenem Benchmark — deutet auf starke Coding-Performance
  • Early Access — GLM 5.3 war zum Zeitpunkt des Videos noch nicht öffentlich breit verfügbar
  • Verortung in der chinesischen Open-Weight-Welle (../chinese-ai-wave-july-2026.md)

Konkrete Bench-Zahlen (nachgezogen 2026-08-14)

Quelle: HermanButlerBot-Zusammenfassung in OME Topic 13 (2026-08-14), basierend auf AICodeKings Video. Original-Transkript nicht abrufbar (Bot-Cookies).

Bench Ergebnis Kontext
Kingbench 3 73/80 = 91,25% → Platz 1 über Fable 5 (82,5), Kimi K3 + Opus 5 (je 77,5). GLM 5.2 lag vor 2 Monaten bei 75% — Sprung 75 → 91,25 bei gleichen Parametern

Kernbefunde des Reviews:

  • Security-Spezialisierung als Booster: Wer Code auditieren kann, versteht Code tief — zeigte sich im gesamten Coding-Bench.
  • "Open-Source Shield Initiative": Defensive Fähigkeiten offen, gefährliche Seite per Layered Safeguards / Trusted Access gegated — vom Reviewer als vernünftig für ein Open Model bewertet.
  • Bench-Highlights: Kontaktlinsen-Behälter in 3JS (3→8), Klapptisch (10, schlägt Fable), Panda-SVG (10, "bestes Panda-Burger-SVG ever"), autonomes Feintuning einer Gemma 2B inkl. Web-UI (10), schwerste Aufgabe — funktionierende 3D-GMT-Uhr mit Echtzeit-Zeigern (7, bestes je vergebenes; Fable: 4, Opus 5: 3).
  • Ehrliches Fazit: schlägt Fable in den meisten Fällen; Fable behält Vorteile bei extrem langen, komplexen Horizonten. Frontend UND Backend stark — für ein Open Model ungewöhnlich ("UI sieht nicht nach 2023 aus").

Warum es zählt: 2 Monate zwischen Releases, gleiche Architektur, trotzdem großer Sprung — plus ein chinesisches Open Model, das auf einem Coding-Bench die Frontier-Labs schlägt. Setzt US-Labore unter Druck.

Relevanz für Hectors Stack

  • GLM-5.2 ist das Primary-Modell in OpenClaw (ollama/glm-5.2:cloud) — GLM 5.3 ist die natürliche Nachfolgegeneration
  • Falls GLM 5.3 über Ollama Cloud / Z.ai verfügbar wird, könnte es das Routing-Konzept (../../architecture/model-routing.md) erweitern

Update 26.08.2026: GLM-5.3-Flash offiziell released — siehe neuen Abschnitt „GLM-5.3-Flash: Offizieller Release (26.08.2026)" unten. Das Modell war zuvor als anonymes „Ox Alpha" auf OpenRouter im Stealth-Preview; Z.ai hat dies im Release-Announcement explizit bestätigt („Previously previewed as Ox Alpha"). Siehe ox-alpha-anonymous-model.md für die vollständige Stealth-Historie und Auflösung.

GLM-5.3-Flash: Offizieller Release (26.08.2026)

Z.ai hat GLM-5.3-Flash am 26.08.2026 offiziell released — das erste nativ multimodale Modell der GLM-5-Serie. Ankündigung: https://x.com/Zai_org/status/2092616204787626030 — HuggingFace-Weights: https://huggingface.co/zai-org/GLM-5.3-Flash — geteilt von Kai (@PWeber) in OME Topic 13 (#12787).

Spezifikationen

Eigenschaft Wert
Architektur 320B total / 18B aktiv pro Token (MoE)
Kontextfenster 1.048.576 Tokens (1M)
Modalität nativ multimodal (Text + Bild + Video → Text)
Lizenz MIT
Training auf chinesischen KI-Chips
Pre-Training-Corpus 30T Tokens (multimodal)
Architektur-Neuerung Hybrid Sparse + Linear Attention (erste in GLM-Serie), Manifold-Constrained Hyper-Connections (mHC)
Base Model neu trainiert (kein Incremental-Update von 5.2)

API-Pricing (per 1M Tokens)

Token-Typ Preis
Input $0.15
Output $0.50
Cached Input $0.03

Performance-Claims (laut Z.ai)

  • Outperformt GLM-5.2 auf jedem Effort-Level auf der chat.z.ai Code Bench
  • „Performs on par with Claude Opus 4.8" auf Coding- und Agentic-Benchmarks
  • Benchmarks (mit Evaluation-Details auf der HF-Model-Card): HLE w/ tools, NL2Repo, DeepSWE, Terminal-Bench 2.1, Toolathlon Verified, AutomationBench v1.0.6, GDPval-AA v2, BabyVision

Ox-Alpha-Enthüllung

Der Release-Post bestätigt explizit: „Previously previewed as Ox Alpha". Damit ist das Rätsel um das anonyme OpenRouter-Modell offiziell aufgelöst — siehe ox-alpha-anonymous-model.md für die vollständige Stealth-Historie (Leak, Forensik, Community-Konsens ~8090 % Zhipu, der sich als korrekt erwies).

  • 4.096 Max-Output-Cap aus dem EP106-Listing war das tatsächliche Output-Limit des Stealth-Previews
  • Der 131k-Wert aus dem Community-Gegencheck war vermutlich ein anderer Messpunkt oder fehlerhaft — der Widerspruch ist damit geklärt

Lokale Deployment-Frameworks

SGLang, vLLM, TokenSpeed, KTransformers — alle mit eigenen Cookbook-/Recipe-Links auf der HF-Page.

Verweise