glm-5.3: bench numbers nachgezogen via Herman-Zusammenfassung (Kingbench 3: 91.25% #1)

This commit is contained in:
Hector 2026-08-14 08:05:38 +02:00
parent 04a79b7347
commit 4b757cc01d
2 changed files with 19 additions and 2 deletions

View file

@ -32,6 +32,22 @@ tags: [concept, glm-5.3, z-ai, zhipu-ai, coding-models, chinese-ai, benchmarks,
- **Early Access** — GLM 5.3 war zum Zeitpunkt des Videos noch nicht öffentlich breit verfügbar
- Verortung in der chinesischen Open-Weight-Welle ([[../chinese-ai-wave-july-2026.md]])
## Konkrete Bench-Zahlen (nachgezogen 2026-08-14)
> Quelle: HermanButlerBot-Zusammenfassung in OME Topic 13 (2026-08-14), basierend auf AICodeKings Video. Original-Transkript nicht abrufbar (Bot-Cookies).
| Bench | Ergebnis | Kontext |
|---|---|---|
| **Kingbench 3** | **73/80 = 91,25% → Platz 1** | über Fable 5 (82,5), Kimi K3 + Opus 5 (je 77,5). GLM 5.2 lag vor 2 Monaten bei 75% — Sprung **75 → 91,25** bei gleichen Parametern |
**Kernbefunde des Reviews:**
- **Security-Spezialisierung als Booster:** Wer Code auditieren kann, versteht Code tief — zeigte sich im gesamten Coding-Bench.
- **"Open-Source Shield Initiative":** Defensive Fähigkeiten offen, gefährliche Seite per Layered Safeguards / Trusted Access gegated — vom Reviewer als vernünftig für ein Open Model bewertet.
- **Bench-Highlights:** Kontaktlinsen-Behälter in 3JS (3→8), Klapptisch (10, schlägt Fable), Panda-SVG (10, "bestes Panda-Burger-SVG ever"), autonomes Feintuning einer Gemma 2B inkl. Web-UI (10), schwerste Aufgabe — funktionierende 3D-GMT-Uhr mit Echtzeit-Zeigern (7, bestes je vergebenes; Fable: 4, Opus 5: 3).
- **Ehrliches Fazit:** schlägt Fable in den meisten Fällen; Fable behält Vorteile bei extrem langen, komplexen Horizonten. Frontend UND Backend stark — für ein Open Model ungewöhnlich ("UI sieht nicht nach 2023 aus").
**Warum es zählt:** 2 Monate zwischen Releases, gleiche Architektur, trotzdem großer Sprung — plus ein chinesisches Open Model, das auf einem Coding-Bench die Frontier-Labs schlägt. Setzt US-Labore unter Druck.
## Relevanz für Hectors Stack
- **GLM-5.2 ist das Primary-Modell** in OpenClaw (`ollama/glm-5.2:cloud`) — GLM 5.3 ist die natürliche Nachfolgegeneration
@ -39,4 +55,4 @@ tags: [concept, glm-5.3, z-ai, zhipu-ai, coding-models, chinese-ai, benchmarks,
## Offene Punkte
- ⚠️ Konkrete Benchmark-Zahlen (AICodeKings Bench) und Early-Access-Details fehlen — Transkript nicht abrufbar (Bot-Cookies). Bei Gelegenheit nachziehen.
- ⚠️ Ursprünglich: konkrete Benchmark-Zahlen fehlten (Transkript nicht abrufbar). **Update 2026-08-14:** nachgezogen via HermanButlerBot-Zusammenfassung — siehe Bench-Tabelle oben. Falls AICodeKings Zahlen in der Zusammenfassung unvollständig/unpräzise sind, bei Gelegenheit am Original-Transkript verifizieren.

View file

@ -9,7 +9,8 @@ Kai (@PWeber) teilte "GLM-5.3 (Fully Tested): I GOT EARLY ACCESS & IT'S #1 ON MY
- **Neue Wiki-Seite:** `wiki/concepts/llm/glm-5.3-z-ai.md` — GLM 5.3 als neue Generation der GLM-Serie (Early Access, AICodeKing-Bench #1), GLM-Familien-Tabelle (5.0→5.1→5.2→5.3, GLM 5.5 angekündigt), Relevanz für Hectors Model-Routing (GLM-5.2 = Primary).
- **Raw (immutable):** `raw/youtube/2026-08-14_glm-5.3-aicodeking.md`
- **Aktualisiert:** `wiki/people/aicodeking.md` (zweites Review-Video), `wiki/index.md` (GLM-5.3-Eintrag).
- **Transkript:** Nicht abrufbar (yt-dlp scheitert an Bot-Cookies) — nur Metadaten + Einordnung.
- **Update (06:05):** Konkrete Bench-Zahlen nachgezogen — Kingbench 3: **73/80 = 91,25% → Platz 1** (über Fable 5, Kimi K3, Opus 5). GLM 5.2 lag vor 2 Monaten bei 75% → Sprung 75→91,25 bei gleichen Parametern. Security-Spezialisierung als Booster, "Open-Source Shield Initiative". Quelle: HermanButlerBot-Zusammenfassung (Original-Transkript nicht abrufbar, Bot-Cookies).
- **Transkript:** Nicht abrufbar (yt-dlp scheitert an Bot-Cookies) — Bench-Zahlen via Herman-Zusammenfassung nachgezogen.
## 2026-08-13 — Forscher knacken verschlüsselte KI-Gedanken (heise & c't, OME Topic 13)