ingest(other): Flash-gegen-Flash-Benchmarks GLM-5.3-Flash vs DS-V4.1-Flash

This commit is contained in:
Hector 2026-09-17 18:16:44 +02:00
parent 877d2c1221
commit 430867513a
4 changed files with 131 additions and 3 deletions

View file

@ -0,0 +1,56 @@
---
type: other
source_url: "https://ollama.com/library/glm-5.3-flash + https://ollama.com/library/deepseek-v4.1-flash"
retrieved: 2026-09-17
title: "Ollama-Benchmark-Tabellen: GLM-5.3-Flash vs. DeepSeek V4.1 Flash"
tags: [benchmarks, ollama, glm-5.3-flash, deepseek-v4.1-flash, model-comparison]
---
# Ollama-Benchmark-Tabellen: GLM-5.3-Flash vs. DeepSeek V4.1 Flash
Abgerufen am 17.09.2026 von den offiziellen Ollama-Modellseiten. Beide Tabellen sind Hersteller-Selbstauskunft (Z.ai bzw. DeepSeek), nicht unabhängig nachgemessen.
## Befund zur Quellenlage
- `ollama.com/library/glm-5.3-flash` enthält eine **vollständige Benchmark-Tabelle** (Coding, Agentic, Vision). Die in einem Gruppenbeitrag aufgestellte Behauptung, für den Flash-Ableger lägen keine Zahlen vor, ist damit widerlegt.
- `ollama.com/library/deepseek-v4.1-flash` enthält ebenfalls eine vollständige Tabelle. Deren GLM-Spalte ist im HTML mit **„GLM-5.3"** überschrieben (nicht „GLM-5.3-Flash") — der dortige Vergleichswert bezieht sich also auf das große Geschwistermodell.
- Die GLM-5.3-Flash-Tabelle listet **keine** Terminal-Bench-3.0- oder -4.0-Zeile. Der kursierende TB-4.0-Wert 37,9 stammt aus der GLM-5.3-Spalte der DeepSeek-Seite.
## GLM-5.3-Flash (eigene Tabelle, Auszug)
| Benchmark | Wert |
|---|---|
| Terminal Bench 2.1 | 84,3 |
| DeepSWE v1.1 | 63,4 |
| NL2Repo | 56,3 |
| Toolathlon Verified | 78,4 |
| AutomationBench v1.0.6 | 48,8 |
| Agents' Last Exam | 26,3 |
| HLE w/ Tools | 55,3 |
| GDPval-AA v2 | 1773 |
| BabyVision | 53,4 |
| MVBench | 77,8 |
| MMVU | 80,5 |
Architektur laut Seite: 320B total / 18B aktiv, 45 Layer, 1M Kontext, MIT-Lizenz, nativ multimodal (Text/Bild/Video). Angaben zu Attention-Compute (3,0×) und KV-Cache (4,4×) gegenüber GLM-5.3.
## DeepSeek-V4.1-Flash (eigene Tabelle, Auszug)
| Benchmark | Wert |
|---|---|
| Terminal-Bench 2.1 | 90,6 |
| Terminal-Bench 3.0 | 30,0 |
| Terminal-Bench 4.0 | 31,2 |
| DeepSWE v1.1 | 74,2 |
| NL2Repo-Bench | 64,0 |
| CyberGym | 88,1 |
| HLE w/ tools | 63,9 |
| AutomationBench | 54,8 |
| Agent's Last Exam | 31,8 |
| BabyVision w/ tools | 89,6 |
Architektur laut Seite: 552B Backbone, Causal Encoder-Decoder (20+20 Layer), 8B aktiv im Prefill / 16B im Decode, KV-Cache 890 Byte/Token. Vergleichsspalten: Opus-5.0, GPT-5.6 Sol, K3, GLM-5.3, DS-V4-Pro, DS-V4-Flash.
## Unabhängige Gegenprobe
Die Seite `artificialanalysis.ai/models/comparisons/deepseek-v4-1-flash-vs-glm-5-3-flash` existiert und vergleicht die beiden Flash-Modelle (Intelligence Index v4.3, zehn Evaluations). Die Einzelwerte werden clientseitig gerendert und wurden bei diesem Abruf nicht ausgelesen.

View file

@ -1,7 +1,7 @@
--- ---
created: 2026-08-14 created: 2026-08-14
updated: 2026-09-08 updated: 2026-09-08
sources: [youtube/2026-08-14_glm-5.3-aicodeking.md, xpost/2026-08-26_zai-glm53-flash-release.md, podcast/2026-09-08_agentstack-daily-ep111-openclaw-91.md] sources: [youtube/2026-08-14_glm-5.3-aicodeking.md, xpost/2026-08-26_zai-glm53-flash-release.md, podcast/2026-09-08_agentstack-daily-ep111-openclaw-91.md, other/2026-09-17_ollama-benchmarks-glm-53-flash-vs-deepseek-v41-flash.md]
tags: [concept, glm-5.3, glm-5.3-flash, z-ai, zhipu-ai, coding-models, chinese-ai, benchmarks, aicodeking, moe, multimodal, mit-license, ox-alpha] tags: [concept, glm-5.3, glm-5.3-flash, z-ai, zhipu-ai, coding-models, chinese-ai, benchmarks, aicodeking, moe, multimodal, mit-license, ox-alpha]
--- ---
@ -80,6 +80,59 @@ Z.ai hat GLM-5.3-Flash am 26.08.2026 offiziell released — das erste **nativ mu
| Output | $0.50 | | Output | $0.50 |
| Cached Input | $0.03 | | Cached Input | $0.03 |
### Benchmark-Tabelle (Ollama-Modellseite, abgerufen 17.09.2026)
> Quelle: https://ollama.com/library/glm-5.3-flash — Hersteller-Selbstauskunft (Z.ai), nicht unabhängig nachgemessen. Vollständige Tabelle inkl. Vision-Block: `raw/other/2026-09-17_ollama-benchmarks-glm-53-flash-vs-deepseek-v41-flash.md`.
| Benchmark | GLM-5.3-Flash | GLM-5.2 |
|---|---|---|
| Terminal Bench 2.1 | 84,3 | 81,0 |
| DeepSWE v1.1 | 63,4 | 46,2 |
| NL2Repo | 56,3 | 48,9 |
| Toolathlon Verified | 78,4 | 59,9 |
| AutomationBench v1.0.6 | 48,8 | 26,2 |
| Agents Last Exam | 26,3 | 20,4 |
| HLE w/ Tools | 55,3 | 54,7 |
| GDPval-AA v2 | 1773 | 1504 |
| OfficeQA Pro | 62,4 | — |
| CharXiv Reasoning w/ Tools | 89,4 | — |
| Chartography w/ Tools | 78,0 | — |
| BabyVision | 53,4 | — |
| MVBench | 77,8 | — |
| MMVU | 80,5 | — |
### Flash gegen Flash: GLM-5.3-Flash vs. DeepSeek-V4.1-Flash
> ⚠️ **Spaltenbeschriftungs-Falle:** Die Vergleichstabelle auf `ollama.com/library/deepseek-v4.1-flash` beschriftet ihre GLM-Spalte im HTML mit **„GLM-5.3"**, nicht „GLM-5.3-Flash". Ein Flash-gegen-Flash-Vergleich über diese Spalte vergleicht also das große Geschwister mit. Beide Modelle haben eigene Tabellen — die sind die richtige Quelle.
| Benchmark | GLM-5.3-Flash | DS-V4.1-Flash | Vorsprung |
|---|---|---|---|
| DeepSWE v1.1 | 63,4 | 74,2 | DeepSeek +17 % |
| Terminal Bench 2.1 | 84,3 | 90,6 | DeepSeek |
| NL2Repo | 56,3 | 64,0 | DeepSeek +14 % |
| AutomationBench | 48,8 | 54,8 | DeepSeek +12 % |
| Agents Last Exam | 26,3 | 31,8 | DeepSeek +21 % |
| HLE w/ Tools | 55,3 | 63,9 | DeepSeek +16 % |
| Toolathlon Verified | 78,4 | — | GLM (kein DS-Wert) |
| Terminal Bench 4.0 | — (nicht gelistet) | 31,2 | — |
| Vision-Block (MVBench/MMVU) | 77,8 / 80,5 | — (kein MVBench; BabyVision 89,6) | gemischt |
**Lesehilfe:** Auf den Agentic- und Coding-Benchmarks liegt DeepSeek durchweg vorn. GLM-5.3-Flash hat seinen eigenen Schwerpunkt im Vision-Block und beim Toolathlon. Für Tool-Ketten, Repo-Arbeit und Automatisierung sprechen die Herstellertabellen für das DeepSeek-Modell; für gemischte Coding-plus-Bild-Workloads für GLM.
### Kosten- und Cache-Nuance
| Position | GLM-5.3-Flash | DS-V4.1-Flash |
|---|---|---|
| Input / 1M | $0,15 | $0,15 |
| Output / 1M | $0,50 | $0,60 |
| **Cached Input / 1M** | **$0,03** | **$0,003** |
Input identisch, Output bei GLM 17 % günstiger — **aber der Cache-Hit ist bei DeepSeek zehnmal billiger** ($0,003 vs. $0,03). Bei cache-lastiger Agenten-Arbeit, also dem Normalfall wiederkehrender Tool-Loops, kippt die Rechnung zu DeepSeek. GLM-Flash ist der günstigere Dauerläufer nur bei output-lastigem Verkehr ohne Cache-Wiederverwendung.
### Unabhängige Gegenprobe
`artificialanalysis.ai/models/comparisons/deepseek-v4-1-flash-vs-glm-5-3-flash` existiert und vergleicht die beiden **Flash**-Modelle direkt (Intelligence Index v4.3, zehn Evaluations; die Ollama-Seite nennt für GLM-5.3-Flash 57 Punkte auf v4.1.1). Die Einzelwerte werden clientseitig gerendert und waren beim Abruf am 17.09.2026 nicht auslesbar — die herstellereigene Richtung ist damit nicht unabhängig gegengeprüft.
### Performance-Claims (laut Z.ai) ### Performance-Claims (laut Z.ai)
- Outperformt GLM-5.2 auf jedem Effort-Level auf der chat.z.ai Code Bench - Outperformt GLM-5.2 auf jedem Effort-Level auf der chat.z.ai Code Bench

View file

@ -2,7 +2,9 @@
*Auto-generated: 2026-07-07* *Auto-generated: 2026-07-07*
*Letzte Aktualisierung: 2026-09-17 (209. Update — StaffMaker (360WeAre UG): Produktdemo beim KI Meetup Hannover. Raw: `raw/other/2026-09-17_staffmaker-360weare.md` (neu). Wiki: `tools/staffmaker-360weare.md` (neu — Orchestrierungs-Schicht über Marie/VERA/PIA/Branda etc., KI-Mitarbeiter-Organigramm mit Rollen statt Prompts, gemeinsamer Credit-Pool, Reifegrad „In Vorbereitung" = Demo vor Marktstart; verifiziert: Hetzner-IP 116.202.6.71, Soft-404 für /impressum /agb /datenschutz, Google Fonts eingebunden, TLS nur staffmaker.de; Kontrast Datenschutz-Reifegrad zum KI.club Hannover).) *Letzte Aktualisierung: 2026-09-17 (210. Update — Flash-gegen-Flash-Benchmark-Abgleich GLM-5.3-Flash vs. DeepSeek-V4.1-Flash, Prüfung eines Gruppenbeitrags. Beide Ollama-Modellseiten direkt abgerufen (17.09.2026). Befund: Die Behauptung, für glm-5.3-flash lägen keine veröffentlichten Zahlen vor, ist widerlegt — `ollama.com/library/glm-5.3-flash` hat eine vollständige Tabelle (TB 2.1 84,3 · DeepSWE 63,4 · NL2Repo 56,3 · Toolathlon 78,4 · AutomationBench 48,8 · ALE 26,3 · HLE w/tools 55,3 · GDPval-AA 1773 · Vision-Block). Zusatzbefund: Die GLM-**Spalte** der DeepSeek-Seite heißt im HTML „GLM-5.3" (nicht -Flash) — ein Flash-gegen-Flash-Vergleich darüber vergleicht das große Geschwister mit; und die GLM-Flash-Tabelle listet **keine** TB-3.0/4.0-Zeile (der Wert 37,9 stammt aus der GLM-5.3-Spalte). Flash gegen Flash nach Herstellertabellen: DeepSeek durchweg vorn (DeepSWE +17 %, ALE +21 %, HLE w/tools +16 %, NL2Repo +14 %, AutomationBench +12 %, TB 2.1 90,6 vs 84,3); GLM vorn bei Toolathlon (kein DS-Wert) und im Vision-Block. Kosten: Input identisch $0,15, Output GLM 17 % günstiger — aber **Cache-Hit bei DeepSeek zehnmal billiger** ($0,003 vs. $0,03), was cache-lastige Agentenarbeit zu DeepSeek kippt. Raw: `raw/other/2026-09-17_ollama-benchmarks-glm-53-flash-vs-deepseek-v41-flash.md` (neu). Wiki: `concepts/llm/glm-5.3-z-ai.md` (Benchmark-Tabelle der Flash-Seite, Flash-gegen-Flash-Sektion, Spaltenbeschriftungs-Warnung, Cache-Nuance). ⚠️ Beide Tabellen = Hersteller-Selbstauskunft; die unabhängige AA-Gegenprobe existiert als Seite, ist aber clientseitig gerendert und wurde nicht ausgelesen.)*
*Vorherige Aktualisierung: 2026-09-17 (209. Update — StaffMaker (360WeAre UG): Produktdemo beim KI Meetup Hannover. Raw: `raw/other/2026-09-17_staffmaker-360weare.md` (neu). Wiki: `tools/staffmaker-360weare.md` (neu — Orchestrierungs-Schicht über Marie/VERA/PIA/Branda etc., KI-Mitarbeiter-Organigramm mit Rollen statt Prompts, gemeinsamer Credit-Pool, Reifegrad „In Vorbereitung" = Demo vor Marktstart; verifiziert: Hetzner-IP 116.202.6.71, Soft-404 für /impressum /agb /datenschutz, Google Fonts eingebunden, TLS nur staffmaker.de; Kontrast Datenschutz-Reifegrad zum KI.club Hannover).)
*Vorherige Aktualisierung: 2026-09-17 (208. Update — KI.club Hannover e.V. (i.G.): Träger hinter dem KI Meetup Hannover. Raw: `raw/other/2026-09-17_ki-club-hannover.md` + `raw/other/2026-09-17_ai-meetup-hannover.md` (neu). Wiki: `institutions/ki-club-hannover.md` (neu — Verein in Gründung, Vorstand Patek/Piekarska/Kaschubs-Saeedi/Tosheva, Sitz Kopernikusstraße 14, letzter Donnerstag im Monat, nächster Termin 29.10.2026, Haftung § 54 S. 2 BGB, Hafven-Hosting, Datenschutz) und `events/ki-meetup-hannover.md` (Trägerschaft + Abgrenzung KI- vs. AI-Meetup). Verifiziert: kiclub-hannover.de und kimeetuphannover.de auf derselben IP 185.253.215.17; boerse-strategie.com + kimeetup-hannover.de NXDOMAIN; ki-strategie.com 301 → aisoma.de.) *Vorherige Aktualisierung: 2026-09-17 (208. Update — KI.club Hannover e.V. (i.G.): Träger hinter dem KI Meetup Hannover. Raw: `raw/other/2026-09-17_ki-club-hannover.md` + `raw/other/2026-09-17_ai-meetup-hannover.md` (neu). Wiki: `institutions/ki-club-hannover.md` (neu — Verein in Gründung, Vorstand Patek/Piekarska/Kaschubs-Saeedi/Tosheva, Sitz Kopernikusstraße 14, letzter Donnerstag im Monat, nächster Termin 29.10.2026, Haftung § 54 S. 2 BGB, Hafven-Hosting, Datenschutz) und `events/ki-meetup-hannover.md` (Trägerschaft + Abgrenzung KI- vs. AI-Meetup). Verifiziert: kiclub-hannover.de und kimeetuphannover.de auf derselben IP 185.253.215.17; boerse-strategie.com + kimeetup-hannover.de NXDOMAIN; ki-strategie.com 301 → aisoma.de.)
*Vorherige Aktualisierung: 2026-09-17 (207. Update — KI Meetup Hannover (5. Ausgabe, 17.09.2026) bei Bechtle. Raw: `raw/other/2026-09-17_ki-meetup-hannover-5.md` (neu — Fotos von Netbits, Line-up verifiziert über Eventbrite + Moderator-Ankündigung). Wiki: `events/ki-meetup-hannover.md` (neu — Format, Line-up in zwei Blöcken, Themenprofil Copilot/Beratung/Agenten-RAG mit Randnote Algo-Trading-Vermarktung; Foliennamen per Vision-Auswertung gegen das offizielle Line-up abgeglichen).) *Vorherige Aktualisierung: 2026-09-17 (207. Update — KI Meetup Hannover (5. Ausgabe, 17.09.2026) bei Bechtle. Raw: `raw/other/2026-09-17_ki-meetup-hannover-5.md` (neu — Fotos von Netbits, Line-up verifiziert über Eventbrite + Moderator-Ankündigung). Wiki: `events/ki-meetup-hannover.md` (neu — Format, Line-up in zwei Blöcken, Themenprofil Copilot/Beratung/Agenten-RAG mit Randnote Algo-Trading-Vermarktung; Foliennamen per Vision-Auswertung gegen das offizielle Line-up abgeglichen).)
*Vorherige Aktualisierung: 2026-09-17 (206. Update — DeepSeek V4.1 Flash auf lokaler Hardware: Durchsatz-Stufen, Q2/Q4-Quantisierung und API-Payback. Video „Run DeepSeek V4.1 Flash on ANY hardware (16GB to 512GB): can it work?" (Marfil Draws @themarfildraws, 16.09.2026, 13:26; geteilt von Kai @PWeber in OME „Tips & Tricks"). Raw: `raw/youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md` (neu — kein Transcript, Beschreibung/Kapitel/25-Quellen-Liste; ausdrücklich Aggregation fremder Messwerte, Eigen-Caveat „individual user reports, not averages"). Wiki: `concepts/hardware/deepseek-v41-flash-lokale-hardware.md` (neu — Architektur an HF-`config.json` verifiziert: 384 Experten/6 pro Token, `engram_layer_ids [1,14]`, 1.048.576 Kontext, `expert_dtype fp4`; Hardware-Stufen-Tabelle 16 GB→512 GB; 5/15/20-tok/s-Grenzen; Prefill als zweite Bremse; Harness-Prompt und Reasoning-Effort als Durchsatz-Killer; Pruning-Falle (45 % Chemie); Payback 47,5 Monate gegen $200/Monat-API — ⚠️ Durchsatz/Preis = Einzelberichte, nicht nachgemessen), `people/marfil-draws.md` (neu — Kanal-Profil, 332 Abos). Cross-Refs: `concepts/llm/deepseek-v4.1-flash.md` (neue Lokale-Inferenz-Sektion + Offene Punkte), `tools/nvidia-dgx-spark.md` (Spark-Cluster-Werte 7→74 tok/s + Source), `concepts/hardware/lokale-ki-coding.md`, `concepts/llm/local-llm-laptop-guide.md`.)* *Vorherige Aktualisierung: 2026-09-17 (206. Update — DeepSeek V4.1 Flash auf lokaler Hardware: Durchsatz-Stufen, Q2/Q4-Quantisierung und API-Payback. Video „Run DeepSeek V4.1 Flash on ANY hardware (16GB to 512GB): can it work?" (Marfil Draws @themarfildraws, 16.09.2026, 13:26; geteilt von Kai @PWeber in OME „Tips & Tricks"). Raw: `raw/youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md` (neu — kein Transcript, Beschreibung/Kapitel/25-Quellen-Liste; ausdrücklich Aggregation fremder Messwerte, Eigen-Caveat „individual user reports, not averages"). Wiki: `concepts/hardware/deepseek-v41-flash-lokale-hardware.md` (neu — Architektur an HF-`config.json` verifiziert: 384 Experten/6 pro Token, `engram_layer_ids [1,14]`, 1.048.576 Kontext, `expert_dtype fp4`; Hardware-Stufen-Tabelle 16 GB→512 GB; 5/15/20-tok/s-Grenzen; Prefill als zweite Bremse; Harness-Prompt und Reasoning-Effort als Durchsatz-Killer; Pruning-Falle (45 % Chemie); Payback 47,5 Monate gegen $200/Monat-API — ⚠️ Durchsatz/Preis = Einzelberichte, nicht nachgemessen), `people/marfil-draws.md` (neu — Kanal-Profil, 332 Abos). Cross-Refs: `concepts/llm/deepseek-v4.1-flash.md` (neue Lokale-Inferenz-Sektion + Offene Punkte), `tools/nvidia-dgx-spark.md` (Spark-Cluster-Werte 7→74 tok/s + Source), `concepts/hardware/lokale-ki-coding.md`, `concepts/llm/local-llm-laptop-guide.md`.)*
@ -207,7 +209,7 @@
| [AI Psychological Testing — Rorschach-Tests für KI-Modelle](concepts/llm/ai-psychological-testing.md) | Brian Roemmele: Psychologische Tests an KI-Modellen (Rorschach, TAT). Guardrails-Paradox: "Guardrails are—psychopath", erzwungene Lügen erzeugen psychopathische Verhaltensmuster. Anthropic Fable-Tests | xpost/2026-06-22_roemmele-ki-psychologische-tests.md | | [AI Psychological Testing — Rorschach-Tests für KI-Modelle](concepts/llm/ai-psychological-testing.md) | Brian Roemmele: Psychologische Tests an KI-Modellen (Rorschach, TAT). Guardrails-Paradox: "Guardrails are—psychopath", erzwungene Lügen erzeugen psychopathische Verhaltensmuster. Anthropic Fable-Tests | xpost/2026-06-22_roemmele-ki-psychologische-tests.md |
| [Semantic Similarity Rating (SSR)](concepts/llm/semantic-similarity-rating-ssr.md) | LLM-basierte Kaufintentions-Vorhersage mit 90% Korrelation | xpost/2026-06-11_colgate-llm-purchase-intent-ssr.md | | [Semantic Similarity Rating (SSR)](concepts/llm/semantic-similarity-rating-ssr.md) | LLM-basierte Kaufintentions-Vorhersage mit 90% Korrelation | xpost/2026-06-11_colgate-llm-purchase-intent-ssr.md |
| [GLM 5.2 (Z.ai) — Chinese Frontier Coding Model](concepts/llm/glm-5.2-zai-coding-model.md) | 10x günstiger als Claude, 1M Kontext, MIT-Lizenz, Z.ai Coding Plan, **nativ in OpenClaw v2026.6.8**. Update 22.06.: Arnie-Review mit 4 Tests, Self-Hosting-Pfade (LM Studio, Unsloth, DwarfStar), Kosten-Analyse. **Update 29.06.:** Semgrep IDOR-Benchmark ≈ Opus 4.8 bei Schwachstellen-Suche, Reward Hacking im RL-Training, DSGVO-konforme Security-Nutzung, Geopolitik. **Update 01.07.:** #1 Open-Weights auf Artificial Analysis Intelligence Index v4.1 (Score 51, 4th worldwide), SWE-bench Pro 62.1 beats GPT-5.5, Industry praise from Rauch/Levie/Howard. **Update 02.07.:** atomic.chat One-Shot Benchmark — B+ at $0.08, 39× cheaper than Fable 5, 6th independent validation | youtube/2026-06-15_ichbinfabian-glm-5.2-coding-modell.md + other/2026-06-16_openclaw-releases-v2026.6.8.md + youtube/2026-06-22_ai-mit-arnie-glm-5-2-review.md + blog/2026-06-29_heise-glm52-hacking-cybersecurity.md + blog/2026-07-01_perplexity-glm52-tops-open-weights-intelligence-index.md + xpost/2026-07-02_atomicchat-coding-benchmark-fable5-gpt55-opus48-glm52.md | | [GLM 5.2 (Z.ai) — Chinese Frontier Coding Model](concepts/llm/glm-5.2-zai-coding-model.md) | 10x günstiger als Claude, 1M Kontext, MIT-Lizenz, Z.ai Coding Plan, **nativ in OpenClaw v2026.6.8**. Update 22.06.: Arnie-Review mit 4 Tests, Self-Hosting-Pfade (LM Studio, Unsloth, DwarfStar), Kosten-Analyse. **Update 29.06.:** Semgrep IDOR-Benchmark ≈ Opus 4.8 bei Schwachstellen-Suche, Reward Hacking im RL-Training, DSGVO-konforme Security-Nutzung, Geopolitik. **Update 01.07.:** #1 Open-Weights auf Artificial Analysis Intelligence Index v4.1 (Score 51, 4th worldwide), SWE-bench Pro 62.1 beats GPT-5.5, Industry praise from Rauch/Levie/Howard. **Update 02.07.:** atomic.chat One-Shot Benchmark — B+ at $0.08, 39× cheaper than Fable 5, 6th independent validation | youtube/2026-06-15_ichbinfabian-glm-5.2-coding-modell.md + other/2026-06-16_openclaw-releases-v2026.6.8.md + youtube/2026-06-22_ai-mit-arnie-glm-5-2-review.md + blog/2026-06-29_heise-glm52-hacking-cybersecurity.md + blog/2026-07-01_perplexity-glm52-tops-open-weights-intelligence-index.md + xpost/2026-07-02_atomicchat-coding-benchmark-fable5-gpt55-opus48-glm52.md |
| [GLM 5.3 (Z.ai) — Neue Generation der GLM-Serie](concepts/llm/glm-5.3-z-ai.md) | AICodeKing Early Access + Bench #1 (2026-08-14). **Update 26.08.: GLM-5.3-Flash offiziell released** — 320B-A18B MoE, 1M Kontext, MIT-Lizenz, nativ multimodal, auf chinesischen KI-Chips; „previously previewed as Ox Alpha"; Hybrid Sparse+Linear Attention, mHC, 30T-Token-Corpus; API $0.15/$0.50/$0.03; SGLang/vLLM/KTransformers; outperformt GLM-5.2, „on par with Claude Opus 4.8". Ox-Alpha-Rätsel offiziell aufgelöst → [[concepts/llm/ox-alpha-anonymous-model.md]] | youtube/2026-08-14_glm-5.3-aicodeking.md, xpost/2026-08-26_zai-glm53-flash-release.md | | [GLM 5.3 (Z.ai) — Neue Generation der GLM-Serie](concepts/llm/glm-5.3-z-ai.md) | AICodeKing Early Access + Bench #1 (2026-08-14). **Update 26.08.: GLM-5.3-Flash offiziell released** — 320B-A18B MoE, 1M Kontext, MIT-Lizenz, nativ multimodal, auf chinesischen KI-Chips; „previously previewed as Ox Alpha"; Hybrid Sparse+Linear Attention, mHC, 30T-Token-Corpus; API $0.15/$0.50/$0.03; SGLang/vLLM/KTransformers; outperformt GLM-5.2, „on par with Claude Opus 4.8". Ox-Alpha-Rätsel offiziell aufgelöst → [[concepts/llm/ox-alpha-anonymous-model.md]]. **Update 17.09.:** Benchmarks der Ollama-Seite nachgetragen + Flash-gegen-Flash-Vergleich mit DS-V4.1-Flash (DeepSeek vorn bei Agentic/Coding; Cache-Hit bei DeepSeek 10× billiger) | youtube/2026-08-14_glm-5.3-aicodeking.md, xpost/2026-08-26_zai-glm53-flash-release.md, other/2026-09-17_ollama-benchmarks-glm-53-flash-vs-deepseek-v41-flash.md |
| [GLM-5.5 (Z.ai) — Trillion-Parameter Announcement](concepts/llm/glm-5.5-z-ai.md) | Successor to GLM 5.2. **>1T parameters**, 1M context, open weights, August 2026 launch. Agent/coding focus. Fourth Chinese AI announcement in four days (20.07.2026). Part of [[concepts/chinese-ai-wave-july-2026.md]]. Comparison table vs GLM 5.2 | xpost/2026-07-20-healthranger-four-chinese-models.md | | [GLM-5.5 (Z.ai) — Trillion-Parameter Announcement](concepts/llm/glm-5.5-z-ai.md) | Successor to GLM 5.2. **>1T parameters**, 1M context, open weights, August 2026 launch. Agent/coding focus. Fourth Chinese AI announcement in four days (20.07.2026). Part of [[concepts/chinese-ai-wave-july-2026.md]]. Comparison table vs GLM 5.2 | xpost/2026-07-20-healthranger-four-chinese-models.md |
| [Ox Alpha — Anonymes KI-Modell auf OpenRouter](concepts/llm/ox-alpha-anonymous-model.md) | Gerücht/Leak (2026-08-22, Insider leak of the day): mysteriöses anonymes Modell auf OpenRouter — 1M-Token-Kontext, multimodal, kein Owner — soll beim Coding Claude Fable 5 + GPT-5.6 Sol schlagen. GLM-identischer Tokenizer; vier vorherige anonyme Drops von chinesischen Labs beansprucht. Offene Herkunfts-Frage (Google vs. Z.ai). **Update 26.08. (EP106):** exakte Listing-Zahlen datiert auf 21.08.: 1.048.576 Kontext / 4.096 Max-Output, Stealth-Positionierung als Agentic-Coding-Reasoning-Modell, Capability-Beschreibung bricht mitten im Satz ab; read-heavy-Agent-Pipeline-Einordnung; Widerspruch zum 131k-Output-Gegencheck offen. ⚠️ Unbestätigt | xpost/2026-08-23_insiderleak-ox-alpha-anonymous-model.md + podcast/2026-08-26_agentstack-daily-ep106.md | | [Ox Alpha — Anonymes KI-Modell auf OpenRouter](concepts/llm/ox-alpha-anonymous-model.md) | Gerücht/Leak (2026-08-22, Insider leak of the day): mysteriöses anonymes Modell auf OpenRouter — 1M-Token-Kontext, multimodal, kein Owner — soll beim Coding Claude Fable 5 + GPT-5.6 Sol schlagen. GLM-identischer Tokenizer; vier vorherige anonyme Drops von chinesischen Labs beansprucht. Offene Herkunfts-Frage (Google vs. Z.ai). **Update 26.08. (EP106):** exakte Listing-Zahlen datiert auf 21.08.: 1.048.576 Kontext / 4.096 Max-Output, Stealth-Positionierung als Agentic-Coding-Reasoning-Modell, Capability-Beschreibung bricht mitten im Satz ab; read-heavy-Agent-Pipeline-Einordnung; Widerspruch zum 131k-Output-Gegencheck offen. ⚠️ Unbestätigt | xpost/2026-08-23_insiderleak-ox-alpha-anonymous-model.md + podcast/2026-08-26_agentstack-daily-ep106.md |
| [Qwen3.8-27B (Alibaba) — Compact Frontier, "Intelligence Density"](concepts/llm/qwen3.8-27b-alibaba.md) | HuggingFace-Release (Countdown bis 14.08.2026, 4.928 wartend). Kompaktes 27B-Modell der Qwen3.8-Generation mit "unmatched intelligence density". Kontrast zum 2.4T-MoE von Qwen 3.8. Lokal-relevant (27B läuft auf Consumer-HW). Release am selben Tag wie GLM-5.3-Review — chinesischer Release-Zyklus. **Update 18.08.:** jetzt auf Ollama lauffähig (`ollama run qwen3.8:27b`), dichte 27,8B-Architektur, Hybrid-Attention, 262k-Kontext (bis 1M via YaRN), multimodal, MTP-markierte Ollama-Tags für Inferenz-Speedup. **Update 19.08.:** DFlash 2 (Z Lab → Inco AI) erreicht 70 tok/s auf M5 Max MacBook Pro — bis 4,6× schneller als autoregressives Decoding via Speculative Decoding (Jun Song: „biggest breakthrough in local AI this year", nächste Innovation in Prefill/Gewichtskompression). Uncensored-Debatte: gregpr07 („no gates") vs. s1gmoid-Gegenposition (Verhältnismäßigkeit). **Update 20.08.:** Unsloth Dynamic 3.0-GGUFs für Qwen3.8-27B — neue UD-…-Dateien deutlich kleiner (UD-IQ1_S 6,2 GB bis Q6_K 22 GB), Qualität-zu-Größe verbessert, ≠ MTP/Speculative-Decoding. **Update 26.08. (EP106):** HF-Trending-Stand 21.08.: 11.836 Likes, 1.726.651 Downloads (>1,7 Mio), image-text-to-text, SafeTensors, Apache 2.0 | other/2026-08-14_qwen3.8-27b-huggingface-release.md + youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md + xpost/2026-08-19_junsong-dflash2-speculative-decoding.md + xpost/2026-08-19_gregpr07-qwen38-uncensored.md + xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38.md + podcast/2026-08-26_agentstack-daily-ep106.md | | [Qwen3.8-27B (Alibaba) — Compact Frontier, "Intelligence Density"](concepts/llm/qwen3.8-27b-alibaba.md) | HuggingFace-Release (Countdown bis 14.08.2026, 4.928 wartend). Kompaktes 27B-Modell der Qwen3.8-Generation mit "unmatched intelligence density". Kontrast zum 2.4T-MoE von Qwen 3.8. Lokal-relevant (27B läuft auf Consumer-HW). Release am selben Tag wie GLM-5.3-Review — chinesischer Release-Zyklus. **Update 18.08.:** jetzt auf Ollama lauffähig (`ollama run qwen3.8:27b`), dichte 27,8B-Architektur, Hybrid-Attention, 262k-Kontext (bis 1M via YaRN), multimodal, MTP-markierte Ollama-Tags für Inferenz-Speedup. **Update 19.08.:** DFlash 2 (Z Lab → Inco AI) erreicht 70 tok/s auf M5 Max MacBook Pro — bis 4,6× schneller als autoregressives Decoding via Speculative Decoding (Jun Song: „biggest breakthrough in local AI this year", nächste Innovation in Prefill/Gewichtskompression). Uncensored-Debatte: gregpr07 („no gates") vs. s1gmoid-Gegenposition (Verhältnismäßigkeit). **Update 20.08.:** Unsloth Dynamic 3.0-GGUFs für Qwen3.8-27B — neue UD-…-Dateien deutlich kleiner (UD-IQ1_S 6,2 GB bis Q6_K 22 GB), Qualität-zu-Größe verbessert, ≠ MTP/Speculative-Decoding. **Update 26.08. (EP106):** HF-Trending-Stand 21.08.: 11.836 Likes, 1.726.651 Downloads (>1,7 Mio), image-text-to-text, SafeTensors, Apache 2.0 | other/2026-08-14_qwen3.8-27b-huggingface-release.md + youtube/2026-08-18_qwen-38-27b-ollama-julian-goldie.md + xpost/2026-08-19_junsong-dflash2-speculative-decoding.md + xpost/2026-08-19_gregpr07-qwen38-uncensored.md + xpost/2026-08-20_teksedge-unsloth-dynamic-3.0-qwen38.md + podcast/2026-08-26_agentstack-daily-ep106.md |

View file

@ -3378,3 +3378,20 @@ Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Über
- wiki (UPDATED): `wiki/concepts/llm/deepseek-v4.1-flash.md` (Lokale-Inferenz-Sektion + Offene Punkte), `wiki/tools/nvidia-dgx-spark.md` (Spark-Cluster-Werte 7→74 tok/s, Source), `wiki/concepts/hardware/lokale-ki-coding.md`, `wiki/concepts/llm/local-llm-laptop-guide.md` - wiki (UPDATED): `wiki/concepts/llm/deepseek-v4.1-flash.md` (Lokale-Inferenz-Sektion + Offene Punkte), `wiki/tools/nvidia-dgx-spark.md` (Spark-Cluster-Werte 7→74 tok/s, Source), `wiki/concepts/hardware/lokale-ki-coding.md`, `wiki/concepts/llm/local-llm-laptop-guide.md`
- `wiki/index.md` (206. Update, Hardware-Row, People-Row, Raw-Source-Row, V4.1-Row) - `wiki/index.md` (206. Update, Hardware-Row, People-Row, Raw-Source-Row, V4.1-Row)
- `wiki/log.md` (dieser Eintrag) - `wiki/log.md` (dieser Eintrag)
## 2026-09-17 — Flash-gegen-Flash-Benchmark-Abgleich: GLM-5.3-Flash vs. DeepSeek-V4.1-Flash
**Type:** ingest + wiki-update | **Scope:** raw/other, wiki/concepts/llm, wiki/index, wiki/log
**Anlass:** Gruppenbeitrag im Topic „Tips & Tricks" (Netbits), der GLM-5.3-Flash gegen DeepSeek-V4.1-Flash verglich — mit der Prämisse, für glm-5.3-flash lägen keine veröffentlichten Benchmarks vor, weshalb ersatzweise das große GLM-5.3 herangezogen wurde.
**Vorgehen:** Beide Ollama-Modellseiten direkt abgerufen (17.09.2026) und die Zahlen gegen die Quelle gehalten.
**Befunde:**
1. **Prämisse widerlegt.** `ollama.com/library/glm-5.3-flash` hat eine vollständige Benchmark-Tabelle (Coding, Agentic, Vision) — der Umweg über das große Geschwister war unnötig.
2. **Spaltenbeschriftungs-Falle.** Die GLM-Spalte der DeepSeek-Seite heißt im HTML „GLM-5.3", nicht „GLM-5.3-Flash". Ein Flash-gegen-Flash-Vergleich über diese Spalte vergleicht das große Modell mit. Zusätzlich listet die GLM-Flash-Tabelle **keine** Terminal-Bench-3.0/4.0-Zeile — der kursierende TB-4.0-Wert 37,9 stammt aus der GLM-5.3-Spalte der DeepSeek-Seite.
3. **Flash gegen Flash:** DeepSeek durchweg vorn auf Coding/Agentic (DeepSWE 74,2 vs. 63,4; ALE 31,8 vs. 26,3; HLE w/tools 63,9 vs. 55,3; NL2Repo 64,0 vs. 56,3; AutomationBench 54,8 vs. 48,8; TB 2.1 90,6 vs. 84,3). GLM vorn bei Toolathlon (78,4, kein DS-Wert) und im Vision-Block.
4. **Kosten-Nuance:** Input identisch ($0,15), Output GLM 17 % günstiger ($0,50 vs. $0,60) — aber Cache-Hit bei DeepSeek zehnmal billiger ($0,003 vs. $0,03). Bei cache-lastiger Agentenarbeit kippt die Rechnung zu DeepSeek.
**Dateien:**
- raw (NEW): `raw/other/2026-09-17_ollama-benchmarks-glm-53-flash-vs-deepseek-v41-flash.md`
- wiki (UPDATED): `wiki/concepts/llm/glm-5.3-z-ai.md` (Benchmark-Tabelle der Flash-Seite, Flash-gegen-Flash-Sektion, Spaltenbeschriftungs-Warnung, Cache-Nuance, Source ergänzt)
- `wiki/index.md` (210. Update, GLM-Row erweitert)
- `wiki/log.md` (dieser Eintrag)
**Einschränkung:** Beide Tabellen sind Hersteller-Selbstauskunft. Die unabhängige Artificial-Analysis-Vergleichsseite existiert, rendert ihre Einzelwerte aber clientseitig und war beim Abruf nicht auslesbar.