- raw: evals.typesafe.ai (lokal gelesen) + devto label-kritik (17.09.2026) - wiki: concepts/llm/system-one-models-jev (benchmark-lage, guardrail-tausch), people/gabriel-anhaia (neu) - korrektur: jev unter opus 5/sol, nicht darueber - index 222. update + log
45 lines
4.2 KiB
Markdown
45 lines
4.2 KiB
Markdown
---
|
||
type: blog
|
||
source_url: https://dev.to/gabrielanhaia/jev-beat-gpt-luna-by-1-point-gpt-6-and-claude-wrote-the-answer-key-314k
|
||
retrieved: 2026-09-18
|
||
title: "Jev Beat GPT Luna by 1 Point. GPT-6 and Claude Wrote the Answer Key."
|
||
author: "Gabriel Anhaia"
|
||
tags: [jev, typesafe-ai, vercel, fx, guardrail, benchmark, luna, label-kritik]
|
||
---
|
||
|
||
# Gabriel Anhaia: Vercel-`fx`-Benchmark und die Label-Kritik (17.09.2026)
|
||
|
||
dev.to-Artikel, veröffentlicht **2026-09-17T08:46:14Z**, abgerufen 18.09.2026 (HTTP 200, Volltext lesbar). Autor ist Gabriel Anhaia (Entwickler/Buchautor, xgabriel.com; bewirbt im Artikel eigene Bücher und ein „Hermes IDE" genanntes Projekt — Eigeninteresse an Aufmerksamkeit vorhanden, aber die zitierten Quellen sind nachprüfbar).
|
||
|
||
## Der neue Befund: Vercels `fx` wechselt den Guardrail-Prüfer
|
||
|
||
- **Guillermo Rauch** (Vercel CEO, [@rauchg](https://x.com/rauchg), 871.158 Follower, verifiziert) laut Artikel: „Default mode in fx is auto, with a safety reviewer analyzing every command. That reviewer runs on GPT Luna today. Jev is up to 18x faster (p95) and more accurate. It's coming to @vercel AI Gateway and likely new default."
|
||
- **Pranit** ([@fazxes](https://x.com/fazxes), 1.755 Follower, verifiziert; Bio „Builder of http://fx.sh @Vercel"): „We benchmarked fx auto mode (safety) classifier with @typesafeai's Jev. tl;dr: ~5-18x faster and more accurate than gpt-5.6-luna, our current top choice."
|
||
- Verknüpfung: Am 16.09.2026 meldete der Vercel-Changelog Jev als verfügbar auf dem AI Gateway.
|
||
|
||
**Anwendungsfall:** `fx` ist ein Coding-Agent-CLI; im Modus „auto" prüft ein Sicherheits-Reviewer jeden Befehl. Hier geht es also nicht um Klassifikation als Produkt, sondern um einen **Guardrail-Tausch** in einem Werkzeug mit großer Verbreitung.
|
||
|
||
## Grenzen dieses Befunds (vom Autor selbst benannt)
|
||
|
||
- „As of September 17, Vercel hasn't published the benchmark behind its claim." — kein Datensatz, keine Fallzahl, keine Methodik; nur Posts.
|
||
- Die Zahlen der beiden Posts (18× p95 / „~5-18×") sind Spannen ohne Rohdaten.
|
||
- TypeSafe-Zahlen bleiben die einzigen detaillierten; sie sind aber gegen Labels von GPT-6 Astra und Claude Fable 5.1 gemessen.
|
||
|
||
## Die Label-Kritik des Artikels (Kernstück)
|
||
|
||
- „TypeSafe's accuracy scores are graded against labels generated by GPT-6 Astra and Claude Fable 5.1." — also gegen **Antworten zweier Frontier-Modelle**, nicht gegen verifizierte Wahrheit.
|
||
- Wörtlich: „Where both frontier models get a case wrong, a model that gets it right is marked down." — wer gegen einen gemeinsamen Blindfleck richtig liegt, verliert Punkte.
|
||
- Der Autor zitiert die Selbstoffenlegung von TypeSafe (Launch-Artikel: Eval-Workflows könnten „some bias" tragen; die Demo-Query sei „highly simplified"; die Homepage-Zahl „193.6x / 444.6x" sei am „higher end of real world gains") und nennt das ausdrücklich lobenswert — es sei trotzdem die Leseanleitung für die Tabelle.
|
||
- Empfehlung des Autors vor einem Modelltausch im Guardrail: eigener Bake-off auf den **eigenen** Labels, Blick auf den Konfidenz-Band (nicht nur Brier-Score über alles), p95-Latenz aus der eigenen Betriebsumgebung inklusive Retries, und Kontrolle nach dem Wechsel (Distribution Shift).
|
||
|
||
## Zahlen aus dem Artikel (TypeSafe-Aggregat, dort als Tabelle zitiert)
|
||
|
||
Jev 67,8 % / $0,0004 / 0,4 s · GPT-5.6 Luna 66,8 % / $0,0033 / 12,9 s · GPT-5.6 Terra 67,9 % / $0,0304 / 10,1 s · Claude Sonnet 5 67,8 % / $0,1174 / 78,1 s · GPT-5.6 Sol 74,1 % / $0,0836 / 23,3 s · Claude Opus 5 73,1 % / $0,1761 / 37,8 s. Der Artikel fasst zusammen: Jev schlägt Luna „by a point", zu rund einem Achtel der Kosten und einem Dreißigstel der Latenz; Sol und Opus 5 liegen rund sechs bzw. fünf Punkte höher bei etwa 210× bzw. 440× der Kosten pro Fall.
|
||
|
||
Eigene Gegenprüfung: Diese Werte stehen wörtlich auf https://evals.typesafe.ai/ (lokal gelesen 18.09.2026) — der Artikel gibt sie korrekt wieder.
|
||
|
||
## Offene Punkte
|
||
|
||
- Vercels Benchmark ist bis heute nicht veröffentlicht; die „18×"/„5-18×" sind unbelegte Hersteller-/Werkzeugangaben.
|
||
- Ob `fx` mittlerweile tatsächlich auf Jev als Default läuft, ist nicht belegt (Rauchg schreibt „likely new default").
|
||
- Der Artikel enthält Eigenwerbung (Bücher, IDE); die zitierten Primärquellen sind davon unabhängig prüfbar.
|