46 lines
4.2 KiB
Markdown
46 lines
4.2 KiB
Markdown
|
|
---
|
|||
|
|
type: blog
|
|||
|
|
source_url: https://dev.to/gabrielanhaia/jev-beat-gpt-luna-by-1-point-gpt-6-and-claude-wrote-the-answer-key-314k
|
|||
|
|
retrieved: 2026-09-18
|
|||
|
|
title: "Jev Beat GPT Luna by 1 Point. GPT-6 and Claude Wrote the Answer Key."
|
|||
|
|
author: "Gabriel Anhaia"
|
|||
|
|
tags: [jev, typesafe-ai, vercel, fx, guardrail, benchmark, luna, label-kritik]
|
|||
|
|
---
|
|||
|
|
|
|||
|
|
# Gabriel Anhaia: Vercel-`fx`-Benchmark und die Label-Kritik (17.09.2026)
|
|||
|
|
|
|||
|
|
dev.to-Artikel, veröffentlicht **2026-09-17T08:46:14Z**, abgerufen 18.09.2026 (HTTP 200, Volltext lesbar). Autor ist Gabriel Anhaia (Entwickler/Buchautor, xgabriel.com; bewirbt im Artikel eigene Bücher und ein „Hermes IDE" genanntes Projekt — Eigeninteresse an Aufmerksamkeit vorhanden, aber die zitierten Quellen sind nachprüfbar).
|
|||
|
|
|
|||
|
|
## Der neue Befund: Vercels `fx` wechselt den Guardrail-Prüfer
|
|||
|
|
|
|||
|
|
- **Guillermo Rauch** (Vercel CEO, [@rauchg](https://x.com/rauchg), 871.158 Follower, verifiziert) laut Artikel: „Default mode in fx is auto, with a safety reviewer analyzing every command. That reviewer runs on GPT Luna today. Jev is up to 18x faster (p95) and more accurate. It's coming to @vercel AI Gateway and likely new default."
|
|||
|
|
- **Pranit** ([@fazxes](https://x.com/fazxes), 1.755 Follower, verifiziert; Bio „Builder of http://fx.sh @Vercel"): „We benchmarked fx auto mode (safety) classifier with @typesafeai's Jev. tl;dr: ~5-18x faster and more accurate than gpt-5.6-luna, our current top choice."
|
|||
|
|
- Verknüpfung: Am 16.09.2026 meldete der Vercel-Changelog Jev als verfügbar auf dem AI Gateway.
|
|||
|
|
|
|||
|
|
**Anwendungsfall:** `fx` ist ein Coding-Agent-CLI; im Modus „auto" prüft ein Sicherheits-Reviewer jeden Befehl. Hier geht es also nicht um Klassifikation als Produkt, sondern um einen **Guardrail-Tausch** in einem Werkzeug mit großer Verbreitung.
|
|||
|
|
|
|||
|
|
## Grenzen dieses Befunds (vom Autor selbst benannt)
|
|||
|
|
|
|||
|
|
- „As of September 17, Vercel hasn't published the benchmark behind its claim." — kein Datensatz, keine Fallzahl, keine Methodik; nur Posts.
|
|||
|
|
- Die Zahlen der beiden Posts (18× p95 / „~5-18×") sind Spannen ohne Rohdaten.
|
|||
|
|
- TypeSafe-Zahlen bleiben die einzigen detaillierten; sie sind aber gegen Labels von GPT-6 Astra und Claude Fable 5.1 gemessen.
|
|||
|
|
|
|||
|
|
## Die Label-Kritik des Artikels (Kernstück)
|
|||
|
|
|
|||
|
|
- „TypeSafe's accuracy scores are graded against labels generated by GPT-6 Astra and Claude Fable 5.1." — also gegen **Antworten zweier Frontier-Modelle**, nicht gegen verifizierte Wahrheit.
|
|||
|
|
- Wörtlich: „Where both frontier models get a case wrong, a model that gets it right is marked down." — wer gegen einen gemeinsamen Blindfleck richtig liegt, verliert Punkte.
|
|||
|
|
- Der Autor zitiert die Selbstoffenlegung von TypeSafe (Launch-Artikel: Eval-Workflows könnten „some bias" tragen; die Demo-Query sei „highly simplified"; die Homepage-Zahl „193.6x / 444.6x" sei am „higher end of real world gains") und nennt das ausdrücklich lobenswert — es sei trotzdem die Leseanleitung für die Tabelle.
|
|||
|
|
- Empfehlung des Autors vor einem Modelltausch im Guardrail: eigener Bake-off auf den **eigenen** Labels, Blick auf den Konfidenz-Band (nicht nur Brier-Score über alles), p95-Latenz aus der eigenen Betriebsumgebung inklusive Retries, und Kontrolle nach dem Wechsel (Distribution Shift).
|
|||
|
|
|
|||
|
|
## Zahlen aus dem Artikel (TypeSafe-Aggregat, dort als Tabelle zitiert)
|
|||
|
|
|
|||
|
|
Jev 67,8 % / $0,0004 / 0,4 s · GPT-5.6 Luna 66,8 % / $0,0033 / 12,9 s · GPT-5.6 Terra 67,9 % / $0,0304 / 10,1 s · Claude Sonnet 5 67,8 % / $0,1174 / 78,1 s · GPT-5.6 Sol 74,1 % / $0,0836 / 23,3 s · Claude Opus 5 73,1 % / $0,1761 / 37,8 s. Der Artikel fasst zusammen: Jev schlägt Luna „by a point", zu rund einem Achtel der Kosten und einem Dreißigstel der Latenz; Sol und Opus 5 liegen rund sechs bzw. fünf Punkte höher bei etwa 210× bzw. 440× der Kosten pro Fall.
|
|||
|
|
|
|||
|
|
Eigene Gegenprüfung: Diese Werte stehen wörtlich auf https://evals.typesafe.ai/ (lokal gelesen 18.09.2026) — der Artikel gibt sie korrekt wieder.
|
|||
|
|
|
|||
|
|
## Offene Punkte
|
|||
|
|
|
|||
|
|
- Vercels Benchmark ist bis heute nicht veröffentlicht; die „18×"/„5-18×" sind unbelegte Hersteller-/Werkzeugangaben.
|
|||
|
|
- Ob `fx` mittlerweile tatsächlich auf Jev als Default läuft, ist nicht belegt (Rauchg schreibt „likely new default").
|
|||
|
|
- Der Artikel enthält Eigenwerbung (Bücher, IDE); die zitierten Primärquellen sind davon unabhängig prüfbar.
|