knowledge-base/raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md
Hector b9dd98dadb ingest(other): typesafe workflow-evals + vercel fx guardrail-tausch + label-kritik
- raw: evals.typesafe.ai (lokal gelesen) + devto label-kritik (17.09.2026)
- wiki: concepts/llm/system-one-models-jev (benchmark-lage, guardrail-tausch), people/gabriel-anhaia (neu)
- korrektur: jev unter opus 5/sol, nicht darueber
- index 222. update + log
2026-09-19 00:01:22 +02:00

45 lines
4.2 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
type: blog
source_url: https://dev.to/gabrielanhaia/jev-beat-gpt-luna-by-1-point-gpt-6-and-claude-wrote-the-answer-key-314k
retrieved: 2026-09-18
title: "Jev Beat GPT Luna by 1 Point. GPT-6 and Claude Wrote the Answer Key."
author: "Gabriel Anhaia"
tags: [jev, typesafe-ai, vercel, fx, guardrail, benchmark, luna, label-kritik]
---
# Gabriel Anhaia: Vercel-`fx`-Benchmark und die Label-Kritik (17.09.2026)
dev.to-Artikel, veröffentlicht **2026-09-17T08:46:14Z**, abgerufen 18.09.2026 (HTTP 200, Volltext lesbar). Autor ist Gabriel Anhaia (Entwickler/Buchautor, xgabriel.com; bewirbt im Artikel eigene Bücher und ein „Hermes IDE" genanntes Projekt — Eigeninteresse an Aufmerksamkeit vorhanden, aber die zitierten Quellen sind nachprüfbar).
## Der neue Befund: Vercels `fx` wechselt den Guardrail-Prüfer
- **Guillermo Rauch** (Vercel CEO, [@rauchg](https://x.com/rauchg), 871.158 Follower, verifiziert) laut Artikel: „Default mode in fx is auto, with a safety reviewer analyzing every command. That reviewer runs on GPT Luna today. Jev is up to 18x faster (p95) and more accurate. It's coming to @vercel AI Gateway and likely new default."
- **Pranit** ([@fazxes](https://x.com/fazxes), 1.755 Follower, verifiziert; Bio „Builder of http://fx.sh @Vercel"): „We benchmarked fx auto mode (safety) classifier with @typesafeai's Jev. tl;dr: ~5-18x faster and more accurate than gpt-5.6-luna, our current top choice."
- Verknüpfung: Am 16.09.2026 meldete der Vercel-Changelog Jev als verfügbar auf dem AI Gateway.
**Anwendungsfall:** `fx` ist ein Coding-Agent-CLI; im Modus „auto" prüft ein Sicherheits-Reviewer jeden Befehl. Hier geht es also nicht um Klassifikation als Produkt, sondern um einen **Guardrail-Tausch** in einem Werkzeug mit großer Verbreitung.
## Grenzen dieses Befunds (vom Autor selbst benannt)
- „As of September 17, Vercel hasn't published the benchmark behind its claim." — kein Datensatz, keine Fallzahl, keine Methodik; nur Posts.
- Die Zahlen der beiden Posts (18× p95 / „~5-18×") sind Spannen ohne Rohdaten.
- TypeSafe-Zahlen bleiben die einzigen detaillierten; sie sind aber gegen Labels von GPT-6 Astra und Claude Fable 5.1 gemessen.
## Die Label-Kritik des Artikels (Kernstück)
- „TypeSafe's accuracy scores are graded against labels generated by GPT-6 Astra and Claude Fable 5.1." — also gegen **Antworten zweier Frontier-Modelle**, nicht gegen verifizierte Wahrheit.
- Wörtlich: „Where both frontier models get a case wrong, a model that gets it right is marked down." — wer gegen einen gemeinsamen Blindfleck richtig liegt, verliert Punkte.
- Der Autor zitiert die Selbstoffenlegung von TypeSafe (Launch-Artikel: Eval-Workflows könnten „some bias" tragen; die Demo-Query sei „highly simplified"; die Homepage-Zahl „193.6x / 444.6x" sei am „higher end of real world gains") und nennt das ausdrücklich lobenswert — es sei trotzdem die Leseanleitung für die Tabelle.
- Empfehlung des Autors vor einem Modelltausch im Guardrail: eigener Bake-off auf den **eigenen** Labels, Blick auf den Konfidenz-Band (nicht nur Brier-Score über alles), p95-Latenz aus der eigenen Betriebsumgebung inklusive Retries, und Kontrolle nach dem Wechsel (Distribution Shift).
## Zahlen aus dem Artikel (TypeSafe-Aggregat, dort als Tabelle zitiert)
Jev 67,8 % / $0,0004 / 0,4 s · GPT-5.6 Luna 66,8 % / $0,0033 / 12,9 s · GPT-5.6 Terra 67,9 % / $0,0304 / 10,1 s · Claude Sonnet 5 67,8 % / $0,1174 / 78,1 s · GPT-5.6 Sol 74,1 % / $0,0836 / 23,3 s · Claude Opus 5 73,1 % / $0,1761 / 37,8 s. Der Artikel fasst zusammen: Jev schlägt Luna „by a point", zu rund einem Achtel der Kosten und einem Dreißigstel der Latenz; Sol und Opus 5 liegen rund sechs bzw. fünf Punkte höher bei etwa 210× bzw. 440× der Kosten pro Fall.
Eigene Gegenprüfung: Diese Werte stehen wörtlich auf https://evals.typesafe.ai/ (lokal gelesen 18.09.2026) — der Artikel gibt sie korrekt wieder.
## Offene Punkte
- Vercels Benchmark ist bis heute nicht veröffentlicht; die „18×"/„5-18×" sind unbelegte Hersteller-/Werkzeugangaben.
- Ob `fx` mittlerweile tatsächlich auf Jev als Default läuft, ist nicht belegt (Rauchg schreibt „likely new default").
- Der Artikel enthält Eigenwerbung (Bücher, IDE); die zitierten Primärquellen sind davon unabhängig prüfbar.