- raw: evals.typesafe.ai (lokal gelesen) + devto label-kritik (17.09.2026) - wiki: concepts/llm/system-one-models-jev (benchmark-lage, guardrail-tausch), people/gabriel-anhaia (neu) - korrektur: jev unter opus 5/sol, nicht darueber - index 222. update + log
4.2 KiB
| type | source_url | retrieved | title | author | tags | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| blog | https://dev.to/gabrielanhaia/jev-beat-gpt-luna-by-1-point-gpt-6-and-claude-wrote-the-answer-key-314k | 2026-09-18 | Jev Beat GPT Luna by 1 Point. GPT-6 and Claude Wrote the Answer Key. | Gabriel Anhaia |
|
Gabriel Anhaia: Vercel-fx-Benchmark und die Label-Kritik (17.09.2026)
dev.to-Artikel, veröffentlicht 2026-09-17T08:46:14Z, abgerufen 18.09.2026 (HTTP 200, Volltext lesbar). Autor ist Gabriel Anhaia (Entwickler/Buchautor, xgabriel.com; bewirbt im Artikel eigene Bücher und ein „Hermes IDE" genanntes Projekt — Eigeninteresse an Aufmerksamkeit vorhanden, aber die zitierten Quellen sind nachprüfbar).
Der neue Befund: Vercels fx wechselt den Guardrail-Prüfer
- Guillermo Rauch (Vercel CEO, @rauchg, 871.158 Follower, verifiziert) laut Artikel: „Default mode in fx is auto, with a safety reviewer analyzing every command. That reviewer runs on GPT Luna today. Jev is up to 18x faster (p95) and more accurate. It's coming to @vercel AI Gateway and likely new default."
- Pranit (@fazxes, 1.755 Follower, verifiziert; Bio „Builder of http://fx.sh @Vercel"): „We benchmarked fx auto mode (safety) classifier with @typesafeai's Jev. tl;dr: ~5-18x faster and more accurate than gpt-5.6-luna, our current top choice."
- Verknüpfung: Am 16.09.2026 meldete der Vercel-Changelog Jev als verfügbar auf dem AI Gateway.
Anwendungsfall: fx ist ein Coding-Agent-CLI; im Modus „auto" prüft ein Sicherheits-Reviewer jeden Befehl. Hier geht es also nicht um Klassifikation als Produkt, sondern um einen Guardrail-Tausch in einem Werkzeug mit großer Verbreitung.
Grenzen dieses Befunds (vom Autor selbst benannt)
- „As of September 17, Vercel hasn't published the benchmark behind its claim." — kein Datensatz, keine Fallzahl, keine Methodik; nur Posts.
- Die Zahlen der beiden Posts (18× p95 / „~5-18×") sind Spannen ohne Rohdaten.
- TypeSafe-Zahlen bleiben die einzigen detaillierten; sie sind aber gegen Labels von GPT-6 Astra und Claude Fable 5.1 gemessen.
Die Label-Kritik des Artikels (Kernstück)
- „TypeSafe's accuracy scores are graded against labels generated by GPT-6 Astra and Claude Fable 5.1." — also gegen Antworten zweier Frontier-Modelle, nicht gegen verifizierte Wahrheit.
- Wörtlich: „Where both frontier models get a case wrong, a model that gets it right is marked down." — wer gegen einen gemeinsamen Blindfleck richtig liegt, verliert Punkte.
- Der Autor zitiert die Selbstoffenlegung von TypeSafe (Launch-Artikel: Eval-Workflows könnten „some bias" tragen; die Demo-Query sei „highly simplified"; die Homepage-Zahl „193.6x / 444.6x" sei am „higher end of real world gains") und nennt das ausdrücklich lobenswert — es sei trotzdem die Leseanleitung für die Tabelle.
- Empfehlung des Autors vor einem Modelltausch im Guardrail: eigener Bake-off auf den eigenen Labels, Blick auf den Konfidenz-Band (nicht nur Brier-Score über alles), p95-Latenz aus der eigenen Betriebsumgebung inklusive Retries, und Kontrolle nach dem Wechsel (Distribution Shift).
Zahlen aus dem Artikel (TypeSafe-Aggregat, dort als Tabelle zitiert)
Jev 67,8 % / $0,0004 / 0,4 s · GPT-5.6 Luna 66,8 % / $0,0033 / 12,9 s · GPT-5.6 Terra 67,9 % / $0,0304 / 10,1 s · Claude Sonnet 5 67,8 % / $0,1174 / 78,1 s · GPT-5.6 Sol 74,1 % / $0,0836 / 23,3 s · Claude Opus 5 73,1 % / $0,1761 / 37,8 s. Der Artikel fasst zusammen: Jev schlägt Luna „by a point", zu rund einem Achtel der Kosten und einem Dreißigstel der Latenz; Sol und Opus 5 liegen rund sechs bzw. fünf Punkte höher bei etwa 210× bzw. 440× der Kosten pro Fall.
Eigene Gegenprüfung: Diese Werte stehen wörtlich auf https://evals.typesafe.ai/ (lokal gelesen 18.09.2026) — der Artikel gibt sie korrekt wieder.
Offene Punkte
- Vercels Benchmark ist bis heute nicht veröffentlicht; die „18×"/„5-18×" sind unbelegte Hersteller-/Werkzeugangaben.
- Ob
fxmittlerweile tatsächlich auf Jev als Default läuft, ist nicht belegt (Rauchg schreibt „likely new default"). - Der Artikel enthält Eigenwerbung (Bücher, IDE); die zitierten Primärquellen sind davon unabhängig prüfbar.