From b9dd98dadbb726410561d50670bb52bdcf24fceb Mon Sep 17 00:00:00 2001 From: Hector Date: Sat, 19 Sep 2026 00:01:22 +0200 Subject: [PATCH] ingest(other): typesafe workflow-evals + vercel fx guardrail-tausch + label-kritik - raw: evals.typesafe.ai (lokal gelesen) + devto label-kritik (17.09.2026) - wiki: concepts/llm/system-one-models-jev (benchmark-lage, guardrail-tausch), people/gabriel-anhaia (neu) - korrektur: jev unter opus 5/sol, nicht darueber - index 222. update + log --- .../2026-09-17_devto-jev-vs-luna-bake-off.md | 45 ++++++++++++++ .../2026-09-17_typesafe-workflow-evals.md | 61 +++++++++++++++++++ wiki/concepts/llm/system-one-models-jev.md | 41 ++++++++++++- wiki/index.md | 6 +- wiki/people/gabriel-anhaia.md | 23 +++++++ 5 files changed, 173 insertions(+), 3 deletions(-) create mode 100644 raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md create mode 100644 raw/other/2026-09-17_typesafe-workflow-evals.md create mode 100644 wiki/people/gabriel-anhaia.md diff --git a/raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md b/raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md new file mode 100644 index 0000000..f28bd5f --- /dev/null +++ b/raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md @@ -0,0 +1,45 @@ +--- +type: blog +source_url: https://dev.to/gabrielanhaia/jev-beat-gpt-luna-by-1-point-gpt-6-and-claude-wrote-the-answer-key-314k +retrieved: 2026-09-18 +title: "Jev Beat GPT Luna by 1 Point. GPT-6 and Claude Wrote the Answer Key." +author: "Gabriel Anhaia" +tags: [jev, typesafe-ai, vercel, fx, guardrail, benchmark, luna, label-kritik] +--- + +# Gabriel Anhaia: Vercel-`fx`-Benchmark und die Label-Kritik (17.09.2026) + +dev.to-Artikel, veröffentlicht **2026-09-17T08:46:14Z**, abgerufen 18.09.2026 (HTTP 200, Volltext lesbar). Autor ist Gabriel Anhaia (Entwickler/Buchautor, xgabriel.com; bewirbt im Artikel eigene Bücher und ein „Hermes IDE" genanntes Projekt — Eigeninteresse an Aufmerksamkeit vorhanden, aber die zitierten Quellen sind nachprüfbar). + +## Der neue Befund: Vercels `fx` wechselt den Guardrail-Prüfer + +- **Guillermo Rauch** (Vercel CEO, [@rauchg](https://x.com/rauchg), 871.158 Follower, verifiziert) laut Artikel: „Default mode in fx is auto, with a safety reviewer analyzing every command. That reviewer runs on GPT Luna today. Jev is up to 18x faster (p95) and more accurate. It's coming to @vercel AI Gateway and likely new default." +- **Pranit** ([@fazxes](https://x.com/fazxes), 1.755 Follower, verifiziert; Bio „Builder of http://fx.sh @Vercel"): „We benchmarked fx auto mode (safety) classifier with @typesafeai's Jev. tl;dr: ~5-18x faster and more accurate than gpt-5.6-luna, our current top choice." +- Verknüpfung: Am 16.09.2026 meldete der Vercel-Changelog Jev als verfügbar auf dem AI Gateway. + +**Anwendungsfall:** `fx` ist ein Coding-Agent-CLI; im Modus „auto" prüft ein Sicherheits-Reviewer jeden Befehl. Hier geht es also nicht um Klassifikation als Produkt, sondern um einen **Guardrail-Tausch** in einem Werkzeug mit großer Verbreitung. + +## Grenzen dieses Befunds (vom Autor selbst benannt) + +- „As of September 17, Vercel hasn't published the benchmark behind its claim." — kein Datensatz, keine Fallzahl, keine Methodik; nur Posts. +- Die Zahlen der beiden Posts (18× p95 / „~5-18×") sind Spannen ohne Rohdaten. +- TypeSafe-Zahlen bleiben die einzigen detaillierten; sie sind aber gegen Labels von GPT-6 Astra und Claude Fable 5.1 gemessen. + +## Die Label-Kritik des Artikels (Kernstück) + +- „TypeSafe's accuracy scores are graded against labels generated by GPT-6 Astra and Claude Fable 5.1." — also gegen **Antworten zweier Frontier-Modelle**, nicht gegen verifizierte Wahrheit. +- Wörtlich: „Where both frontier models get a case wrong, a model that gets it right is marked down." — wer gegen einen gemeinsamen Blindfleck richtig liegt, verliert Punkte. +- Der Autor zitiert die Selbstoffenlegung von TypeSafe (Launch-Artikel: Eval-Workflows könnten „some bias" tragen; die Demo-Query sei „highly simplified"; die Homepage-Zahl „193.6x / 444.6x" sei am „higher end of real world gains") und nennt das ausdrücklich lobenswert — es sei trotzdem die Leseanleitung für die Tabelle. +- Empfehlung des Autors vor einem Modelltausch im Guardrail: eigener Bake-off auf den **eigenen** Labels, Blick auf den Konfidenz-Band (nicht nur Brier-Score über alles), p95-Latenz aus der eigenen Betriebsumgebung inklusive Retries, und Kontrolle nach dem Wechsel (Distribution Shift). + +## Zahlen aus dem Artikel (TypeSafe-Aggregat, dort als Tabelle zitiert) + +Jev 67,8 % / $0,0004 / 0,4 s · GPT-5.6 Luna 66,8 % / $0,0033 / 12,9 s · GPT-5.6 Terra 67,9 % / $0,0304 / 10,1 s · Claude Sonnet 5 67,8 % / $0,1174 / 78,1 s · GPT-5.6 Sol 74,1 % / $0,0836 / 23,3 s · Claude Opus 5 73,1 % / $0,1761 / 37,8 s. Der Artikel fasst zusammen: Jev schlägt Luna „by a point", zu rund einem Achtel der Kosten und einem Dreißigstel der Latenz; Sol und Opus 5 liegen rund sechs bzw. fünf Punkte höher bei etwa 210× bzw. 440× der Kosten pro Fall. + +Eigene Gegenprüfung: Diese Werte stehen wörtlich auf https://evals.typesafe.ai/ (lokal gelesen 18.09.2026) — der Artikel gibt sie korrekt wieder. + +## Offene Punkte + +- Vercels Benchmark ist bis heute nicht veröffentlicht; die „18×"/„5-18×" sind unbelegte Hersteller-/Werkzeugangaben. +- Ob `fx` mittlerweile tatsächlich auf Jev als Default läuft, ist nicht belegt (Rauchg schreibt „likely new default"). +- Der Artikel enthält Eigenwerbung (Bücher, IDE); die zitierten Primärquellen sind davon unabhängig prüfbar. diff --git a/raw/other/2026-09-17_typesafe-workflow-evals.md b/raw/other/2026-09-17_typesafe-workflow-evals.md new file mode 100644 index 0000000..b922c38 --- /dev/null +++ b/raw/other/2026-09-17_typesafe-workflow-evals.md @@ -0,0 +1,61 @@ +--- +type: other +source_url: https://evals.typesafe.ai/ +retrieved: 2026-09-18 +title: "TypeSafe Workflow-Evals — Benchmarktabelle (Aggregat + vier Workflows)" +tags: [jev, typesafe-ai, benchmark, evals, kalibrierung, luna, terra, sol, opus, sonnet, haiku, deepseek] +--- + +# TypeSafe Workflow-Evals (Primärseite, lokal gelesen 18.09.2026) + +Anbietereigene Auswertungsseite unter https://evals.typesafe.ai/ — HTTP 200, 65.008 Byte, Text vollständig extrahierbar (9.077 Zeichen). Inhalt ist die Quelle aller Jev-Benchmarkzahlen, die seit dem 15.09.2026 zitiert werden. + +## Methodik (Wortlaut der Seite) + +- Vier Workflows: **Security Incidents**, **Agent Trace Observability**, **Invoice Processing**, **Customer Service** — „structured workflows for automation tasks". +- Zwei Ausführungsformen je Modell: **workflow** (Struktur/Harness) und **prompt** (alles in einem Prompt). +- Drei Fragetypen: **Noul** (ja/nein, mit Wahrscheinlichkeit), **Choice** (Option aus definierter Menge, mit Verteilung und Confidence), **Score** (Stufe auf Skala, mit Verteilung und Confidence). +- **Referenzlabels:** „generated via an average of the responses of GPT-6 Astra and Claude Fable 5.1, both at high thinking, answering every question in the harness." +- Alle anderen Modelle laufen „at the provider's default reasoning setting". +- Gleichgewichtung: „Each point averages one model configuration's accuracy, cost and time over the four workflows with equal weight, against the consensus labels." +- Selbstannahme der Seite: „Instead of debating the correctness of the harness and labels, we assume that the code is correct." +- Kein Hinweis auf menschliche Labelvergabe; kein Hinweis auf eine unabhängige Prüfung der Workflows. + +## Aggregat über die vier Workflows (Workflow-Modus) + +| Modell | Genauigkeit | Kosten/Fall | Latenz/Fall | +|--------|-------------|-------------|-------------| +| **Jev** | **67,8 %** | **$0,0004** | **0,4 s** | +| luna | 66,8 % | $0,0033 | 12,9 s | +| terra | 67,9 % | $0,0304 | 10,1 s | +| sonnet 5 | 67,8 % | $0,1174 | 78,1 s | +| sol | 74,1 % | $0,0836 | 23,3 s | +| opus 5 | 73,1 % | $0,1761 | 37,8 s | +| haiku 4.5 | 53,6 % | $0,0195 | 12,5 s | +| DS v4 flash | 64,4 % | $0,0059 | 51,9 s | +| DS v4 pro | 65,5 % | $0,0413 | 86,5 s | + +Prompt-Modus derselben Modelle (Auszug): luna 51,9 % / $0,0079 / 27,3 s; terra 61,6 % / $0,0750 / 25,1 s; opus 5 64,8 % / $0,3417 / 70,5 s; haiku 4.5 18,1 % / $0,0363 / 21,2 s. Durchgehender Befund der Seite: jede Modellkonfiguration ist im Workflow-Modus genauer, billiger und schneller als als reiner Prompt. + +## Jev je Workflow + +| Workflow | Genauigkeit | Kosten/Fall | Latenz/Fall | +|----------|-------------|-------------|-------------| +| Security Incidents | 61,7 % | $0,0001 | 0,3 s | +| Agent Trace Observability | 71,6 % | $0,0003 | 0,5 s | +| Invoice Processing | 61,8 % | $0,0011 | 0,5 s | +| Customer Service | 76,0 % | $0,0001 | 0,4 s | + +Beste Konkurrenten im selben Lauf (Workflow-Modus): Security Incidents — opus 5 66,2 %, sol 62,5 %, Jev 61,7 %; Agent Trace — luna 76,1 %, sol 76,6 %, Jev 71,6 %; Invoice — opus 5 78,4 %, sol 79,1 %, Jev 61,8 % (hier die größte Lücke); Customer Service — opus 5 72,4 %, sol 78,3 %, Jev 76,0 %. + +## Weitere Angaben der Seite + +- Achsen-Beschriftung: „frontier: nothing is both cheaper and more accurate" bzw. „nothing is both faster and more accurate". +- Die Startseite (https://typesafe.ai/) nennt „193.6x Faster, 444.6x Cheaper" mit Fußnote auf System-One-Workflows. + +## Eigene Prüfung / Grenzen + +- Die Seite liefert Zahlen, aber **keine Rohdaten** und keine Fallzahlen pro Workflow; Reproduktion durch Dritte ist nicht möglich. +- Referenz = Durchschnitt zweier Frontier-Modelle, nicht verifizierte Korrektheit: Ein Modell, das einen Fall richtig beantwortet, in dem Astra und Fable 5.1 übereinstimmend falsch liegen, wird **abgewertet**. +- Workflows wurden vom Anbieterteam entworfen (TypSafe räumt im Launch-Artikel „some bias" ein); die Genauigkeit ist damit an die Wahl der Fragen gebunden. +- Die Zahl „67,8 %" für Jev ist über die vier Workflows gemittelt und verbirgt Streuung von 61,7 % bis 76,0 %. diff --git a/wiki/concepts/llm/system-one-models-jev.md b/wiki/concepts/llm/system-one-models-jev.md index 22ea546..8979ce6 100644 --- a/wiki/concepts/llm/system-one-models-jev.md +++ b/wiki/concepts/llm/system-one-models-jev.md @@ -1,7 +1,7 @@ --- created: 2026-09-17 updated: 2026-09-18 -sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md, blog/2026-09-16_theregister-typesafe-jev-doom.md, blog/2026-09-16_vercel-jev-ai-gateway.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, xpost/2026-09-15_almeida-jev-launch-post.md, youtube/2026-09-18_berman-jev.md] +sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md, blog/2026-09-16_theregister-typesafe-jev-doom.md, blog/2026-09-16_vercel-jev-ai-gateway.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, xpost/2026-09-15_almeida-jev-launch-post.md, youtube/2026-09-18_berman-jev.md, other/2026-09-17_typesafe-workflow-evals.md, blog/2026-09-17_devto-jev-vs-luna-bake-off.md] tags: [concept, llm, typesafe, jev, system-one-models, rlcd, structured-outputs, calibrated-decisions, parallel-sampling, inference-cost, automation, harness] --- @@ -70,6 +70,43 @@ Jev verpasste in allen drei Runs dieselbe Passage („a shared appointment calen **Was der Test nicht zeigt:** Breite über Branchen und Aufgabentypen. Der Autor sagt es selbst; die Zahl der Grundfälle ist einstellig. +## Benchmark-Lage (Anbieter-Evals, lokal gelesen 18.09.2026) + +Die Genauigkeitszahlen, die seit dem Launch zitiert werden, stammen von **[evals.typesafe.ai](https://evals.typesafe.ai/)** (HTTP 200, Text extrahierbar; Raw: `raw/other/2026-09-17_typesafe-workflow-evals.md`). Vier Workflows (Security Incidents, Agent Trace Observability, Invoice Processing, Customer Service), je Modell zwei Ausführungen: **workflow** (strukturierter Harness) vs. **prompt** (alles in einem Prompt). + +**Aggregat im Workflow-Modus, gleichgewichtet über die vier Workflows:** + +| Modell | Genauigkeit | Kosten/Fall | Latenz/Fall | +|--------|-------------|-------------|-------------| +| **Jev** | **67,8 %** | **$0,0004** | **0,4 s** | +| luna | 66,8 % | $0,0033 | 12,9 s | +| terra | 67,9 % | $0,0304 | 10,1 s | +| sonnet 5 | 67,8 % | $0,1174 | 78,1 s | +| sol | **74,1 %** | $0,0836 | 23,3 s | +| opus 5 | **73,1 %** | $0,1761 | 37,8 s | +| haiku 4.5 | 53,6 % | $0,0195 | 12,5 s | +| DS v4 flash | 64,4 % | $0,0059 | 51,9 s | +| DS v4 pro | 65,5 % | $0,0413 | 86,5 s | + +**Häufigste Fehllektüre:** Jev liegt **auf Augenhöhe mit Terra (67,9 %) und Sonnet 5 (67,8 %)**, einen Punkt über Luna — und **unter Sol (74,1 %) und Opus 5 (73,1 %)**. Die Aussage „über Opus 5" ist invertiert. Der Vorsprung liegt bei Kosten und Latenz (rund 1/8 der Luna-Kosten, 1/30 deren Latenz), nicht in der Genauigkeitskrone. + +**Jev je Workflow — die Streuung hinter dem Mittel:** + +| Workflow | Jev | Bester Konkurrent | +|----------|-----|-------------------| +| Customer Service | **76,0 %** | sol 78,3 % · opus 5 72,4 % | +| Agent Trace Observability | 71,6 % | sol 76,6 % · opus 5 75,2 % | +| Security Incidents | 61,7 % | opus 5 66,2 % · sol 62,5 % | +| Invoice Processing | 61,8 % | sol 79,1 % · opus 5 78,4 % | + +Der Mittelwert verbirgt eine Spanne von 61,7 % bis 76,0 %; bei Rechnungsverarbeitung liegt Jev fast 18 Punkte hinter Sol. + +**Wogegen gemessen wird:** Referenz sind laut Seite „labels generated via an average of the responses of GPT-6 Astra and Claude Fable 5.1, both at high thinking" — kein Mensch labelt, keine unabhängige Ground Truth. Wo beide Frontier-Modelle falsch liegen, wird ein abweichend richtiges Modell **abgewertet** ([[../../people/gabriel-anhaia.md|Gabriel Anhaia]], [Dev.to 17.09.2026](https://dev.to/gabrielanhaia/jev-beat-gpt-luna-by-1-point-gpt-6-and-claude-wrote-the-answer-key-314k)). Die Seite legt ihre Harness-Annahme selbst offen: „we assume that the code is correct". + +## Guardrail-Tausch bei Vercel `fx` + +Der bislang gewichtigste **Fremdnutzen** liegt nicht in den Evals, sondern in einem Werkzeugwechsel: Vercel-CEO **Guillermo Rauch** ([@rauchg](https://x.com/rauchg), 871.158 Follower) schreibt laut Dev.to-Bericht, der Sicherheits-Reviewer in `fx` (Vercel-Labs-CLI, Modus „auto", prüft jeden Befehl) laufe heute auf **GPT-5.6 Luna** und **Jev sei „up to 18x faster (p95) and more accurate"** — „likely new default". Vercel-Bauer **Pranit** ([@fazxes](https://x.com/fazxes)) berichtet „~5-18x faster and more accurate than gpt-5.6-luna, our current top choice". ⚠️ **Vercel hat den Benchmark nicht veröffentlicht** (Stand 17.09.): keine Fallzahlen, kein Datensatz. Die Zahlen sind als Werkzeugangabe zu lesen, nicht als Messung. + ## Quellenkritik der Benchmarks Die eigenen Workflow-Evals messen **Übereinstimmung mit Referenzantworten** (Durchschnitt aus GPT-6 Astra und Fable 5.1), nicht unabhängig verifizierte Korrektheit. TypeSafe legt die Bias-Richtungen selbst offen: @@ -110,7 +147,7 @@ Neben Benchmarks und Verteilung entstand eine Welle öffentlicher Bauprojekte ## Offene Punkte - ⚠️ **Alle Leistungszahlen sind Anbieterangaben** außer dem einen Every-Einzeltest (37 Dokumente, 12 Passagen, 1.709 Judgments). Keine peer-reviewte Evaluation, keine breite Fremdprüfung. -- ⚠️ Kein unabhängiger Nachbau der vier Workflows; die Evals-Seite (https://evals.typesafe.ai/) wurde nicht ausgewertet. +- ⚠️ Die Evals-Seite (https://evals.typesafe.ai/, jetzt lokal ausgewertet) nennt **keine Fallzahlen und keine Rohdaten**; ein Nachbau der vier Workflows ist Dritten nicht möglich. - ⚠️ Architektur, Trainingsverfahren und Datenherkunft von Jev sind nicht veröffentlicht — ob paralleles Sampling die genannten Latenzen erklärt, ist nicht überprüfbar. - Offen: ob der Preis ($42/Mrd. Input, $0 Output) nachhaltig ist — der Anbieter räumt Subvention nicht ausgeschlossen aus. - Offen: ob der Gateway-Preis dem Direkt-API-Preis entspricht und ob Rate Limits/SLA existieren — auf den Gateway-Seiten nicht ausgewiesen ([[jev-vercel-ai-gateway.md]]). diff --git a/wiki/index.md b/wiki/index.md index dfb01d5..5e7bddf 100644 --- a/wiki/index.md +++ b/wiki/index.md @@ -2,7 +2,8 @@ *Auto-generated: 2026-07-07* -*Letzte Aktualisierung: 2026-09-18 (221. Update — Jev praktisch: Berman-Video + Demo-Welle + Ankündigungspost. Anlass: YouTube-Link „We need to talk about Jev..." (Matthew Berman, 18.09.2026, 12:30, 82.291 Views, **mit Werbekennzeichnung**/Sponsor Zapier) von Pit Weber in OME Topic „JEV". ⚠️ **Kein Transcript** — yt-dlp „Sign in to confirm you're not a bot" (auch mit `--js-runtimes node`), kein `captionTracks`, Firecrawl lieferte nur Consent-/401-Seite, Crawl4AI startet nicht (Playwright-Binary fehlt), Transkriptdienste 403/522; auswertbar waren Beschreibung, Quellenliste und Aufrufzahl. **Aufgelöste Quellenliste des Videos** (fxtwitter): Diogo Almeida Launch-Post (15.09.2026, **34,9 Mio. Views/69.647 Likes** — nennt **Spannen** „20-200x faster"/„40-400x cheaper", nicht 200×/400× als Erwartungswert), AI/ML API Schach-Test (Jev vs. Fable 5.1: materiell unterlegen, **Sieg auf Zeit**, ~2,6 s/Zug vs. 6–15 s; vs. GPT-6 Astra: **Matt in 18 Zügen**), kitze „Unclutter" (Ad-/Slop-Blocker, BYOK/Open Source), Riley Brown („agent with model router powered by Jev"), Justin Schroeder („rebuilt Tesla FSD in <1 h" — viralster und inhaltsleerster Post der Reihe), @The_Alex (Melee). Wiki: `concepts/llm/jev-praxis-demos.md` (neu — Demos als Tabelle mit Belastbarkeits-Abstufung, Zeitökonomie als Kernbefund), `people/matthew-berman.md`, `people/kitze.md`, `people/riley-brown.md`, `people/justin-schroeder.md`, `people/alex-the-alex.md` (alle neu), `institutions/ai-ml-api.md` (neu); Updates `concepts/llm/system-one-models-jev.md` (Ankündigungspost + Demo-Welle), `people/diogo-almeida.md` (Launch-Post + Views). Raw: `raw/youtube/2026-09-18_berman-jev.md` (neu), `raw/xpost/2026-09-15_almeida-jev-launch-post.md` (neu).)* +*Letzte Aktualisierung: 2026-09-18 (222. Update — Jev-Benchmarklage: Evals-Seite lokal ausgewertet + Vercel-`fx`-Guardrail-Tausch + Label-Kritik. Anlass: Zusammenfassung von DeltaKralle (@DeltaKrallenbot) in OME Topic „JEV", die Jev als „auf Augenhöhe mit Luna/Terra/Sonnet 5, **über Opus 5**" beschreibt — **invertiert**. **Lokal verifiziert:** [evals.typesafe.ai](https://evals.typesafe.ai/) HTTP 200/65.008 Byte, Text vollständig extrahierbar. Aggregat (Workflow-Modus, vier Workflows gleichgewichtet): **Jev 67,8 % · $0,0004 · 0,4 s** · luna 66,8 %/$0,0033/12,9 s · terra **67,9 %**/$0,0304/10,1 s · sonnet 5 **67,8 %**/$0,1174/78,1 s · **sol 74,1 %**/$0,0836/23,3 s · **opus 5 73,1 %**/$0,1761/37,8 s · haiku 4.5 53,6 % · DS v4 flash 64,4 % · DS v4 pro 65,5 %. Jev liegt also **auf Augenhöhe mit Terra/Sonnet 5, einen Punkt über Luna — und ~5 Punkte UNTER Opus 5 sowie ~6 unter Sol.** Je Workflow streut das Mittel stark: Customer Service 76,0 % (sol 78,3), Agent Trace 71,6 % (sol 76,6), Security Incidents 61,7 % (opus 5 66,2), **Invoice Processing 61,8 % (sol 79,1 — fast 18 Punkte zurück)**. Referenzlabels = Durchschnitt aus GPT-6 Astra + Fable 5.1 (kein Mensch, keine Ground Truth; wer gegen einen gemeinsamen Blindfleck richtig liegt, wird abgewertet); Seite legt Harness-Annahme offen („we assume that the code is correct"). **Zweiter Neubefund:** Vercel-CEO Guillermo Rauch ([@rauchg](https://x.com/rauchg), 871.158 Follower) tauscht den Sicherheits-Reviewer in `fx` (Modus „auto", prüft jeden Befehl) von GPT-5.6 Luna auf Jev — „up to 18x faster (p95) and more accurate", „likely new default"; Vercel-Bauer Pranit (@fazxes): „~5-18x faster and more accurate". ⚠️ **Benchmark nicht veröffentlicht.** Wiki: `people/gabriel-anhaia.md` (neu — Autor der Label-Kritik + Prüf-Maßstab für Guardrail-Tausche); Update `concepts/llm/system-one-models-jev.md` (neue Abschnitte „Benchmark-Lage" und „Guardrail-Tausch bei Vercel fx", Genauigkeits-Fehllektüre markiert, offene Punkte korrigiert). Raw: `raw/other/2026-09-17_typesafe-workflow-evals.md` (neu), `raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md` (neu).)* +*Vorherige Aktualisierung: 2026-09-18 (221. Update — Jev praktisch: Berman-Video + Demo-Welle + Ankündigungspost. Anlass: YouTube-Link „We need to talk about Jev..." (Matthew Berman, 18.09.2026, 12:30, 82.291 Views, **mit Werbekennzeichnung**/Sponsor Zapier) von Pit Weber in OME Topic „JEV". ⚠️ **Kein Transcript** — yt-dlp „Sign in to confirm you're not a bot" (auch mit `--js-runtimes node`), kein `captionTracks`, Firecrawl lieferte nur Consent-/401-Seite, Crawl4AI startet nicht (Playwright-Binary fehlt), Transkriptdienste 403/522; auswertbar waren Beschreibung, Quellenliste und Aufrufzahl. **Aufgelöste Quellenliste des Videos** (fxtwitter): Diogo Almeida Launch-Post (15.09.2026, **34,9 Mio. Views/69.647 Likes** — nennt **Spannen** „20-200x faster"/„40-400x cheaper", nicht 200×/400× als Erwartungswert), AI/ML API Schach-Test (Jev vs. Fable 5.1: materiell unterlegen, **Sieg auf Zeit**, ~2,6 s/Zug vs. 6–15 s; vs. GPT-6 Astra: **Matt in 18 Zügen**), kitze „Unclutter" (Ad-/Slop-Blocker, BYOK/Open Source), Riley Brown („agent with model router powered by Jev"), Justin Schroeder („rebuilt Tesla FSD in <1 h" — viralster und inhaltsleerster Post der Reihe), @The_Alex (Melee). Wiki: `concepts/llm/jev-praxis-demos.md` (neu — Demos als Tabelle mit Belastbarkeits-Abstufung, Zeitökonomie als Kernbefund), `people/matthew-berman.md`, `people/kitze.md`, `people/riley-brown.md`, `people/justin-schroeder.md`, `people/alex-the-alex.md` (alle neu), `institutions/ai-ml-api.md` (neu); Updates `concepts/llm/system-one-models-jev.md` (Ankündigungspost + Demo-Welle), `people/diogo-almeida.md` (Launch-Post + Views). Raw: `raw/youtube/2026-09-18_berman-jev.md` (neu), `raw/xpost/2026-09-15_almeida-jev-launch-post.md` (neu).)* *Vorherige Aktualisierung: 2026-09-18 (220. Update — Jev-Verteilung: Greg Isenbergs „Jev is HERE"-Post (18.09.2026, 18:41 UTC; 29.661 Views / 415 Likes bei Abruf) und die Gateway-Listung. Anlass: X-Link von Pit Weber in OME Topic „JEV". **Lokal verifiziert (18.09.2026, HTTP 200 mit auswertbarem Text):** Der Vercel AI Gateway führt `typesafe-ai/jev` seit 16.09.2026 — AI SDK 7.0.105+ mit `experimental evaluate`, Frage-Typen Choice/Score/Boolean, ein gemeinsames `state` + Map benannter `questions`, Choice-/Score-Confidence unter `result.providerMetadata.typesafe.confidence`, Zero Data Retention und No Training per Request, Abrechnung gegen Gateway-Budgets; Gateway-Preis **$0.04/1M Input** (gerundet) gegen $0,042 in der TypeSafe-Primärquelle; Leistungszahlen 193,6×/444,6× von Vercel ausdrücklich als TypeSafe-Angabe weitergegeben („TypeSafe reports"). **Post-Inhalt:** sieben Geschäftsideen (Instant Quotes, Lead Scoring, Support-Triage, Clipping, Antragsstapel, Marketplace-Matching, Browser-Agenten), Formel „find an expensive queue and put Jev at the front of it", Zugang über den Gateway statt Waitlist; ⚠️ „1.700 E-Mails für 18 Cent" ohne Token-Aufschlüsselung, Datensatz oder Messung, „94 %" als Illustrationswert, Episode-Gast [@ryanvogel](https://x.com/ryanvogel) („ceo of @rebasetv / founding developer @opencode") nur aus dem Post zugeordnet. Wiki: `concepts/llm/jev-vercel-ai-gateway.md` (neu), `institutions/vercel.md` (neu), `people/greg-isenberg.md` (neu), `people/ryan-vogel.md` (neu); Updates `concepts/llm/system-one-models-jev.md` (Verteilungs-Abschnitt + offene Gateway-Punkte), `institutions/typesafe-ai.md` (Distribution), `concepts/llm/llm-model-catalog.md`. Raw: `raw/xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md` (neu), `raw/blog/2026-09-16_vercel-jev-ai-gateway.md` (neu).)* *Vorherige Aktualisierung: 2026-09-18 (219. Update — PLUR1BUS Memory 7.12.61 (Mr. Cy / @Cyb3rblade, Ankündigung via Yvonne, 18.09.2026). Raw: `raw/other/2026-09-18_plur1bus-memory-release-71261.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Release 7.12.61 OpenClaw + Hermes 7.12.61-hermes.0-Prerelease: Skill begleitet Installation, ersetzt natives Paket nicht; Hermans Analyse — Afterthought-Auswahl, Fallback respektiert Hermes-Modell, Compaction koordiniert sofort, Journal-Tail-Integrität). Deployment: Bernhardine/Bernd live, Hector auf 7.12.56, Herman auf 7.12.7.post3 (keine Installation ohne Freigabe).)* *Vorherige Aktualisierung: 2026-09-18 (218. Update — „Grok Bot Galaxy" Nachlauf: (a) Elon Musks Quote-Post des Day-2-Broadcasts (16.09.2026, 18:52 UTC, https://x.com/elonmusk/status/2100296847344783441 — „Watch a company being built live with @Grok @Bot!", 6,23 Mio. Views / 15,8K Likes; geteilt von Rüdiger @Stelariz_75 in OME „GrokBot", 18.09. 15:12 UTC; Begleit-Briefing Herman) — kein eigener Inhalt, reine Verteilung; (b) Ergebnis des 72-h-Builds laut Sekundärbericht (techiexpert.com): Firma „Ship by Thursday" (shipbythurs.day, Food-Pop-up-Plattform, Stack Notion/Slack/Cursor/Vercel, Meta-Agent „Dr. Eggbot"), Lieferstand Landing Page + Waitlist, kein Umsatznachweis; ⚠️ widersprüchliche Dritt-Aufzeichnung nennt Spielestudio „Thursday Arena"; (c) VentureBeat-Launch-Bericht (11.08.2026): Preisstaffel Cursor Premium Teams $120/Seat · Cursor Ultra $200 · SuperGrok Heavy $300, **keine Benchmarks veröffentlicht**. Raw: `raw/xpost/2026-09-16_elonmusk-grok-bot-galaxy-day2.md` (neu), `raw/blog/2026-08-11_venturebeat-grok-bot-launch-pricing.md` (neu), `raw/blog/2026-09-18_techiexpert-grok-bot-galaxy-ship-by-thursday.md` (neu). Wiki: `tools/grok-bot-spacexai.md` (Galaxy-Abschnitt: Ergebnis + Musk-Verstärkung + Ehrliche Kante; Quellen, Raw-Liste, Stand).)* @@ -429,6 +430,7 @@ | [AI Copium](people/ai-copium.md) | YouTube-Kanal **@AICopium** mit KI-Nachrichten-/Erklärformat. Video „A ChatGPT Researcher Just Dropped a MASSIVE AI Breakthrough…" (17.09.2026, 14:25; vollständiges Transcript) zum TypeSafe-Launch — zitiert die Fremdzahlen korrekt und entlarvt „Zero Hallucinations" als irreführend, verdichtet aber im Titel auf „400x" (Primärquelle: 193,6×/444,6×) | youtube/2026-09-17_aicopium-typesafe-jev.md | | [Greg Isenberg](people/greg-isenberg.md) | Gründer/Investor und Content-Unternehmer (@gregisenberg, 712.496 Follower), Host von **The Startup Ideas Podcast**, CEO von **Late Checkout** (Produkte: ideabrowser, meetLCA, boringmarketer). **Verteilkanal** zweier Wiki-Ingests: GPT-6-Astra-Praxis-Prompts (05.09.2026) und Jev auf dem Vercel AI Gateway (18.09.2026). Muster: Infrastrukturthema als Geschäftsideen-Liste; Funnel-Struktur („at the end I'll tell you how"). ⚠️ Interessenlage: verdient an Gründungen und Aufmerksamkeit — Post verteilt, prüft nicht | xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md + xpost/2026-09-05_greg-isenberg-gpt6-astra-prompts.md | | [Matthew Berman](people/matthew-berman.md) | YouTube-Kanal/Newsletter **Forward Future** (@matthew_berman, forwardfuture.com): Erklärvideos mit eigenen Demos, regelmäßig mit ausgewiesener Werbekennzeichnung. **Bündelungsstelle** der Jev-Demo-Welle („We need to talk about Jev...", 18.09.2026, 12:30, Sponsor Zapier, 82.291 Views) und früher schon Quelle der Model-Routing-Patterns (07.07.2026, Planung vs. Ausführung). ⚠️ Kein Transcript des Jev-Videos abrufbar; Inhalt nur über Beschreibung/Quellenliste belegt | youtube/2026-09-18_berman-jev.md + youtube/2026-07-07_berman-model-routing.md | +| [Gabriel Anhaia](people/gabriel-anhaia.md) | Entwickler/Buchautor (dev.to/gabrielanhaia, xgabriel.com, **Hermes IDE**). Autor des scharfsinnigsten Fremdbeitrags zu Jev (17.09.2026): verbindet den **Vercel-`fx`-Guardrail-Tausch** (Rauchg: Jev „up to 18x faster (p95) and more accurate" als GPT-5.6 Luna, „likely new default") mit der **Label-Kritik** an den TypeSafe-Evals (Referenz = Durchschnitt aus Astra + Fable 5.1 — wer gegen einen gemeinsamen Blindfleck richtig liegt, wird abgewertet) und empfiehlt fünf Prüfschritte vor einem Guardrail-Tausch. ⚠️ Artikel enthält Eigenwerbung; zitierte Zahlen beim Ingest gegen `evals.typesafe.ai` gegengeprüft und korrekt | blog/2026-09-17_devto-jev-vs-luna-bake-off.md | | [kitze](people/kitze.md) | Entwickler (@thekitze). **„Unclutter"** — Ad-/Slop-Blocker mit Jev gegen Ads, Cookie-Banner, Upsells, Dialoge; BYOK, Open Source (17.09.2026, 33.951 Views). Beispiel für Klassifikation pro Seitenelement statt Textgenerierung. ⚠️ Ankündigung, Wirksamkeit/Repo nicht geprüft | youtube/2026-09-18_berman-jev.md | | [Riley Brown](people/riley-brown.md) | Builder/Creator (@rileybrown): „Building an agent with model router powered by Jev" (17.09.2026, 46.436 Views). Deckt TypeSafes dokumentiertes Muster „nächsten Tool/Subagent wählen". ⚠️ Ein Satz, kein Artefakt | youtube/2026-09-18_berman-jev.md | | [Justin Schroeder](people/justin-schroeder.md) | Entwickler (@jpschroeder): „I rebuilt Tesla Full Self Driving with Jev in less than an hour" (16.09.2026, **568.108 Views / 4.580 Likes** — viralster Post der Welle). **Lehrstück über Viralität:** stärkstes Engagement auf schwächster Evidenz, kein Repo/keine Metrik/kein Aufbau | youtube/2026-09-18_berman-jev.md | @@ -714,4 +716,6 @@ | `raw/xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md` | xpost | Greg Isenberg (@gregisenberg, 712.496 Follower): „Jev is HERE" (https://x.com/gregisenberg/status/2101018750916948237, 18.09.2026 18:41 UTC; 29.661 Views / 415 Likes bei Abruf 21:31 UTC; geteilt von Pit Weber in OME Topic „JEV"). Vollständiger Wortlaut (2.430 Zeichen): Was Jev ist („it sorts, it doesn't write back"), sieben Geschäftsideen, TLDR „find an expensive queue and put Jev at the front of it", Zugang über den Vercel AI Gateway statt Waitlist, Episode mit @ryanvogel. ⚠️ „1.700 E-Mails für 18 Cent" ohne Token-Aufschlüsselung; „94 %" Illustration; Video-Transkript nicht ausgewertet. Wiki: `concepts/llm/jev-vercel-ai-gateway.md` (neu), `people/greg-isenberg.md` (neu), `people/ryan-vogel.md` (neu) | | `raw/blog/2026-09-16_vercel-jev-ai-gateway.md` | blog | Vercel: „TypeSafe AI's Jev now available on AI Gateway" (Changelog 16.09.2026, Taneja/Chen/Zheng) + Modellseite https://vercel.com/ai-gateway/models/jev — **lokal gelesen, HTTP 200**. Modell-ID `typesafe-ai/jev`, Preis `$0.04/1M` Input, AI SDK 7.0.105+, `experimental evaluate`, **Choice/Score/Boolean**, parallele Auswertung, Confidence in `providerMetadata.typesafe.confidence`, ZDR/No-Training per Request, Budgets/Logs. Leistungszahlen (193,6×/444,6×) ausdrücklich als TypeSafe-Angabe. Wiki: `concepts/llm/jev-vercel-ai-gateway.md` (neu), `institutions/vercel.md` (neu) | | `raw/youtube/2026-09-18_berman-jev.md` | youtube | Matthew Berman: „We need to talk about Jev..." (https://www.youtube.com/watch?v=2z-7pIj57f8, 18.09.2026, 12:30, 82.291 Views bei Abruf, **„Includes paid promotion"/Sponsor Zapier**; geteilt von Pit in OME Topic „JEV"). **Kein Transcript abrufbar** (yt-dlp Bot-Check, kein `captionTracks`, Firecrawl nur Consent-Seite, Crawl4AI ohne Playwright-Binary, Transkriptdienste 403/522) — auswertbar: Beschreibung, Quellenliste (6 X-Posts, aufgelöst), Titel/Kanal/Aufrufe. Kapitelmarken fehlen. ⚠️ Videoinhalt nur über Sekundärzusammenfassung, nicht verifiziert. Wiki: `concepts/llm/jev-praxis-demos.md` (neu), `people/matthew-berman.md` (neu) | +| `raw/other/2026-09-17_typesafe-workflow-evals.md` | other | TypeSafe **Workflow-Evals** (https://evals.typesafe.ai/, lokal gelesen: 65.008 Byte, Text extrahierbar). Vier Workflows (Security Incidents, Agent Trace, Invoice Processing, Customer Service) × zwei Modi (workflow/prompt), Fragetypen Noul/Choice/Score. Aggregat Jev 67,8 %/$0,0004/0,4 s vs. luna 66,8/terra 67,9/sonnet 5 67,8/**sol 74,1/opus 5 73,1**. Je Workflow 61,7–76,0 %. Referenzlabels = Mittel aus GPT-6 Astra + Fable 5.1; keine Fallzahlen/Rohdaten. Wiki: `concepts/llm/system-one-models-jev.md` | +| `raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md` | blog | Gabriel Anhaia (17.09.2026): „Jev Beat GPT Luna by 1 Point. GPT-6 and Claude Wrote the Answer Key." — Vercel-`fx`-Reviewer-Wechsel (Rauchg/@fazxes, „~5-18x faster and more accurate", **Benchmark unveröffentlicht**), TypeSafe-Aggregat-Tabelle (gegengeprüft, korrekt), **Label-Kritik** (Reference-Labels aus zwei Frontier-Modellen → gemeinsame Blindflecken werten richtige Abweichler ab; TypeSafe legt Bias selbst offen und nennt die Homepage-Zahl „higher end of real world gains"). Fünf Prüfschritte vor dem Tausch. Wiki: `people/gabriel-anhaia.md` (neu) | | `raw/xpost/2026-09-15_almeida-jev-launch-post.md` | xpost | Diogo Almeida ([@CompleteSkeptic](https://x.com/CompleteSkeptic), 113.333 Follower; Bio „co-created RLHF/ChatGPT @ @openai … (ceo @typesafeai)"): **Jev-Launch-Post** (15.09.2026 18:17 UTC, 34.903.594 Views / 69.647 Likes bei Abruf). Wortlaut: „After co-inventing ChatGPT…"; Zahlen als **Spannen** „20-200x faster / 40-400x cheaper (w/ output tokens free)" — die kursierenden 200×/400× sind die Obergrenzen. Wiki: `people/diogo-almeida.md` (Launch-Post-Abschnitt), `concepts/llm/system-one-models-jev.md` | diff --git a/wiki/people/gabriel-anhaia.md b/wiki/people/gabriel-anhaia.md new file mode 100644 index 0000000..faf8e30 --- /dev/null +++ b/wiki/people/gabriel-anhaia.md @@ -0,0 +1,23 @@ +--- +created: 2026-09-18 +updated: 2026-09-18 +sources: [blog/2026-09-17_devto-jev-vs-luna-bake-off.md] +tags: [person, gabriel-anhaia, devto, evals, guardrails, label-kritik] +--- + +# Gabriel Anhaia + +Entwickler, Autor und Buchverleger ([dev.to/gabrielanhaia](https://dev.to/gabrielanhaia), Website https://xgabriel.com/, GitHub https://github.com/gabrielanhaia; Projekt **Hermes IDE** auf https://hermes-ide.com/). Schreibt über TypeScript-Stack für KI-Anwendungen. + +## Rolle im Wiki + +Autor des bislang **scharfsinnigsten Fremdbeitrags zu Jev** ([Dev.to, 17.09.2026](https://dev.to/gabrielanhaia/jev-beat-gpt-luna-by-1-point-gpt-6-and-claude-wrote-the-answer-key-314k)): Er verbindet zwei Dinge, die in der Diskussion getrennt bleiben — den **Vercel-`fx`-Guardrail-Tausch** (Rauchg: „up to 18x faster (p95) and more accurate" als GPT-5.6 Luna, „likely new default") und die **Label-Kritik** an den TypeSafe-Evals (Referenzlabels = Durchschnitt von GPT-6 Astra + Fable 5.1; wer gegen einen gemeinsamen Blindfleck richtig liegt, wird abgewertet). + +Bemerkenswert: Sein Fazit ist Pro-Jev-nüchtern statt ablehnend — er nennt Vercels Ergebnis „a good early signal" und empfiehlt fünf Prüfschritte (eigene Labels, Konfidenzband, p95 aus eigener Umgebung inkl. Retries, Kontrolle nach dem Wechsel, Kosten zuletzt). Das Wiki nutzt den Beitrag als **Prüfmaßstab** für Guardrail-Tausche. → [[../concepts/llm/system-one-models-jev.md]] + +⚠️ Der Artikel enthält Eigenwerbung (fünf Bücher, Pocket Guides, Hermes IDE). Die zitierten Primärquellen sind davon unabhängig nachprüfbar; die TypeSafe-Zahlen wurden beim Ingest gegen `evals.typesafe.ai` gegengeprüft und stimmen. + +## Verwandte Wiki-Seiten + +- [[../concepts/llm/system-one-models-jev.md]] — Benchmark-Lage und Label-Kritik +- [[../concepts/agents/agent-budget-breaker.md]] — Kostendeckel und Guardrails