258 lines
25 KiB
Markdown
258 lines
25 KiB
Markdown
---
|
||
created: 2026-09-17
|
||
updated: 2026-09-22
|
||
sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md, blog/2026-09-16_theregister-typesafe-jev-doom.md, blog/2026-09-16_vercel-jev-ai-gateway.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, xpost/2026-09-15_almeida-jev-launch-post.md, youtube/2026-09-18_berman-jev.md, youtube/2026-09-19_nate-herk-jev-12-use-cases.md, other/2026-09-17_typesafe-workflow-evals.md, other/2026-09-17_reddit-n8-jev-terra-benchmark.md, blog/2026-09-17_devto-jev-vs-luna-bake-off.md, other/2026-09-18_typesafe-docs-jev-spezifikation.md, xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md, youtube/2026-09-18_gary-explains-jev-caveat.md]
|
||
tags: [concept, llm, typesafe, jev, system-one-models, rlcd, structured-outputs, calibrated-decisions, parallel-sampling, inference-cost, automation, harness]
|
||
---
|
||
|
||
# System One Models & Jev (TypeSafe AI)
|
||
|
||
> **Quellenbasis:** TypeSafe-Ankündigungsartikel von Diogo Almeida (15.09.2026, https://typesafe.ai/blog/introducing-system-one-models-and-jev), Anbieter-Workflow-Evals, Every-Einzeltest von Mike Taylor sowie der unabhängige System-1-Benchmark von [[../../people/n8-programs.md|N8 Programs]] gegen GPT-5.6 Terra. Anbieterangaben und Fremdmessungen bleiben getrennt; keine der Fremdmessungen ist vollständig reproduzierbar veröffentlicht.
|
||
|
||
## Kernidee
|
||
|
||
**Jev** ist das erste Modell einer neuen Klasse, die TypeSafe **[[../../institutions/typesafe-ai.md|System One Models]]** nennt: keine Textgenerierung, sondern **typisierte probabilistische Entscheidungen** für Software. Anbieterselbstbeschreibung: „unstructured state in, typed probabilistic decisions out" — und „a frontier-intelligence function call".
|
||
|
||
Der Ansatz setzt auf **strukturierte Ausgaben mit vorab definierten Optionen** statt Strings, auf **paralleles Sampling** statt autoregressiver Token-Generierung und auf **kalibrierte Wahrscheinlichkeiten** statt überkonfidenter Fließtexte.
|
||
|
||
## Drei Konstruktions-Entscheidungen
|
||
|
||
| Achse | Bestehende LLMs | Jev |
|
||
|-------|-----------------|-----|
|
||
| Optimierung | RLHF / RLVR — menschliche Präferenz bzw. verifizierbare Rewards | **RLCD** (Reinforcement Learning for Calibrated Decisions) |
|
||
| Ausgabe | Strings — müssen geparst und validiert werden | **Type-safe structured values**; Ausgabeoptionen und Struktur vorab definiert |
|
||
| Sampling | sequenziell, ein Token nach dem anderen | **parallel**, alle Urteile in einer Query |
|
||
|
||
Zielgröße laut Anbieter: Werte nahe 1 sollen häufiger zutreffen; „If it flags 100 customer messages as having a 90 percent chance of expressing anger, about 90 should express anger" ([[../../people/mike-taylor.md|Mike Taylor]]).
|
||
|
||
## Anbieterangaben zu Kosten und Geschwindigkeit
|
||
|
||
| Kennzahl | TypeSafe-Angabe |
|
||
|----------|-----------------|
|
||
| End-to-end-Latenz | **70–500 ms** (LLMs laut Artikel 3–329 s) |
|
||
| Speedup | 40×–200× „for System One shaped queries"; Homepage-Claim **193,6× schneller** |
|
||
| Kosten-Input | **$0,042 / MTok** = $42 pro Milliarde Tokens |
|
||
| Kosten-Output | **$0** („too cheap to meter", da keine Token generiert werden) |
|
||
| Kosten-CLAIM Homepage | **444,6× günstiger** |
|
||
| Genauigkeit | „near state-of-the-art" auf den eigenen vier Workflows |
|
||
|
||
⚠️ Die im Videotitel/-beschreibung und im Kapitelmarken-Layout kursierende **„400x"**-Zahl findet sich in der Primärquelle nicht; dort stehen **193,6× / 444,6×**, und der Artikel ordnet selbst ein: „we expect that these are on the higher end of real world gains".
|
||
|
||
## Was „keine Halluzination" heißt — und was nicht
|
||
|
||
TypeSafe schreibt, Jev könne nicht halluzinieren; gemeint ist **Type-Safety**: Das Modell kann kein Feld mit falschem Typ füllen und keine Option erfinden, die nicht im Schema steht. Das ist laut Anbieter mathematisch garantiert („Schema matching is guaranteed").
|
||
|
||
Nicht gemeint ist semantische Korrektheit:
|
||
- Jev kann die **falsche Option wählen** — ein Rückerstattungsantrag kann „approve" erhalten, obwohl „reject" richtig wäre ([[../../people/mike-taylor.md|Taylor]] / AI Copium).
|
||
- Das ist keine neue Eigenschaft von Jev: LLMs lassen sich ebenfalls auf Formate zwingen (z. B. OpenAI Structured Outputs, DSPy).
|
||
|
||
**Merksatz fürs Wiki:** Type-Safety ist eine Formatgarantie, keine Wahrheitsgarantie. Der verwandte Mechanismus — Gate vs. probabilistische Generierung — steht in [[harness-vs-standalone-chat-llm.md]].
|
||
|
||
## Unabhängiger Test (Every, 15.09.2026)
|
||
|
||
Zwei Messungen, beide von **[[../../people/mike-taylor.md|Mike Taylor]]** (Head of Evals, [[../../institutions/every.md|Every]]):
|
||
|
||
**Test 1 — 37 Dokumente × 21 Fragen:**
|
||
- 27 eigene Every-Artikel + 10 bewusst KI-stilisierte Gegenstücke
|
||
- **777 Judgments in unter 0,7 Sekunden**, geschätzt **ein Viertel Cent**
|
||
- Eigenbewertung des Testerstellers: markierte KI-lastige Passagen korrekt, aber „I'd want a more thorough accuracy check before putting it into production"
|
||
|
||
**Test 2 — 12 synthetische Passagen, 4 Schreib-Checks ([[../../people/dan-shipper.md|Dan Shipper]]):**
|
||
|
||
| | Jev | Claude Fable 5.1 (high effort) |
|
||
|---|---|---|
|
||
| Median pro Passage | **0,35 s** | **8,83 s** |
|
||
| Geschwindigkeit | ~25× schneller | — |
|
||
| Kosten | ~580× niedriger | — |
|
||
| Defekte gefunden | **6 von 7** | **7 von 7** |
|
||
|
||
Jev verpasste in allen drei Runs dieselbe Passage („a shared appointment calendar that parents and staff teach together"). Über 11 Experimente: 1.709 Judgments für unter einem Cent.
|
||
|
||
**Was der Test nicht zeigt:** Breite über Branchen und Aufgabentypen. Der Autor sagt es selbst; die Zahl der Grundfälle ist einstellig.
|
||
|
||
## Unabhängiger Benchmark gegen GPT-5.6 Terra (N8 Programs, 16.09.2026)
|
||
|
||
**[[../../people/n8-programs.md|N8 Programs]]** prüfte TypeSafes Behauptung „vergleichbare Intelligenz“ auf neun Multiple-Choice-Bedingungen. Terra lief mit `reasoning=none` und Letter-only-Ausgabe; damit isoliert der Vergleich bewusst einen einzelnen Forward Pass statt Terras Reasoning-Modus. Quelle: [X-Thread](https://x.com/N8Programs/status/2100088523403432357), geteilt als [r/ProAI-Repost](https://www.reddit.com/r/ProAI/comments/1wik66s/tested_typesafeai_s_claim_that_their_new_model/); Raw: `raw/other/2026-09-17_reddit-n8-jev-terra-benchmark.md`.
|
||
|
||
| Benchmark | Jev | Terra | Differenz Jev−Terra |
|
||
|---|---:|---:|---:|
|
||
| MMLU | **90,91 %** | 87,89 % | +3,02 Pp |
|
||
| GPQA Diamond | **68,18 %** | 56,06 % | +12,12 Pp |
|
||
| ARC-Easy | **99,33 %** | 98,82 % | +0,51 Pp |
|
||
| ARC-Challenge | **97,61 %** | 96,76 % | +0,85 Pp |
|
||
| WinoGrande | **91,63 %** | 78,69 % | +12,94 Pp |
|
||
| HellaSwag | 94,86 % | **95,32 %** | −0,46 Pp |
|
||
| GSM8K · 4 Optionen | 79,68 % | **87,72 %** | −8,04 Pp |
|
||
| GSM8K · 10 Optionen | 54,59 % | **69,83 %** | −15,24 Pp |
|
||
| Schach · 4 legale Züge | 49,45 % | **50,25 %** | −0,80 Pp |
|
||
| **Ungewichteter Makromittelwert** | **80,69 %** | **80,15 %** | **+0,54 Pp** |
|
||
|
||
**Was „Terra-tier“ hier trägt:** Im Makromittel über diese neun heterogenen Bedingungen liegen beide fast gleichauf. Das Profil ist aber klar verschieden: Jev gewinnt Wissen/Commonsense, Terra gewinnt Mathematik; Schach ist praktisch Gleichstand. Der Threadtext behauptet zusätzlich einen Jev-Sieg auf HellaSwag — **seine eigene Tabelle widerspricht** (Terra +0,46 Pp).
|
||
|
||
### Kalibrierung und Kosten
|
||
|
||
Das Reliability-Diagramm umfasst **33.735 Entscheidungen**, zehn gleich breite Bins und Wilson-95-%-Konfidenzintervalle. Gemeldet werden **ECE 1,74 Prozentpunkte** im Aggregat und 0,26–6,96 Pp je Einzel-Benchmark. Das ist die bislang stärkste öffentliche Fremdevidenz für TypeSafes RLCD-Versprechen — deutlich belastbarer als die anbietererzeugten Workflow-Labels, aber keine Reproduktion.
|
||
|
||
Die Kosten summieren sich im Bild auf **$0,6999 für Jev** und **$12,9865 für Terra**: **18,55× günstiger**, N8 rundet korrekt auf „~18ד. Jev ist als „estimated“ ausgewiesen (aufgezeichnete Input-Token × $0,042/MTok, Output frei), Terra als API-„reported“. Der Test bestätigt damit einen deutlichen Kostenvorteil, **nicht** die Hersteller-Obergrenze von 400–444,6×. Geschwindigkeit wurde überhaupt nicht gemessen.
|
||
|
||
### Belastbarkeitsgrenzen
|
||
|
||
- Kein öffentliches Eval-Repository, keine Prompts, Seeds, Beispieldateien oder Run-Logs; die Resultate wurden hier nicht reproduziert.
|
||
- `reasoning=none` ist für die System-1-Frage fair, aber kein Vergleich der maximalen Produktleistung.
|
||
- Öffentliche Standardbenchmarks tragen Kontaminationsrisiko. Der Autor nimmt Übertragbarkeit an, weil TypeSafe öffentliche Benches nach eigener Aussage nicht priorisiere.
|
||
- Das gepoolte ECE kann Unterschiede zwischen Aufgaben verdecken; die 6,96-Pp-Spitze zeigt bereits Streuung.
|
||
- Die Grafik nennt sich „Official benchmark comparison“, stammt aber aus einem **unabhängigen persönlichen Test**, nicht von einer Benchmark-Organisation.
|
||
|
||
## Benchmark-Lage (Anbieter-Evals, lokal gelesen 18.09.2026)
|
||
|
||
Die Genauigkeitszahlen, die seit dem Launch zitiert werden, stammen von **[evals.typesafe.ai](https://evals.typesafe.ai/)** (HTTP 200, Text extrahierbar; Raw: `raw/other/2026-09-17_typesafe-workflow-evals.md`). Vier Workflows (Security Incidents, Agent Trace Observability, Invoice Processing, Customer Service), je Modell zwei Ausführungen: **workflow** (strukturierter Harness) vs. **prompt** (alles in einem Prompt).
|
||
|
||
**Aggregat im Workflow-Modus, gleichgewichtet über die vier Workflows:**
|
||
|
||
| Modell | Genauigkeit | Kosten/Fall | Latenz/Fall |
|
||
|--------|-------------|-------------|-------------|
|
||
| **Jev** | **67,8 %** | **$0,0004** | **0,4 s** |
|
||
| luna | 66,8 % | $0,0033 | 12,9 s |
|
||
| terra | 67,9 % | $0,0304 | 10,1 s |
|
||
| sonnet 5 | 67,8 % | $0,1174 | 78,1 s |
|
||
| sol | **74,1 %** | $0,0836 | 23,3 s |
|
||
| opus 5 | **73,1 %** | $0,1761 | 37,8 s |
|
||
| haiku 4.5 | 53,6 % | $0,0195 | 12,5 s |
|
||
| DS v4 flash | 64,4 % | $0,0059 | 51,9 s |
|
||
| DS v4 pro | 65,5 % | $0,0413 | 86,5 s |
|
||
|
||
**Häufigste Fehllektüre:** Jev liegt **auf Augenhöhe mit Terra (67,9 %) und Sonnet 5 (67,8 %)**, einen Punkt über Luna — und **unter Sol (74,1 %) und Opus 5 (73,1 %)**. Die Aussage „über Opus 5" ist invertiert. Der Vorsprung liegt bei Kosten und Latenz (rund 1/8 der Luna-Kosten, 1/30 deren Latenz), nicht in der Genauigkeitskrone.
|
||
|
||
**Jev je Workflow — die Streuung hinter dem Mittel:**
|
||
|
||
| Workflow | Jev | Bester Konkurrent |
|
||
|----------|-----|-------------------|
|
||
| Customer Service | **76,0 %** | sol 78,3 % · opus 5 72,4 % |
|
||
| Agent Trace Observability | 71,6 % | sol 76,6 % · opus 5 75,2 % |
|
||
| Security Incidents | 61,7 % | opus 5 66,2 % · sol 62,5 % |
|
||
| Invoice Processing | 61,8 % | sol 79,1 % · opus 5 78,4 % |
|
||
|
||
Der Mittelwert verbirgt eine Spanne von 61,7 % bis 76,0 %; bei Rechnungsverarbeitung liegt Jev fast 18 Punkte hinter Sol.
|
||
|
||
**Wogegen gemessen wird:** Referenz sind laut Seite „labels generated via an average of the responses of GPT-6 Astra and Claude Fable 5.1, both at high thinking" — kein Mensch labelt, keine unabhängige Ground Truth. Wo beide Frontier-Modelle falsch liegen, wird ein abweichend richtiges Modell **abgewertet** ([[../../people/gabriel-anhaia.md|Gabriel Anhaia]], [Dev.to 17.09.2026](https://dev.to/gabrielanhaia/jev-beat-gpt-luna-by-1-point-gpt-6-and-claude-wrote-the-answer-key-314k)). Die Seite legt ihre Harness-Annahme selbst offen: „we assume that the code is correct".
|
||
|
||
## Guardrail-Tausch bei Vercel `fx`
|
||
|
||
Der bislang gewichtigste **Fremdnutzen** liegt nicht in den Evals, sondern in einem Werkzeugwechsel: Vercel-CEO **Guillermo Rauch** ([@rauchg](https://x.com/rauchg), 871.158 Follower) schreibt laut Dev.to-Bericht, der Sicherheits-Reviewer in `fx` (Vercel-Labs-CLI, Modus „auto", prüft jeden Befehl) laufe heute auf **GPT-5.6 Luna** und **Jev sei „up to 18x faster (p95) and more accurate"** — „likely new default". Vercel-Bauer **Pranit** ([@fazxes](https://x.com/fazxes)) berichtet „~5-18x faster and more accurate than gpt-5.6-luna, our current top choice". ⚠️ **Vercel hat den Benchmark nicht veröffentlicht** (Stand 17.09.): keine Fallzahlen, kein Datensatz. Die Zahlen sind als Werkzeugangabe zu lesen, nicht als Messung.
|
||
|
||
## Spezifikation (Anbieter-Docs, lokal gelesen 18.09.2026)
|
||
|
||
Harte Angaben aus **https://docs.typesafe.ai/models** (HTTP 200, 338.781 Byte; Raw: `raw/other/2026-09-18_typesafe-docs-jev-spezifikation.md`):
|
||
|
||
| Feld | Wert |
|
||
|------|------|
|
||
| Aktuelles Modell | **Jev 1.13** · Modell-ID **`jev-1.13.0`** |
|
||
| Preis | **$42/Btok** bzw. $0,042/Mtok Input; „Output tokens are free" |
|
||
| Rate Limits | **250.000 Token/Sekunde** · **1.200 Requests/Minute** |
|
||
| Kontext | **64k Token pro Request**; **32k für State + längste Frage** |
|
||
| Eingabe | **Nur Text** — String, JSON-Objekt oder Array. **Keine Bild-, Audio- oder Video-Eingabe** |
|
||
|
||
Zwei Punkte, die in der öffentlichen Diskussion regelmäßig falsch wiedergegeben werden:
|
||
|
||
- **„32k Kontext" ist die engere der zwei Grenzen.** Die Doku nennt 64k pro Request; die 32k beziehen sich auf State plus die *längste Einzelfrage*. Wer nur 32k nennt, unterschlägt die Hälfte (so im [[../../people/cj-zafir.md|CJ-Zafir]]-Post).
|
||
- **Text-Only ist eine harte Grenze für Computer-Use.** Ein Desktop- oder Browser-Agent kann Bildschirminhalte **nicht** an Jev geben; er muss den Zustand erst in Text übersetzen. Das relativiert jede Demo, die den Eindruck erweckt, Jev „sehe" den Bildschirm (etwa [[../agents/jev-sprachsteuerung-computer-use.md]]).
|
||
|
||
**Erster Nutzungs-Kostenwert:** [[../../people/cj-zafir.md|CJ Zafir]] berichtet **$3,40 Ausgaben in 24 Stunden** — bei $0,042/MTok rund **81 Mio. Input-Token**, also etwa 19 Durchläufe des bekannten 4,2-Mio.-Postfachs. Bisher waren alle Kostenangaben Anbieterpreise oder Demo-Rechnungen Dritter.
|
||
|
||
## Quellenkritik der Benchmarks
|
||
|
||
Die eigenen Workflow-Evals messen **Übereinstimmung mit Referenzantworten** (Durchschnitt aus GPT-6 Astra und Fable 5.1), nicht unabhängig verifizierte Korrektheit. TypeSafe legt die Bias-Richtungen selbst offen:
|
||
|
||
- Referenzwahl „biases answers towards OpenAI and Anthropic's models" → eigene Leistung gegenüber DeepSeek vermutlich unterschätzt.
|
||
- Workflows „made by individuals on our model capabilities team, so some bias could exist" — aber nicht in der Trainingsverteilung.
|
||
- Die Vergleichs-LLMs liefen über einen eigenen Wrapper, der sie zu Wahrscheinlichkeiten zwingt: laut Artikel langsamer und teurer als freie Entscheidungen — das **vergrößert** den gemessenen Abstand.
|
||
- Die „0 %" in den Halluzinations-Plots sind **nicht empirisch**, sondern aus der Schema-Garantie abgeleitet.
|
||
- LLM-Vergleichszahlen stammen von OpenRouter (Routing-Bias möglich).
|
||
- Preis: „We can't prove it isn't subsidized; we'll need the long-term to prove the sustainability of our pricing."
|
||
|
||
## Einordnung
|
||
|
||
- **Neue Achse statt neuer Frontier.** Jev konkurriert nicht mit Chat- und Coding-Frontier-Modellen, sondern mit der Rolle, die bisher DSPy-Pipelines, Klassifikatoren und Guardrail-Modelle gespielt haben — nur als Foundation-Model. Das ist der eigentliche Beitrag: eine eigene Produktkategorie „Modell für Maschinen" (so auch die Presse-Formulierung „model for machines").
|
||
- **Preis als Freigrenze für Häufigkeit.** Die relevante Verschiebung ist nicht „billiger pro Call", sondern „Checks sind so billig, dass man sie während der Arbeit und nicht danach laufen lässt" — 1.709 Urteile für unter einem Cent. Praktische Konsequenz: dauerhafte Verifikation statt Stichprobe am Ende, vgl. [[../agents/agent-budget-breaker.md]] (Kostendeckel als Voraussetzung unbewachter Schleifen).
|
||
- **Der Linter-Vergleich ist stark.** „Ein Code-Linter für Wissensarbeit" beschreibt den Nutzen präziser als jede Benchmark-Zahl: schnell, billig, unvollständig genau, aber besser als gar keine Prüfung. Genau das ist auch seine Grenze — ein Linter ersetzt keinen Test.
|
||
- **Verifikation wird zur eigenen Fehlerquelle.** Wenn Prüf-Urteile von einem Modell kommen, das kalibriert, aber nicht korrekt ist, wandert die Fehlerquelle in das Gate. Kalibrierung ist die entscheidende Eigenschaft: Nur wenn 0,9 wirklich 90 % Trefferquote bedeutet, kann Code sinnvoll auf Wahrscheinlichkeiten branchen.
|
||
- **Latentes Reasoning als Nebenlinie.** Das Video zieht die Parallele zu OpenAIs *recurrent depth / looped transformers* — Reasoning im latenten Raum statt ausgeschriebener Gedankenkette — und nennt die Safety-Warnung, dass das die Überwachung erschwert. Das Video räumt selbst ein: „we don't know that Jev works the same way internally." Hier ist die Parallele Deutung, kein Befund.
|
||
- **Namensgebung als These:** „Jev" nach **William Stanley Jevons** — Jevons-Paradox: sinkende Kosten erhöhen den Verbrauch. Der Name ist das Programmm: Intelligenz wird billiger, also wird mehr davon verbraucht.
|
||
- Bezug zur Harness-Deutung unseres Wikis: Jev besetzt **weder Modell-Prompting noch Orchestrierung**, sondern die Gate-Schicht im Ablauf — vgl. [[harness-vs-standalone-chat-llm.md]] („Grounding-Tools verhindern keine probabilistische Generierung — nur Gates tun das") und [[../agents/harness-loop-graph-engineering.md]].
|
||
|
||
## Verteilung: über den Vercel AI Gateway (ab 16.09.2026)
|
||
|
||
Der Weg zu Jev führt seit dem **16.09.2026** nicht mehr nur über TypeSafes eigene Waitlist: Das Modell läuft im **[[../../institutions/vercel.md|Vercel]] AI Gateway** unter der ID `typesafe-ai/jev`, nutzbar über das AI SDK (7.0.105+) und die `experimental evaluate`-API. Die Gateway-Seiten nennen `$0.04 / 1 Mio. Input-Token` (gerundete Anzeige gegenüber $0,042), **Zero Data Retention** und **No Training** als pro-Request-Schalter, und sie rechnen Auswertungen gegen Gateway-Budgets ab.
|
||
|
||
Für die Einordnung bedeutsamer als der Zugangsweg: Die ersten Zahlen, die nach dem Launch durch die Timeline laufen, stammen aus einem **Startup-Ideen-Post** von [[../../people/greg-isenberg.md|Greg Isenberg]] (18.09.2026), nicht aus einer Messung — „1,700 emails for 18 cents" ist eine zweit- bis dritthändige Größenordnung ohne Token-Aufschlüsselung und Datensatz. Details, die sieben dort genannten Geschäftsideen und die Quellenkritik: [[jev-vercel-ai-gateway.md]].
|
||
|
||
Merksatz: Der Launch war eine Ankündigung, die Gateway-Listung ist Verteilung — und Verteilungszahlen sind keine Leistungszahlen.
|
||
|
||
### Reichweite: Jev führt zwei Gateway-Leaderboards (Befund 20.09.2026)
|
||
|
||
Ein Blick in die **[[../../institutions/vercel.md|Vercel]]-Leaderboards** (lokal abgerufen 20.09.2026, Zeitraum `Jun 21 – Sep 18, 2026`) liefert zum ersten Mal unabhängig vom Anbieter erhobene **Nutzungszahlen** — anonymisiert, täglich aktualisiert, CC BY 4.0 ([[../../../raw/other/2026-09-20_vercel-ai-gateway-leaderboards.md]]):
|
||
|
||
| Achse | Rang 1 | Rang 2 | Abstand |
|
||
|---|---|---|---|
|
||
| **Reach** (Teams, die das Modell nutzen) | **Jev 15,6 %** | Claude Haiku 4.5 · 14,6 % | +1,0 Pp |
|
||
| **Preference** (primäres Modell nach Token-Volumen) | **Jev 13,3 %** | GPT 5.6 Luna / Claude Sonnet 5 · je 6,9 % | **+6,4 Pp** |
|
||
|
||
In der Reach-Liste stehen dahinter ausschließlich etablierte Frontier-Modelle (Haiku 4.5, Luna, Sonnet 5/4.6, Gemini 2.5/3.8 Flash, Sol, `text-embedding-3-small`). Ein Modell, das im September 2026 neu auf dem Gateway erschien, führt damit **beide** Nutzungsachsen — bei **Preference** mit fast doppeltem Abstand auf Platz 2.
|
||
|
||
Das ist die erste Zahl dieser Akte, die nicht vom Anbieter stammt: Vercel ist der Gateway-Betreiber und erhebt aus eigenem Routing-Verkehr. Es bleibt eine **Plattformmessung** einer einzelnen Firma, kein Benchmark und kein Weltmarkt — die Rangfolgen sind ein Signal, kein Messwert. Details und Kontext: [[open-weights-share-vercel-gateway.md]].
|
||
|
||
## Ankündigungspost und Zahlenherkunft
|
||
|
||
Der Launch-Post von Diogo Almeida ([@CompleteSkeptic](https://x.com/CompleteSkeptic), 15.09.2026, [34,9 Mio. Views](https://x.com/CompleteSkeptic/status/2099925682726002904)) nennt **Spannen**, nicht Einzelwerte: „20-200x faster", „40-400x cheaper (w/ output tokens free)". Die im Umlauf befindlichen „200×/400×" sind die Obergrenzen dieser Spannen; die Workflow-Auswertung nennt 193,6×/444,6×. Wer die Spannen-Obergrenze als Erwartungswert liest, überzeichnet den Anbieter bereits selbst (Raw: `raw/xpost/2026-09-15_almeida-jev-launch-post.md`).
|
||
|
||
## Demo-Welle (16.–18.09.2026)
|
||
|
||
Neben Benchmarks und Verteilung entstand eine Welle öffentlicher Bauprojekte — Doom, Wikipedia-Races, Kleinstadt-Simulation, Schach gegen Frontier-LLMs, Ad-Blocker, Jev-Modellrouter. Diese Demos zeigen das Modell **im Loop** und liefern damit Evidenz, die kein Standard-Eval abfragt. Abstufung, Gegenprüfung und Grenzen: [[jev-praxis-demos.md]].
|
||
|
||
## Rezeption in der Erklärebene (18.09.2026)
|
||
|
||
Zwei Tage nach der Ankündigung erreicht Jev die allgemeine Tech-Erklärebene: **Gary Explains** veröffentlichte am 18.09.2026 ein Video („…is a New Class of AI Model that is FAST and CHEAP - But There is a Caveat!"), dessen Beschreibung den Kern sauber benennt: Jev ist **kein LLM**, sondern „versteht natürliche Sprache und antwortet mit strukturierten Antworten samt Konfidenzwert". Kein neuer Faktenlieferant, sondern ein Verbreitungssignal. Metadata-only, kein Transkript: `raw/youtube/2026-09-18_gary-explains-jev-caveat.md`.
|
||
|
||
Am **19.09.2026** folgt die Praktikerebene: [[../../people/nate-herk.md|Nate Herk]] testet Jev in zwölf Automatisierungsworkflows und zieht die gleiche Grenze — Jev ersetzt kein LLM, sondern übernimmt definierte Einzelentscheidungen; vor dem Produktiveinsatz empfiehlt er Evals mit **Golden Dataset**. Seine Zahlen passen zum Preismodell (≈2.143 Token pro Mail bei 9 Cent/1.000 Mails), seine Laufzeitangaben liegen teils am dokumentierten Rate Limit — Details und Rechnung: [[jev-praxis-demos.md]].
|
||
|
||
## Offene Punkte
|
||
|
||
- ⚠️ **Alle Leistungszahlen sind Anbieterangaben** außer dem einen Every-Einzeltest (37 Dokumente, 12 Passagen, 1.709 Judgments). Keine peer-reviewte Evaluation, keine breite Fremdprüfung.
|
||
- ⚠️ Die Evals-Seite (https://evals.typesafe.ai/, jetzt lokal ausgewertet) nennt **keine Fallzahlen und keine Rohdaten**; ein Nachbau der vier Workflows ist Dritten nicht möglich.
|
||
- ⚠️ Architektur, Trainingsverfahren und Datenherkunft von Jev sind nicht veröffentlicht — ob paralleles Sampling die genannten Latenzen erklärt, ist nicht überprüfbar.
|
||
- Offen: ob der Preis ($42/Mrd. Input, $0 Output) nachhaltig ist — der Anbieter räumt Subvention nicht ausgeschlossen aus.
|
||
- Offen: ob der Gateway-Preis dem Direkt-API-Preis entspricht und ob Rate Limits/SLA existieren — auf den Gateway-Seiten nicht ausgewiesen ([[jev-vercel-ai-gateway.md]]).
|
||
- Offen: Fehlerkosten bei falscher, aber kalibrierter Entscheidung — der Every-Test liefert dazu nur ein Datenpaar (6/7 vs. 7/7).
|
||
- [[../../institutions/typesafe-ai.md|TypeSafe]] hat drei Gründer (Almeida, Sheng, Gafni), Sitzt in San Francisco und ist **nicht** mit OpenAI verbunden — Almeida ist ehemaliger OpenAI-/Google-Brain-Forscher. Die Video-/Presse-Rahmung „a ChatGPT researcher" ist Zuschreibung, keine Firmenbeziehung.
|
||
|
||
## Verwandte Wiki-Seiten
|
||
|
||
- [[../../institutions/typesafe-ai.md]] — Firma, Team, Manifesto
|
||
- [[../../people/diogo-almeida.md]] — Gründer, InstructGPT-Mitautor
|
||
- [[../../people/mike-taylor.md]] — Autor des unabhängigen Tests
|
||
- [[../../people/dan-shipper.md]] — Every-CEO, Test 2
|
||
- [[../../institutions/every.md]] — Publikation des Fremdtests
|
||
- [[../../people/ai-copium.md]] — Kanal, der das Video gepostet hat
|
||
- [[harness-vs-standalone-chat-llm.md]] — Gate vs. Generierung
|
||
- [[llm-model-catalog.md]] — Modellkatalog
|
||
- [[../agents/agent-budget-breaker.md]] — Kostendeckel für unbewachte Schleifen
|
||
- [[../agents/harness-loop-graph-engineering.md]] — Harness-Ebene
|
||
- [[llm-sycophancy-confabulation.md]] — Fehlerklassen jenseits von Halluzination
|
||
- [[jev-vercel-ai-gateway.md]] — Verteilung über den Vercel AI Gateway, Isenberg-Post, sieben Geschäftsideen
|
||
- [[jev-praxis-demos.md]] — Demo-Welle (Doom, Wikipedia-Races, Schach, Modellrouter) und ihre Belastbarkeit
|
||
- [[../agents/jev-sprachsteuerung-computer-use.md]] — Sprachsteuerung als Desktop-Agent (Text-Only-Grenze beachten)
|
||
- [[../../people/cj-zafir.md]] — Erfahrungsbericht mit Ausgabenwert und Fehllektüren
|
||
- [[../../institutions/vercel.md]] — Gateway-Betreiber
|
||
- [[../../people/greg-isenberg.md]] — Startup-Ideen-Kanal, der die „18 Cent"-Zahl verbreitet
|
||
- [[../../people/guillermo-rauch.md]] — Vercel-CEO, tauschte `fx`-Reviewer auf Jev, postete die Gateway-Zahlen
|
||
- [[open-weights-share-vercel-gateway.md]] — Open-Weights-Anteil im Gateway, Reach/Preference-Rangfolgen
|
||
|
||
## Quellen
|
||
|
||
- [TypeSafe: Introducing System One Models & Jev](https://typesafe.ai/blog/introducing-system-one-models-and-jev) (15.09.2026, abgerufen 17.09.2026)
|
||
- [Every: Mini-Vibe Check (Mike Taylor)](https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds) (15.09.2026)
|
||
- [AI Copium: „A ChatGPT Researcher Just Dropped a MASSIVE AI Breakthrough…"](https://www.youtube.com/watch?v=xQtUzjd7-As) (17.09.2026, 14:25, vollständiges Transcript)
|
||
- Raw: `raw/blog/2026-09-15_typesafe-system-one-models-jev.md`, `raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md`, `raw/youtube/2026-09-17_aicopium-typesafe-jev.md`
|
||
- [Vercel AI Gateway — Jev](https://vercel.com/ai-gateway/models/jev) und [Vercel Changelog](https://vercel.com/changelog/typesafe-ai-jev-now-available-on-ai-gateway) (16.09.2026, Gateway-Listung, lokal gelesen)
|
||
- [X-Post @gregisenberg](https://x.com/gregisenberg/status/2101018750916948237) (18.09.2026, 18:41 UTC; 29.661 Views / 415 Likes bei Abruf 21:31 UTC)
|
||
- Erwähnung ohne auswertbaren Inhalt: [The Register](https://www.theregister.com/ai-and-ml/2026/09/16/typesafe-ai-debuts-model-for-machines-that-plays-doom/5296711) (16.09.2026; Volltext nicht abrufbar, nur „Are we human?" extrahiert)
|