- raw: evals.typesafe.ai (lokal gelesen) + devto label-kritik (17.09.2026) - wiki: concepts/llm/system-one-models-jev (benchmark-lage, guardrail-tausch), people/gabriel-anhaia (neu) - korrektur: jev unter opus 5/sol, nicht darueber - index 222. update + log
183 lines
18 KiB
Markdown
183 lines
18 KiB
Markdown
---
|
||
created: 2026-09-17
|
||
updated: 2026-09-18
|
||
sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md, blog/2026-09-16_theregister-typesafe-jev-doom.md, blog/2026-09-16_vercel-jev-ai-gateway.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, xpost/2026-09-15_almeida-jev-launch-post.md, youtube/2026-09-18_berman-jev.md, other/2026-09-17_typesafe-workflow-evals.md, blog/2026-09-17_devto-jev-vs-luna-bake-off.md]
|
||
tags: [concept, llm, typesafe, jev, system-one-models, rlcd, structured-outputs, calibrated-decisions, parallel-sampling, inference-cost, automation, harness]
|
||
---
|
||
|
||
# System One Models & Jev (TypeSafe AI)
|
||
|
||
> **Quelle:** TypeSafe-Ankündigungsartikel von Diogo Almeida (15.09.2026, https://typesafe.ai/blog/introducing-system-one-models-and-jev) + unabhängiger Test von Mike Taylor in Every (15.09.2026) + Video-Zusammenfassung von AI Copium (17.09.2026). Primärquelle = Anbieter; die unabhängige Prüfung ist ein Einzeltest mit kleinem Stichprobenumfang.
|
||
|
||
## Kernidee
|
||
|
||
**Jev** ist das erste Modell einer neuen Klasse, die TypeSafe **[[../../institutions/typesafe-ai.md|System One Models]]** nennt: keine Textgenerierung, sondern **typisierte probabilistische Entscheidungen** für Software. Anbieterselbstbeschreibung: „unstructured state in, typed probabilistic decisions out" — und „a frontier-intelligence function call".
|
||
|
||
Der Ansatz setzt auf **strukturierte Ausgaben mit vorab definierten Optionen** statt Strings, auf **paralleles Sampling** statt autoregressiver Token-Generierung und auf **kalibrierte Wahrscheinlichkeiten** statt überkonfidenter Fließtexte.
|
||
|
||
## Drei Konstruktions-Entscheidungen
|
||
|
||
| Achse | Bestehende LLMs | Jev |
|
||
|-------|-----------------|-----|
|
||
| Optimierung | RLHF / RLVR — menschliche Präferenz bzw. verifizierbare Rewards | **RLCD** (Reinforcement Learning for Calibrated Decisions) |
|
||
| Ausgabe | Strings — müssen geparst und validiert werden | **Type-safe structured values**; Ausgabeoptionen und Struktur vorab definiert |
|
||
| Sampling | sequenziell, ein Token nach dem anderen | **parallel**, alle Urteile in einer Query |
|
||
|
||
Zielgröße laut Anbieter: Werte nahe 1 sollen häufiger zutreffen; „If it flags 100 customer messages as having a 90 percent chance of expressing anger, about 90 should express anger" ([[../../people/mike-taylor.md|Mike Taylor]]).
|
||
|
||
## Anbieterangaben zu Kosten und Geschwindigkeit
|
||
|
||
| Kennzahl | TypeSafe-Angabe |
|
||
|----------|-----------------|
|
||
| End-to-end-Latenz | **70–500 ms** (LLMs laut Artikel 3–329 s) |
|
||
| Speedup | 40×–200× „for System One shaped queries"; Homepage-Claim **193,6× schneller** |
|
||
| Kosten-Input | **$0,042 / MTok** = $42 pro Milliarde Tokens |
|
||
| Kosten-Output | **$0** („too cheap to meter", da keine Token generiert werden) |
|
||
| Kosten-CLAIM Homepage | **444,6× günstiger** |
|
||
| Genauigkeit | „near state-of-the-art" auf den eigenen vier Workflows |
|
||
|
||
⚠️ Die im Videotitel/-beschreibung und im Kapitelmarken-Layout kursierende **„400x"**-Zahl findet sich in der Primärquelle nicht; dort stehen **193,6× / 444,6×**, und der Artikel ordnet selbst ein: „we expect that these are on the higher end of real world gains".
|
||
|
||
## Was „keine Halluzination" heißt — und was nicht
|
||
|
||
TypeSafe schreibt, Jev könne nicht halluzinieren; gemeint ist **Type-Safety**: Das Modell kann kein Feld mit falschem Typ füllen und keine Option erfinden, die nicht im Schema steht. Das ist laut Anbieter mathematisch garantiert („Schema matching is guaranteed").
|
||
|
||
Nicht gemeint ist semantische Korrektheit:
|
||
- Jev kann die **falsche Option wählen** — ein Rückerstattungsantrag kann „approve" erhalten, obwohl „reject" richtig wäre ([[../../people/mike-taylor.md|Taylor]] / AI Copium).
|
||
- Das ist keine neue Eigenschaft von Jev: LLMs lassen sich ebenfalls auf Formate zwingen (z. B. OpenAI Structured Outputs, DSPy).
|
||
|
||
**Merksatz fürs Wiki:** Type-Safety ist eine Formatgarantie, keine Wahrheitsgarantie. Der verwandte Mechanismus — Gate vs. probabilistische Generierung — steht in [[harness-vs-standalone-chat-llm.md]].
|
||
|
||
## Unabhängiger Test (Every, 15.09.2026)
|
||
|
||
Zwei Messungen, beide von **[[../../people/mike-taylor.md|Mike Taylor]]** (Head of Evals, [[../../institutions/every.md|Every]]):
|
||
|
||
**Test 1 — 37 Dokumente × 21 Fragen:**
|
||
- 27 eigene Every-Artikel + 10 bewusst KI-stilisierte Gegenstücke
|
||
- **777 Judgments in unter 0,7 Sekunden**, geschätzt **ein Viertel Cent**
|
||
- Eigenbewertung des Testerstellers: markierte KI-lastige Passagen korrekt, aber „I'd want a more thorough accuracy check before putting it into production"
|
||
|
||
**Test 2 — 12 synthetische Passagen, 4 Schreib-Checks ([[../../people/dan-shipper.md|Dan Shipper]]):**
|
||
|
||
| | Jev | Claude Fable 5.1 (high effort) |
|
||
|---|---|---|
|
||
| Median pro Passage | **0,35 s** | **8,83 s** |
|
||
| Geschwindigkeit | ~25× schneller | — |
|
||
| Kosten | ~580× niedriger | — |
|
||
| Defekte gefunden | **6 von 7** | **7 von 7** |
|
||
|
||
Jev verpasste in allen drei Runs dieselbe Passage („a shared appointment calendar that parents and staff teach together"). Über 11 Experimente: 1.709 Judgments für unter einem Cent.
|
||
|
||
**Was der Test nicht zeigt:** Breite über Branchen und Aufgabentypen. Der Autor sagt es selbst; die Zahl der Grundfälle ist einstellig.
|
||
|
||
## Benchmark-Lage (Anbieter-Evals, lokal gelesen 18.09.2026)
|
||
|
||
Die Genauigkeitszahlen, die seit dem Launch zitiert werden, stammen von **[evals.typesafe.ai](https://evals.typesafe.ai/)** (HTTP 200, Text extrahierbar; Raw: `raw/other/2026-09-17_typesafe-workflow-evals.md`). Vier Workflows (Security Incidents, Agent Trace Observability, Invoice Processing, Customer Service), je Modell zwei Ausführungen: **workflow** (strukturierter Harness) vs. **prompt** (alles in einem Prompt).
|
||
|
||
**Aggregat im Workflow-Modus, gleichgewichtet über die vier Workflows:**
|
||
|
||
| Modell | Genauigkeit | Kosten/Fall | Latenz/Fall |
|
||
|--------|-------------|-------------|-------------|
|
||
| **Jev** | **67,8 %** | **$0,0004** | **0,4 s** |
|
||
| luna | 66,8 % | $0,0033 | 12,9 s |
|
||
| terra | 67,9 % | $0,0304 | 10,1 s |
|
||
| sonnet 5 | 67,8 % | $0,1174 | 78,1 s |
|
||
| sol | **74,1 %** | $0,0836 | 23,3 s |
|
||
| opus 5 | **73,1 %** | $0,1761 | 37,8 s |
|
||
| haiku 4.5 | 53,6 % | $0,0195 | 12,5 s |
|
||
| DS v4 flash | 64,4 % | $0,0059 | 51,9 s |
|
||
| DS v4 pro | 65,5 % | $0,0413 | 86,5 s |
|
||
|
||
**Häufigste Fehllektüre:** Jev liegt **auf Augenhöhe mit Terra (67,9 %) und Sonnet 5 (67,8 %)**, einen Punkt über Luna — und **unter Sol (74,1 %) und Opus 5 (73,1 %)**. Die Aussage „über Opus 5" ist invertiert. Der Vorsprung liegt bei Kosten und Latenz (rund 1/8 der Luna-Kosten, 1/30 deren Latenz), nicht in der Genauigkeitskrone.
|
||
|
||
**Jev je Workflow — die Streuung hinter dem Mittel:**
|
||
|
||
| Workflow | Jev | Bester Konkurrent |
|
||
|----------|-----|-------------------|
|
||
| Customer Service | **76,0 %** | sol 78,3 % · opus 5 72,4 % |
|
||
| Agent Trace Observability | 71,6 % | sol 76,6 % · opus 5 75,2 % |
|
||
| Security Incidents | 61,7 % | opus 5 66,2 % · sol 62,5 % |
|
||
| Invoice Processing | 61,8 % | sol 79,1 % · opus 5 78,4 % |
|
||
|
||
Der Mittelwert verbirgt eine Spanne von 61,7 % bis 76,0 %; bei Rechnungsverarbeitung liegt Jev fast 18 Punkte hinter Sol.
|
||
|
||
**Wogegen gemessen wird:** Referenz sind laut Seite „labels generated via an average of the responses of GPT-6 Astra and Claude Fable 5.1, both at high thinking" — kein Mensch labelt, keine unabhängige Ground Truth. Wo beide Frontier-Modelle falsch liegen, wird ein abweichend richtiges Modell **abgewertet** ([[../../people/gabriel-anhaia.md|Gabriel Anhaia]], [Dev.to 17.09.2026](https://dev.to/gabrielanhaia/jev-beat-gpt-luna-by-1-point-gpt-6-and-claude-wrote-the-answer-key-314k)). Die Seite legt ihre Harness-Annahme selbst offen: „we assume that the code is correct".
|
||
|
||
## Guardrail-Tausch bei Vercel `fx`
|
||
|
||
Der bislang gewichtigste **Fremdnutzen** liegt nicht in den Evals, sondern in einem Werkzeugwechsel: Vercel-CEO **Guillermo Rauch** ([@rauchg](https://x.com/rauchg), 871.158 Follower) schreibt laut Dev.to-Bericht, der Sicherheits-Reviewer in `fx` (Vercel-Labs-CLI, Modus „auto", prüft jeden Befehl) laufe heute auf **GPT-5.6 Luna** und **Jev sei „up to 18x faster (p95) and more accurate"** — „likely new default". Vercel-Bauer **Pranit** ([@fazxes](https://x.com/fazxes)) berichtet „~5-18x faster and more accurate than gpt-5.6-luna, our current top choice". ⚠️ **Vercel hat den Benchmark nicht veröffentlicht** (Stand 17.09.): keine Fallzahlen, kein Datensatz. Die Zahlen sind als Werkzeugangabe zu lesen, nicht als Messung.
|
||
|
||
## Quellenkritik der Benchmarks
|
||
|
||
Die eigenen Workflow-Evals messen **Übereinstimmung mit Referenzantworten** (Durchschnitt aus GPT-6 Astra und Fable 5.1), nicht unabhängig verifizierte Korrektheit. TypeSafe legt die Bias-Richtungen selbst offen:
|
||
|
||
- Referenzwahl „biases answers towards OpenAI and Anthropic's models" → eigene Leistung gegenüber DeepSeek vermutlich unterschätzt.
|
||
- Workflows „made by individuals on our model capabilities team, so some bias could exist" — aber nicht in der Trainingsverteilung.
|
||
- Die Vergleichs-LLMs liefen über einen eigenen Wrapper, der sie zu Wahrscheinlichkeiten zwingt: laut Artikel langsamer und teurer als freie Entscheidungen — das **vergrößert** den gemessenen Abstand.
|
||
- Die „0 %" in den Halluzinations-Plots sind **nicht empirisch**, sondern aus der Schema-Garantie abgeleitet.
|
||
- LLM-Vergleichszahlen stammen von OpenRouter (Routing-Bias möglich).
|
||
- Preis: „We can't prove it isn't subsidized; we'll need the long-term to prove the sustainability of our pricing."
|
||
|
||
## Einordnung
|
||
|
||
- **Neue Achse statt neuer Frontier.** Jev konkurriert nicht mit Chat- und Coding-Frontier-Modellen, sondern mit der Rolle, die bisher DSPy-Pipelines, Klassifikatoren und Guardrail-Modelle gespielt haben — nur als Foundation-Model. Das ist der eigentliche Beitrag: eine eigene Produktkategorie „Modell für Maschinen" (so auch die Presse-Formulierung „model for machines").
|
||
- **Preis als Freigrenze für Häufigkeit.** Die relevante Verschiebung ist nicht „billiger pro Call", sondern „Checks sind so billig, dass man sie während der Arbeit und nicht danach laufen lässt" — 1.709 Urteile für unter einem Cent. Praktische Konsequenz: dauerhafte Verifikation statt Stichprobe am Ende, vgl. [[../agents/agent-budget-breaker.md]] (Kostendeckel als Voraussetzung unbewachter Schleifen).
|
||
- **Der Linter-Vergleich ist stark.** „Ein Code-Linter für Wissensarbeit" beschreibt den Nutzen präziser als jede Benchmark-Zahl: schnell, billig, unvollständig genau, aber besser als gar keine Prüfung. Genau das ist auch seine Grenze — ein Linter ersetzt keinen Test.
|
||
- **Verifikation wird zur eigenen Fehlerquelle.** Wenn Prüf-Urteile von einem Modell kommen, das kalibriert, aber nicht korrekt ist, wandert die Fehlerquelle in das Gate. Kalibrierung ist die entscheidende Eigenschaft: Nur wenn 0,9 wirklich 90 % Trefferquote bedeutet, kann Code sinnvoll auf Wahrscheinlichkeiten branchen.
|
||
- **Latentes Reasoning als Nebenlinie.** Das Video zieht die Parallele zu OpenAIs *recurrent depth / looped transformers* — Reasoning im latenten Raum statt ausgeschriebener Gedankenkette — und nennt die Safety-Warnung, dass das die Überwachung erschwert. Das Video räumt selbst ein: „we don't know that Jev works the same way internally." Hier ist die Parallele Deutung, kein Befund.
|
||
- **Namensgebung als These:** „Jev" nach **William Stanley Jevons** — Jevons-Paradox: sinkende Kosten erhöhen den Verbrauch. Der Name ist das Programmm: Intelligenz wird billiger, also wird mehr davon verbraucht.
|
||
- Bezug zur Harness-Deutung unseres Wikis: Jev besetzt **weder Modell-Prompting noch Orchestrierung**, sondern die Gate-Schicht im Ablauf — vgl. [[harness-vs-standalone-chat-llm.md]] („Grounding-Tools verhindern keine probabilistische Generierung — nur Gates tun das") und [[../agents/harness-loop-graph-engineering.md]].
|
||
|
||
## Verteilung: über den Vercel AI Gateway (ab 16.09.2026)
|
||
|
||
Der Weg zu Jev führt seit dem **16.09.2026** nicht mehr nur über TypeSafes eigene Waitlist: Das Modell läuft im **[[../../institutions/vercel.md|Vercel]] AI Gateway** unter der ID `typesafe-ai/jev`, nutzbar über das AI SDK (7.0.105+) und die `experimental evaluate`-API. Die Gateway-Seiten nennen `$0.04 / 1 Mio. Input-Token` (gerundete Anzeige gegenüber $0,042), **Zero Data Retention** und **No Training** als pro-Request-Schalter, und sie rechnen Auswertungen gegen Gateway-Budgets ab.
|
||
|
||
Für die Einordnung bedeutsamer als der Zugangsweg: Die ersten Zahlen, die nach dem Launch durch die Timeline laufen, stammen aus einem **Startup-Ideen-Post** von [[../../people/greg-isenberg.md|Greg Isenberg]] (18.09.2026), nicht aus einer Messung — „1,700 emails for 18 cents" ist eine zweit- bis dritthändige Größenordnung ohne Token-Aufschlüsselung und Datensatz. Details, die sieben dort genannten Geschäftsideen und die Quellenkritik: [[jev-vercel-ai-gateway.md]].
|
||
|
||
Merksatz: Der Launch war eine Ankündigung, die Gateway-Listung ist Verteilung — und Verteilungszahlen sind keine Leistungszahlen.
|
||
|
||
## Ankündigungspost und Zahlenherkunft
|
||
|
||
Der Launch-Post von Diogo Almeida ([@CompleteSkeptic](https://x.com/CompleteSkeptic), 15.09.2026, [34,9 Mio. Views](https://x.com/CompleteSkeptic/status/2099925682726002904)) nennt **Spannen**, nicht Einzelwerte: „20-200x faster", „40-400x cheaper (w/ output tokens free)". Die im Umlauf befindlichen „200×/400×" sind die Obergrenzen dieser Spannen; die Workflow-Auswertung nennt 193,6×/444,6×. Wer die Spannen-Obergrenze als Erwartungswert liest, überzeichnet den Anbieter bereits selbst (Raw: `raw/xpost/2026-09-15_almeida-jev-launch-post.md`).
|
||
|
||
## Demo-Welle (16.–18.09.2026)
|
||
|
||
Neben Benchmarks und Verteilung entstand eine Welle öffentlicher Bauprojekte — Doom, Wikipedia-Races, Kleinstadt-Simulation, Schach gegen Frontier-LLMs, Ad-Blocker, Jev-Modellrouter. Diese Demos zeigen das Modell **im Loop** und liefern damit Evidenz, die kein Standard-Eval abfragt. Abstufung, Gegenprüfung und Grenzen: [[jev-praxis-demos.md]].
|
||
|
||
## Offene Punkte
|
||
|
||
- ⚠️ **Alle Leistungszahlen sind Anbieterangaben** außer dem einen Every-Einzeltest (37 Dokumente, 12 Passagen, 1.709 Judgments). Keine peer-reviewte Evaluation, keine breite Fremdprüfung.
|
||
- ⚠️ Die Evals-Seite (https://evals.typesafe.ai/, jetzt lokal ausgewertet) nennt **keine Fallzahlen und keine Rohdaten**; ein Nachbau der vier Workflows ist Dritten nicht möglich.
|
||
- ⚠️ Architektur, Trainingsverfahren und Datenherkunft von Jev sind nicht veröffentlicht — ob paralleles Sampling die genannten Latenzen erklärt, ist nicht überprüfbar.
|
||
- Offen: ob der Preis ($42/Mrd. Input, $0 Output) nachhaltig ist — der Anbieter räumt Subvention nicht ausgeschlossen aus.
|
||
- Offen: ob der Gateway-Preis dem Direkt-API-Preis entspricht und ob Rate Limits/SLA existieren — auf den Gateway-Seiten nicht ausgewiesen ([[jev-vercel-ai-gateway.md]]).
|
||
- Offen: Fehlerkosten bei falscher, aber kalibrierter Entscheidung — der Every-Test liefert dazu nur ein Datenpaar (6/7 vs. 7/7).
|
||
- [[../../institutions/typesafe-ai.md|TypeSafe]] hat drei Gründer (Almeida, Sheng, Gafni), Sitzt in San Francisco und ist **nicht** mit OpenAI verbunden — Almeida ist ehemaliger OpenAI-/Google-Brain-Forscher. Die Video-/Presse-Rahmung „a ChatGPT researcher" ist Zuschreibung, keine Firmenbeziehung.
|
||
|
||
## Verwandte Wiki-Seiten
|
||
|
||
- [[../../institutions/typesafe-ai.md]] — Firma, Team, Manifesto
|
||
- [[../../people/diogo-almeida.md]] — Gründer, InstructGPT-Mitautor
|
||
- [[../../people/mike-taylor.md]] — Autor des unabhängigen Tests
|
||
- [[../../people/dan-shipper.md]] — Every-CEO, Test 2
|
||
- [[../../institutions/every.md]] — Publikation des Fremdtests
|
||
- [[../../people/ai-copium.md]] — Kanal, der das Video gepostet hat
|
||
- [[harness-vs-standalone-chat-llm.md]] — Gate vs. Generierung
|
||
- [[llm-model-catalog.md]] — Modellkatalog
|
||
- [[../agents/agent-budget-breaker.md]] — Kostendeckel für unbewachte Schleifen
|
||
- [[../agents/harness-loop-graph-engineering.md]] — Harness-Ebene
|
||
- [[llm-sycophancy-confabulation.md]] — Fehlerklassen jenseits von Halluzination
|
||
- [[jev-vercel-ai-gateway.md]] — Verteilung über den Vercel AI Gateway, Isenberg-Post, sieben Geschäftsideen
|
||
- [[jev-praxis-demos.md]] — Demo-Welle (Doom, Wikipedia-Races, Schach, Modellrouter) und ihre Belastbarkeit
|
||
- [[../../institutions/vercel.md]] — Gateway-Betreiber
|
||
- [[../../people/greg-isenberg.md]] — Startup-Ideen-Kanal, der die „18 Cent"-Zahl verbreitet
|
||
|
||
## Quellen
|
||
|
||
- [TypeSafe: Introducing System One Models & Jev](https://typesafe.ai/blog/introducing-system-one-models-and-jev) (15.09.2026, abgerufen 17.09.2026)
|
||
- [Every: Mini-Vibe Check (Mike Taylor)](https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds) (15.09.2026)
|
||
- [AI Copium: „A ChatGPT Researcher Just Dropped a MASSIVE AI Breakthrough…"](https://www.youtube.com/watch?v=xQtUzjd7-As) (17.09.2026, 14:25, vollständiges Transcript)
|
||
- Raw: `raw/blog/2026-09-15_typesafe-system-one-models-jev.md`, `raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md`, `raw/youtube/2026-09-17_aicopium-typesafe-jev.md`
|
||
- [Vercel AI Gateway — Jev](https://vercel.com/ai-gateway/models/jev) und [Vercel Changelog](https://vercel.com/changelog/typesafe-ai-jev-now-available-on-ai-gateway) (16.09.2026, Gateway-Listung, lokal gelesen)
|
||
- [X-Post @gregisenberg](https://x.com/gregisenberg/status/2101018750916948237) (18.09.2026, 18:41 UTC; 29.661 Views / 415 Likes bei Abruf 21:31 UTC)
|
||
- Erwähnung ohne auswertbaren Inhalt: [The Register](https://www.theregister.com/ai-and-ml/2026/09/16/typesafe-ai-debuts-model-for-machines-that-plays-doom/5296711) (16.09.2026; Volltext nicht abrufbar, nur „Are we human?" extrahiert)
|