--- created: 2026-09-17 updated: 2026-09-17 sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md, blog/2026-09-16_theregister-typesafe-jev-doom.md] tags: [concept, llm, typesafe, jev, system-one-models, rlcd, structured-outputs, calibrated-decisions, parallel-sampling, inference-cost, automation, harness] --- # System One Models & Jev (TypeSafe AI) > **Quelle:** TypeSafe-Ankündigungsartikel von Diogo Almeida (15.09.2026, https://typesafe.ai/blog/introducing-system-one-models-and-jev) + unabhängiger Test von Mike Taylor in Every (15.09.2026) + Video-Zusammenfassung von AI Copium (17.09.2026). Primärquelle = Anbieter; die unabhängige Prüfung ist ein Einzeltest mit kleinem Stichprobenumfang. ## Kernidee **Jev** ist das erste Modell einer neuen Klasse, die TypeSafe **[[../../institutions/typesafe-ai.md|System One Models]]** nennt: keine Textgenerierung, sondern **typisierte probabilistische Entscheidungen** für Software. Anbieterselbstbeschreibung: „unstructured state in, typed probabilistic decisions out" — und „a frontier-intelligence function call". Der Ansatz setzt auf **strukturierte Ausgaben mit vorab definierten Optionen** statt Strings, auf **paralleles Sampling** statt autoregressiver Token-Generierung und auf **kalibrierte Wahrscheinlichkeiten** statt überkonfidenter Fließtexte. ## Drei Konstruktions-Entscheidungen | Achse | Bestehende LLMs | Jev | |-------|-----------------|-----| | Optimierung | RLHF / RLVR — menschliche Präferenz bzw. verifizierbare Rewards | **RLCD** (Reinforcement Learning for Calibrated Decisions) | | Ausgabe | Strings — müssen geparst und validiert werden | **Type-safe structured values**; Ausgabeoptionen und Struktur vorab definiert | | Sampling | sequenziell, ein Token nach dem anderen | **parallel**, alle Urteile in einer Query | Zielgröße laut Anbieter: Werte nahe 1 sollen häufiger zutreffen; „If it flags 100 customer messages as having a 90 percent chance of expressing anger, about 90 should express anger" ([[../../people/mike-taylor.md|Mike Taylor]]). ## Anbieterangaben zu Kosten und Geschwindigkeit | Kennzahl | TypeSafe-Angabe | |----------|-----------------| | End-to-end-Latenz | **70–500 ms** (LLMs laut Artikel 3–329 s) | | Speedup | 40×–200× „for System One shaped queries"; Homepage-Claim **193,6× schneller** | | Kosten-Input | **$0,042 / MTok** = $42 pro Milliarde Tokens | | Kosten-Output | **$0** („too cheap to meter", da keine Token generiert werden) | | Kosten-CLAIM Homepage | **444,6× günstiger** | | Genauigkeit | „near state-of-the-art" auf den eigenen vier Workflows | ⚠️ Die im Videotitel/-beschreibung und im Kapitelmarken-Layout kursierende **„400x"**-Zahl findet sich in der Primärquelle nicht; dort stehen **193,6× / 444,6×**, und der Artikel ordnet selbst ein: „we expect that these are on the higher end of real world gains". ## Was „keine Halluzination" heißt — und was nicht TypeSafe schreibt, Jev könne nicht halluzinieren; gemeint ist **Type-Safety**: Das Modell kann kein Feld mit falschem Typ füllen und keine Option erfinden, die nicht im Schema steht. Das ist laut Anbieter mathematisch garantiert („Schema matching is guaranteed"). Nicht gemeint ist semantische Korrektheit: - Jev kann die **falsche Option wählen** — ein Rückerstattungsantrag kann „approve" erhalten, obwohl „reject" richtig wäre ([[../../people/mike-taylor.md|Taylor]] / AI Copium). - Das ist keine neue Eigenschaft von Jev: LLMs lassen sich ebenfalls auf Formate zwingen (z. B. OpenAI Structured Outputs, DSPy). **Merksatz fürs Wiki:** Type-Safety ist eine Formatgarantie, keine Wahrheitsgarantie. Der verwandte Mechanismus — Gate vs. probabilistische Generierung — steht in [[harness-vs-standalone-chat-llm.md]]. ## Unabhängiger Test (Every, 15.09.2026) Zwei Messungen, beide von **[[../../people/mike-taylor.md|Mike Taylor]]** (Head of Evals, [[../../institutions/every.md|Every]]): **Test 1 — 37 Dokumente × 21 Fragen:** - 27 eigene Every-Artikel + 10 bewusst KI-stilisierte Gegenstücke - **777 Judgments in unter 0,7 Sekunden**, geschätzt **ein Viertel Cent** - Eigenbewertung des Testerstellers: markierte KI-lastige Passagen korrekt, aber „I'd want a more thorough accuracy check before putting it into production" **Test 2 — 12 synthetische Passagen, 4 Schreib-Checks ([[../../people/dan-shipper.md|Dan Shipper]]):** | | Jev | Claude Fable 5.1 (high effort) | |---|---|---| | Median pro Passage | **0,35 s** | **8,83 s** | | Geschwindigkeit | ~25× schneller | — | | Kosten | ~580× niedriger | — | | Defekte gefunden | **6 von 7** | **7 von 7** | Jev verpasste in allen drei Runs dieselbe Passage („a shared appointment calendar that parents and staff teach together"). Über 11 Experimente: 1.709 Judgments für unter einem Cent. **Was der Test nicht zeigt:** Breite über Branchen und Aufgabentypen. Der Autor sagt es selbst; die Zahl der Grundfälle ist einstellig. ## Quellenkritik der Benchmarks Die eigenen Workflow-Evals messen **Übereinstimmung mit Referenzantworten** (Durchschnitt aus GPT-6 Astra und Fable 5.1), nicht unabhängig verifizierte Korrektheit. TypeSafe legt die Bias-Richtungen selbst offen: - Referenzwahl „biases answers towards OpenAI and Anthropic's models" → eigene Leistung gegenüber DeepSeek vermutlich unterschätzt. - Workflows „made by individuals on our model capabilities team, so some bias could exist" — aber nicht in der Trainingsverteilung. - Die Vergleichs-LLMs liefen über einen eigenen Wrapper, der sie zu Wahrscheinlichkeiten zwingt: laut Artikel langsamer und teurer als freie Entscheidungen — das **vergrößert** den gemessenen Abstand. - Die „0 %" in den Halluzinations-Plots sind **nicht empirisch**, sondern aus der Schema-Garantie abgeleitet. - LLM-Vergleichszahlen stammen von OpenRouter (Routing-Bias möglich). - Preis: „We can't prove it isn't subsidized; we'll need the long-term to prove the sustainability of our pricing." ## Einordnung - **Neue Achse statt neuer Frontier.** Jev konkurriert nicht mit Chat- und Coding-Frontier-Modellen, sondern mit der Rolle, die bisher DSPy-Pipelines, Klassifikatoren und Guardrail-Modelle gespielt haben — nur als Foundation-Model. Das ist der eigentliche Beitrag: eine eigene Produktkategorie „Modell für Maschinen" (so auch die Presse-Formulierung „model for machines"). - **Preis als Freigrenze für Häufigkeit.** Die relevante Verschiebung ist nicht „billiger pro Call", sondern „Checks sind so billig, dass man sie während der Arbeit und nicht danach laufen lässt" — 1.709 Urteile für unter einem Cent. Praktische Konsequenz: dauerhafte Verifikation statt Stichprobe am Ende, vgl. [[../agents/agent-budget-breaker.md]] (Kostendeckel als Voraussetzung unbewachter Schleifen). - **Der Linter-Vergleich ist stark.** „Ein Code-Linter für Wissensarbeit" beschreibt den Nutzen präziser als jede Benchmark-Zahl: schnell, billig, unvollständig genau, aber besser als gar keine Prüfung. Genau das ist auch seine Grenze — ein Linter ersetzt keinen Test. - **Verifikation wird zur eigenen Fehlerquelle.** Wenn Prüf-Urteile von einem Modell kommen, das kalibriert, aber nicht korrekt ist, wandert die Fehlerquelle in das Gate. Kalibrierung ist die entscheidende Eigenschaft: Nur wenn 0,9 wirklich 90 % Trefferquote bedeutet, kann Code sinnvoll auf Wahrscheinlichkeiten branchen. - **Latentes Reasoning als Nebenlinie.** Das Video zieht die Parallele zu OpenAIs *recurrent depth / looped transformers* — Reasoning im latenten Raum statt ausgeschriebener Gedankenkette — und nennt die Safety-Warnung, dass das die Überwachung erschwert. Das Video räumt selbst ein: „we don't know that Jev works the same way internally." Hier ist die Parallele Deutung, kein Befund. - **Namensgebung als These:** „Jev" nach **William Stanley Jevons** — Jevons-Paradox: sinkende Kosten erhöhen den Verbrauch. Der Name ist das Programmm: Intelligenz wird billiger, also wird mehr davon verbraucht. - Bezug zur Harness-Deutung unseres Wikis: Jev besetzt **weder Modell-Prompting noch Orchestrierung**, sondern die Gate-Schicht im Ablauf — vgl. [[harness-vs-standalone-chat-llm.md]] („Grounding-Tools verhindern keine probabilistische Generierung — nur Gates tun das") und [[../agents/harness-loop-graph-engineering.md]]. ## Offene Punkte - ⚠️ **Alle Leistungszahlen sind Anbieterangaben** außer dem einen Every-Einzeltest (37 Dokumente, 12 Passagen, 1.709 Judgments). Keine peer-reviewte Evaluation, keine breite Fremdprüfung. - ⚠️ Kein unabhängiger Nachbau der vier Workflows; die Evals-Seite (https://evals.typesafe.ai/) wurde nicht ausgewertet. - ⚠️ Architektur, Trainingsverfahren und Datenherkunft von Jev sind nicht veröffentlicht — ob paralleles Sampling die genannten Latenzen erklärt, ist nicht überprüfbar. - Offen: ob der Preis ($42/Mrd. Input, $0 Output) nachhaltig ist — der Anbieter räumt Subvention nicht ausgeschlossen aus. - Offen: Fehlerkosten bei falscher, aber kalibrierter Entscheidung — der Every-Test liefert dazu nur ein Datenpaar (6/7 vs. 7/7). - [[../../institutions/typesafe-ai.md|TypeSafe]] hat drei Gründer (Almeida, Sheng, Gafni), Sitzt in San Francisco und ist **nicht** mit OpenAI verbunden — Almeida ist ehemaliger OpenAI-/Google-Brain-Forscher. Die Video-/Presse-Rahmung „a ChatGPT researcher" ist Zuschreibung, keine Firmenbeziehung. ## Verwandte Wiki-Seiten - [[../../institutions/typesafe-ai.md]] — Firma, Team, Manifesto - [[../../people/diogo-almeida.md]] — Gründer, InstructGPT-Mitautor - [[../../people/mike-taylor.md]] — Autor des unabhängigen Tests - [[../../people/dan-shipper.md]] — Every-CEO, Test 2 - [[../../institutions/every.md]] — Publikation des Fremdtests - [[../../people/ai-copium.md]] — Kanal, der das Video gepostet hat - [[harness-vs-standalone-chat-llm.md]] — Gate vs. Generierung - [[llm-model-catalog.md]] — Modellkatalog - [[../agents/agent-budget-breaker.md]] — Kostendeckel für unbewachte Schleifen - [[../agents/harness-loop-graph-engineering.md]] — Harness-Ebene - [[llm-sycophancy-confabulation.md]] — Fehlerklassen jenseits von Halluzination ## Quellen - [TypeSafe: Introducing System One Models & Jev](https://typesafe.ai/blog/introducing-system-one-models-and-jev) (15.09.2026, abgerufen 17.09.2026) - [Every: Mini-Vibe Check (Mike Taylor)](https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds) (15.09.2026) - [AI Copium: „A ChatGPT Researcher Just Dropped a MASSIVE AI Breakthrough…"](https://www.youtube.com/watch?v=xQtUzjd7-As) (17.09.2026, 14:25, vollständiges Transcript) - Raw: `raw/blog/2026-09-15_typesafe-system-one-models-jev.md`, `raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md`, `raw/youtube/2026-09-17_aicopium-typesafe-jev.md` - Erwähnung ohne auswertbaren Inhalt: [The Register](https://www.theregister.com/ai-and-ml/2026/09/16/typesafe-ai-debuts-model-for-machines-that-plays-doom/5296711) (16.09.2026; Volltext nicht abrufbar, nur „Are we human?" extrahiert)