20 KiB
| created | updated | sources | tags | |||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-09-17 | 2026-09-18 |
|
|
System One Models & Jev (TypeSafe AI)
Quelle: TypeSafe-Ankündigungsartikel von Diogo Almeida (15.09.2026, https://typesafe.ai/blog/introducing-system-one-models-and-jev) + unabhängiger Test von Mike Taylor in Every (15.09.2026) + Video-Zusammenfassung von AI Copium (17.09.2026). Primärquelle = Anbieter; die unabhängige Prüfung ist ein Einzeltest mit kleinem Stichprobenumfang.
Kernidee
Jev ist das erste Modell einer neuen Klasse, die TypeSafe ../../institutions/typesafe-ai.md nennt: keine Textgenerierung, sondern typisierte probabilistische Entscheidungen für Software. Anbieterselbstbeschreibung: „unstructured state in, typed probabilistic decisions out" — und „a frontier-intelligence function call".
Der Ansatz setzt auf strukturierte Ausgaben mit vorab definierten Optionen statt Strings, auf paralleles Sampling statt autoregressiver Token-Generierung und auf kalibrierte Wahrscheinlichkeiten statt überkonfidenter Fließtexte.
Drei Konstruktions-Entscheidungen
| Achse | Bestehende LLMs | Jev |
|---|---|---|
| Optimierung | RLHF / RLVR — menschliche Präferenz bzw. verifizierbare Rewards | RLCD (Reinforcement Learning for Calibrated Decisions) |
| Ausgabe | Strings — müssen geparst und validiert werden | Type-safe structured values; Ausgabeoptionen und Struktur vorab definiert |
| Sampling | sequenziell, ein Token nach dem anderen | parallel, alle Urteile in einer Query |
Zielgröße laut Anbieter: Werte nahe 1 sollen häufiger zutreffen; „If it flags 100 customer messages as having a 90 percent chance of expressing anger, about 90 should express anger" (../../people/mike-taylor.md).
Anbieterangaben zu Kosten und Geschwindigkeit
| Kennzahl | TypeSafe-Angabe |
|---|---|
| End-to-end-Latenz | 70–500 ms (LLMs laut Artikel 3–329 s) |
| Speedup | 40×–200× „for System One shaped queries"; Homepage-Claim 193,6× schneller |
| Kosten-Input | $0,042 / MTok = $42 pro Milliarde Tokens |
| Kosten-Output | $0 („too cheap to meter", da keine Token generiert werden) |
| Kosten-CLAIM Homepage | 444,6× günstiger |
| Genauigkeit | „near state-of-the-art" auf den eigenen vier Workflows |
⚠️ Die im Videotitel/-beschreibung und im Kapitelmarken-Layout kursierende „400x"-Zahl findet sich in der Primärquelle nicht; dort stehen 193,6× / 444,6×, und der Artikel ordnet selbst ein: „we expect that these are on the higher end of real world gains".
Was „keine Halluzination" heißt — und was nicht
TypeSafe schreibt, Jev könne nicht halluzinieren; gemeint ist Type-Safety: Das Modell kann kein Feld mit falschem Typ füllen und keine Option erfinden, die nicht im Schema steht. Das ist laut Anbieter mathematisch garantiert („Schema matching is guaranteed").
Nicht gemeint ist semantische Korrektheit:
- Jev kann die falsche Option wählen — ein Rückerstattungsantrag kann „approve" erhalten, obwohl „reject" richtig wäre (../../people/mike-taylor.md / AI Copium).
- Das ist keine neue Eigenschaft von Jev: LLMs lassen sich ebenfalls auf Formate zwingen (z. B. OpenAI Structured Outputs, DSPy).
Merksatz fürs Wiki: Type-Safety ist eine Formatgarantie, keine Wahrheitsgarantie. Der verwandte Mechanismus — Gate vs. probabilistische Generierung — steht in harness-vs-standalone-chat-llm.md.
Unabhängiger Test (Every, 15.09.2026)
Zwei Messungen, beide von ../../people/mike-taylor.md (Head of Evals, ../../institutions/every.md):
Test 1 — 37 Dokumente × 21 Fragen:
- 27 eigene Every-Artikel + 10 bewusst KI-stilisierte Gegenstücke
- 777 Judgments in unter 0,7 Sekunden, geschätzt ein Viertel Cent
- Eigenbewertung des Testerstellers: markierte KI-lastige Passagen korrekt, aber „I'd want a more thorough accuracy check before putting it into production"
Test 2 — 12 synthetische Passagen, 4 Schreib-Checks (../../people/dan-shipper.md):
| Jev | Claude Fable 5.1 (high effort) | |
|---|---|---|
| Median pro Passage | 0,35 s | 8,83 s |
| Geschwindigkeit | ~25× schneller | — |
| Kosten | ~580× niedriger | — |
| Defekte gefunden | 6 von 7 | 7 von 7 |
Jev verpasste in allen drei Runs dieselbe Passage („a shared appointment calendar that parents and staff teach together"). Über 11 Experimente: 1.709 Judgments für unter einem Cent.
Was der Test nicht zeigt: Breite über Branchen und Aufgabentypen. Der Autor sagt es selbst; die Zahl der Grundfälle ist einstellig.
Benchmark-Lage (Anbieter-Evals, lokal gelesen 18.09.2026)
Die Genauigkeitszahlen, die seit dem Launch zitiert werden, stammen von evals.typesafe.ai (HTTP 200, Text extrahierbar; Raw: raw/other/2026-09-17_typesafe-workflow-evals.md). Vier Workflows (Security Incidents, Agent Trace Observability, Invoice Processing, Customer Service), je Modell zwei Ausführungen: workflow (strukturierter Harness) vs. prompt (alles in einem Prompt).
Aggregat im Workflow-Modus, gleichgewichtet über die vier Workflows:
| Modell | Genauigkeit | Kosten/Fall | Latenz/Fall |
|---|---|---|---|
| Jev | 67,8 % | $0,0004 | 0,4 s |
| luna | 66,8 % | $0,0033 | 12,9 s |
| terra | 67,9 % | $0,0304 | 10,1 s |
| sonnet 5 | 67,8 % | $0,1174 | 78,1 s |
| sol | 74,1 % | $0,0836 | 23,3 s |
| opus 5 | 73,1 % | $0,1761 | 37,8 s |
| haiku 4.5 | 53,6 % | $0,0195 | 12,5 s |
| DS v4 flash | 64,4 % | $0,0059 | 51,9 s |
| DS v4 pro | 65,5 % | $0,0413 | 86,5 s |
Häufigste Fehllektüre: Jev liegt auf Augenhöhe mit Terra (67,9 %) und Sonnet 5 (67,8 %), einen Punkt über Luna — und unter Sol (74,1 %) und Opus 5 (73,1 %). Die Aussage „über Opus 5" ist invertiert. Der Vorsprung liegt bei Kosten und Latenz (rund 1/8 der Luna-Kosten, 1/30 deren Latenz), nicht in der Genauigkeitskrone.
Jev je Workflow — die Streuung hinter dem Mittel:
| Workflow | Jev | Bester Konkurrent |
|---|---|---|
| Customer Service | 76,0 % | sol 78,3 % · opus 5 72,4 % |
| Agent Trace Observability | 71,6 % | sol 76,6 % · opus 5 75,2 % |
| Security Incidents | 61,7 % | opus 5 66,2 % · sol 62,5 % |
| Invoice Processing | 61,8 % | sol 79,1 % · opus 5 78,4 % |
Der Mittelwert verbirgt eine Spanne von 61,7 % bis 76,0 %; bei Rechnungsverarbeitung liegt Jev fast 18 Punkte hinter Sol.
Wogegen gemessen wird: Referenz sind laut Seite „labels generated via an average of the responses of GPT-6 Astra and Claude Fable 5.1, both at high thinking" — kein Mensch labelt, keine unabhängige Ground Truth. Wo beide Frontier-Modelle falsch liegen, wird ein abweichend richtiges Modell abgewertet (../../people/gabriel-anhaia.md, Dev.to 17.09.2026). Die Seite legt ihre Harness-Annahme selbst offen: „we assume that the code is correct".
Guardrail-Tausch bei Vercel fx
Der bislang gewichtigste Fremdnutzen liegt nicht in den Evals, sondern in einem Werkzeugwechsel: Vercel-CEO Guillermo Rauch (@rauchg, 871.158 Follower) schreibt laut Dev.to-Bericht, der Sicherheits-Reviewer in fx (Vercel-Labs-CLI, Modus „auto", prüft jeden Befehl) laufe heute auf GPT-5.6 Luna und Jev sei „up to 18x faster (p95) and more accurate" — „likely new default". Vercel-Bauer Pranit (@fazxes) berichtet „~5-18x faster and more accurate than gpt-5.6-luna, our current top choice". ⚠️ Vercel hat den Benchmark nicht veröffentlicht (Stand 17.09.): keine Fallzahlen, kein Datensatz. Die Zahlen sind als Werkzeugangabe zu lesen, nicht als Messung.
Spezifikation (Anbieter-Docs, lokal gelesen 18.09.2026)
Harte Angaben aus https://docs.typesafe.ai/models (HTTP 200, 338.781 Byte; Raw: raw/other/2026-09-18_typesafe-docs-jev-spezifikation.md):
| Feld | Wert |
|---|---|
| Aktuelles Modell | Jev 1.13 · Modell-ID jev-1.13.0 |
| Preis | $42/Btok bzw. $0,042/Mtok Input; „Output tokens are free" |
| Rate Limits | 250.000 Token/Sekunde · 1.200 Requests/Minute |
| Kontext | 64k Token pro Request; 32k für State + längste Frage |
| Eingabe | Nur Text — String, JSON-Objekt oder Array. Keine Bild-, Audio- oder Video-Eingabe |
Zwei Punkte, die in der öffentlichen Diskussion regelmäßig falsch wiedergegeben werden:
- „32k Kontext" ist die engere der zwei Grenzen. Die Doku nennt 64k pro Request; die 32k beziehen sich auf State plus die längste Einzelfrage. Wer nur 32k nennt, unterschlägt die Hälfte (so im ../../people/cj-zafir.md-Post).
- Text-Only ist eine harte Grenze für Computer-Use. Ein Desktop- oder Browser-Agent kann Bildschirminhalte nicht an Jev geben; er muss den Zustand erst in Text übersetzen. Das relativiert jede Demo, die den Eindruck erweckt, Jev „sehe" den Bildschirm (etwa ../agents/jev-sprachsteuerung-computer-use.md).
Erster Nutzungs-Kostenwert: ../../people/cj-zafir.md berichtet $3,40 Ausgaben in 24 Stunden — bei $0,042/MTok rund 81 Mio. Input-Token, also etwa 19 Durchläufe des bekannten 4,2-Mio.-Postfachs. Bisher waren alle Kostenangaben Anbieterpreise oder Demo-Rechnungen Dritter.
Quellenkritik der Benchmarks
Die eigenen Workflow-Evals messen Übereinstimmung mit Referenzantworten (Durchschnitt aus GPT-6 Astra und Fable 5.1), nicht unabhängig verifizierte Korrektheit. TypeSafe legt die Bias-Richtungen selbst offen:
- Referenzwahl „biases answers towards OpenAI and Anthropic's models" → eigene Leistung gegenüber DeepSeek vermutlich unterschätzt.
- Workflows „made by individuals on our model capabilities team, so some bias could exist" — aber nicht in der Trainingsverteilung.
- Die Vergleichs-LLMs liefen über einen eigenen Wrapper, der sie zu Wahrscheinlichkeiten zwingt: laut Artikel langsamer und teurer als freie Entscheidungen — das vergrößert den gemessenen Abstand.
- Die „0 %" in den Halluzinations-Plots sind nicht empirisch, sondern aus der Schema-Garantie abgeleitet.
- LLM-Vergleichszahlen stammen von OpenRouter (Routing-Bias möglich).
- Preis: „We can't prove it isn't subsidized; we'll need the long-term to prove the sustainability of our pricing."
Einordnung
- Neue Achse statt neuer Frontier. Jev konkurriert nicht mit Chat- und Coding-Frontier-Modellen, sondern mit der Rolle, die bisher DSPy-Pipelines, Klassifikatoren und Guardrail-Modelle gespielt haben — nur als Foundation-Model. Das ist der eigentliche Beitrag: eine eigene Produktkategorie „Modell für Maschinen" (so auch die Presse-Formulierung „model for machines").
- Preis als Freigrenze für Häufigkeit. Die relevante Verschiebung ist nicht „billiger pro Call", sondern „Checks sind so billig, dass man sie während der Arbeit und nicht danach laufen lässt" — 1.709 Urteile für unter einem Cent. Praktische Konsequenz: dauerhafte Verifikation statt Stichprobe am Ende, vgl. ../agents/agent-budget-breaker.md (Kostendeckel als Voraussetzung unbewachter Schleifen).
- Der Linter-Vergleich ist stark. „Ein Code-Linter für Wissensarbeit" beschreibt den Nutzen präziser als jede Benchmark-Zahl: schnell, billig, unvollständig genau, aber besser als gar keine Prüfung. Genau das ist auch seine Grenze — ein Linter ersetzt keinen Test.
- Verifikation wird zur eigenen Fehlerquelle. Wenn Prüf-Urteile von einem Modell kommen, das kalibriert, aber nicht korrekt ist, wandert die Fehlerquelle in das Gate. Kalibrierung ist die entscheidende Eigenschaft: Nur wenn 0,9 wirklich 90 % Trefferquote bedeutet, kann Code sinnvoll auf Wahrscheinlichkeiten branchen.
- Latentes Reasoning als Nebenlinie. Das Video zieht die Parallele zu OpenAIs recurrent depth / looped transformers — Reasoning im latenten Raum statt ausgeschriebener Gedankenkette — und nennt die Safety-Warnung, dass das die Überwachung erschwert. Das Video räumt selbst ein: „we don't know that Jev works the same way internally." Hier ist die Parallele Deutung, kein Befund.
- Namensgebung als These: „Jev" nach William Stanley Jevons — Jevons-Paradox: sinkende Kosten erhöhen den Verbrauch. Der Name ist das Programmm: Intelligenz wird billiger, also wird mehr davon verbraucht.
- Bezug zur Harness-Deutung unseres Wikis: Jev besetzt weder Modell-Prompting noch Orchestrierung, sondern die Gate-Schicht im Ablauf — vgl. harness-vs-standalone-chat-llm.md („Grounding-Tools verhindern keine probabilistische Generierung — nur Gates tun das") und ../agents/harness-loop-graph-engineering.md.
Verteilung: über den Vercel AI Gateway (ab 16.09.2026)
Der Weg zu Jev führt seit dem 16.09.2026 nicht mehr nur über TypeSafes eigene Waitlist: Das Modell läuft im ../../institutions/vercel.md AI Gateway unter der ID typesafe-ai/jev, nutzbar über das AI SDK (7.0.105+) und die experimental evaluate-API. Die Gateway-Seiten nennen $0.04 / 1 Mio. Input-Token (gerundete Anzeige gegenüber $0,042), Zero Data Retention und No Training als pro-Request-Schalter, und sie rechnen Auswertungen gegen Gateway-Budgets ab.
Für die Einordnung bedeutsamer als der Zugangsweg: Die ersten Zahlen, die nach dem Launch durch die Timeline laufen, stammen aus einem Startup-Ideen-Post von ../../people/greg-isenberg.md (18.09.2026), nicht aus einer Messung — „1,700 emails for 18 cents" ist eine zweit- bis dritthändige Größenordnung ohne Token-Aufschlüsselung und Datensatz. Details, die sieben dort genannten Geschäftsideen und die Quellenkritik: jev-vercel-ai-gateway.md.
Merksatz: Der Launch war eine Ankündigung, die Gateway-Listung ist Verteilung — und Verteilungszahlen sind keine Leistungszahlen.
Ankündigungspost und Zahlenherkunft
Der Launch-Post von Diogo Almeida (@CompleteSkeptic, 15.09.2026, 34,9 Mio. Views) nennt Spannen, nicht Einzelwerte: „20-200x faster", „40-400x cheaper (w/ output tokens free)". Die im Umlauf befindlichen „200×/400×" sind die Obergrenzen dieser Spannen; die Workflow-Auswertung nennt 193,6×/444,6×. Wer die Spannen-Obergrenze als Erwartungswert liest, überzeichnet den Anbieter bereits selbst (Raw: raw/xpost/2026-09-15_almeida-jev-launch-post.md).
Demo-Welle (16.–18.09.2026)
Neben Benchmarks und Verteilung entstand eine Welle öffentlicher Bauprojekte — Doom, Wikipedia-Races, Kleinstadt-Simulation, Schach gegen Frontier-LLMs, Ad-Blocker, Jev-Modellrouter. Diese Demos zeigen das Modell im Loop und liefern damit Evidenz, die kein Standard-Eval abfragt. Abstufung, Gegenprüfung und Grenzen: jev-praxis-demos.md.
Rezeption in der Erklärebene (18.09.2026)
Zwei Tage nach der Ankündigung erreicht Jev die allgemeine Tech-Erklärebene: Gary Explains veröffentlichte am 18.09.2026 ein Video („…is a New Class of AI Model that is FAST and CHEAP - But There is a Caveat!"), dessen Beschreibung den Kern sauber benennt: Jev ist kein LLM, sondern „versteht natürliche Sprache und antwortet mit strukturierten Antworten samt Konfidenzwert". Kein neuer Faktenlieferant, sondern ein Verbreitungssignal. Metadata-only, kein Transkript: raw/youtube/2026-09-18_gary-explains-jev-caveat.md.
Offene Punkte
- ⚠️ Alle Leistungszahlen sind Anbieterangaben außer dem einen Every-Einzeltest (37 Dokumente, 12 Passagen, 1.709 Judgments). Keine peer-reviewte Evaluation, keine breite Fremdprüfung.
- ⚠️ Die Evals-Seite (https://evals.typesafe.ai/, jetzt lokal ausgewertet) nennt keine Fallzahlen und keine Rohdaten; ein Nachbau der vier Workflows ist Dritten nicht möglich.
- ⚠️ Architektur, Trainingsverfahren und Datenherkunft von Jev sind nicht veröffentlicht — ob paralleles Sampling die genannten Latenzen erklärt, ist nicht überprüfbar.
- Offen: ob der Preis ($42/Mrd. Input, $0 Output) nachhaltig ist — der Anbieter räumt Subvention nicht ausgeschlossen aus.
- Offen: ob der Gateway-Preis dem Direkt-API-Preis entspricht und ob Rate Limits/SLA existieren — auf den Gateway-Seiten nicht ausgewiesen (jev-vercel-ai-gateway.md).
- Offen: Fehlerkosten bei falscher, aber kalibrierter Entscheidung — der Every-Test liefert dazu nur ein Datenpaar (6/7 vs. 7/7).
- ../../institutions/typesafe-ai.md hat drei Gründer (Almeida, Sheng, Gafni), Sitzt in San Francisco und ist nicht mit OpenAI verbunden — Almeida ist ehemaliger OpenAI-/Google-Brain-Forscher. Die Video-/Presse-Rahmung „a ChatGPT researcher" ist Zuschreibung, keine Firmenbeziehung.
Verwandte Wiki-Seiten
- ../../institutions/typesafe-ai.md — Firma, Team, Manifesto
- ../../people/diogo-almeida.md — Gründer, InstructGPT-Mitautor
- ../../people/mike-taylor.md — Autor des unabhängigen Tests
- ../../people/dan-shipper.md — Every-CEO, Test 2
- ../../institutions/every.md — Publikation des Fremdtests
- ../../people/ai-copium.md — Kanal, der das Video gepostet hat
- harness-vs-standalone-chat-llm.md — Gate vs. Generierung
- llm-model-catalog.md — Modellkatalog
- ../agents/agent-budget-breaker.md — Kostendeckel für unbewachte Schleifen
- ../agents/harness-loop-graph-engineering.md — Harness-Ebene
- llm-sycophancy-confabulation.md — Fehlerklassen jenseits von Halluzination
- jev-vercel-ai-gateway.md — Verteilung über den Vercel AI Gateway, Isenberg-Post, sieben Geschäftsideen
- jev-praxis-demos.md — Demo-Welle (Doom, Wikipedia-Races, Schach, Modellrouter) und ihre Belastbarkeit
- ../agents/jev-sprachsteuerung-computer-use.md — Sprachsteuerung als Desktop-Agent (Text-Only-Grenze beachten)
- ../../people/cj-zafir.md — Erfahrungsbericht mit Ausgabenwert und Fehllektüren
- ../../institutions/vercel.md — Gateway-Betreiber
- ../../people/greg-isenberg.md — Startup-Ideen-Kanal, der die „18 Cent"-Zahl verbreitet
Quellen
- TypeSafe: Introducing System One Models & Jev (15.09.2026, abgerufen 17.09.2026)
- Every: Mini-Vibe Check (Mike Taylor) (15.09.2026)
- AI Copium: „A ChatGPT Researcher Just Dropped a MASSIVE AI Breakthrough…" (17.09.2026, 14:25, vollständiges Transcript)
- Raw:
raw/blog/2026-09-15_typesafe-system-one-models-jev.md,raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md,raw/youtube/2026-09-17_aicopium-typesafe-jev.md - Vercel AI Gateway — Jev und Vercel Changelog (16.09.2026, Gateway-Listung, lokal gelesen)
- X-Post @gregisenberg (18.09.2026, 18:41 UTC; 29.661 Views / 415 Likes bei Abruf 21:31 UTC)
- Erwähnung ohne auswertbaren Inhalt: The Register (16.09.2026; Volltext nicht abrufbar, nur „Are we human?" extrahiert)