Video: https://www.youtube.com/watch?v=xQtUzjd7-As (AI Copium, 17.09.2026, 14:25). Erstmals vollstaendiges Transcript (Firecrawl) statt metadata-only. Primaerquellen: TypeSafe-Ankuendigung (Diogo Almeida, 15.09.) + Every-Test (Mike Taylor, 15.09.). raw: raw/youtube/2026-09-17_aicopium-typesafe-jev.md (neu), raw/blog/2026-09-15_typesafe-system-one-models-jev.md (neu), raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md (neu), raw/blog/2026-09-16_theregister-typesafe-jev-doom.md (neu, Negativbefund) wiki: concepts/llm/system-one-models-jev.md (neu), institutions/typesafe-ai.md (neu), institutions/every.md (neu), people/diogo-almeida.md, people/mike-taylor.md, people/dan-shipper.md, people/ai-copium.md (alle neu) + Cross-Refs in llm-model-catalog, harness-vs-standalone-chat-llm, llm-sycophancy-confabulation, agent-budget-breaker, harness-loop-graph-engineering + index.md (216. Update), log.md
123 lines
11 KiB
Markdown
123 lines
11 KiB
Markdown
---
|
||
created: 2026-09-17
|
||
updated: 2026-09-17
|
||
sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md, blog/2026-09-16_theregister-typesafe-jev-doom.md]
|
||
tags: [concept, llm, typesafe, jev, system-one-models, rlcd, structured-outputs, calibrated-decisions, parallel-sampling, inference-cost, automation, harness]
|
||
---
|
||
|
||
# System One Models & Jev (TypeSafe AI)
|
||
|
||
> **Quelle:** TypeSafe-Ankündigungsartikel von Diogo Almeida (15.09.2026, https://typesafe.ai/blog/introducing-system-one-models-and-jev) + unabhängiger Test von Mike Taylor in Every (15.09.2026) + Video-Zusammenfassung von AI Copium (17.09.2026). Primärquelle = Anbieter; die unabhängige Prüfung ist ein Einzeltest mit kleinem Stichprobenumfang.
|
||
|
||
## Kernidee
|
||
|
||
**Jev** ist das erste Modell einer neuen Klasse, die TypeSafe **[[../../institutions/typesafe-ai.md|System One Models]]** nennt: keine Textgenerierung, sondern **typisierte probabilistische Entscheidungen** für Software. Anbieterselbstbeschreibung: „unstructured state in, typed probabilistic decisions out" — und „a frontier-intelligence function call".
|
||
|
||
Der Ansatz setzt auf **strukturierte Ausgaben mit vorab definierten Optionen** statt Strings, auf **paralleles Sampling** statt autoregressiver Token-Generierung und auf **kalibrierte Wahrscheinlichkeiten** statt überkonfidenter Fließtexte.
|
||
|
||
## Drei Konstruktions-Entscheidungen
|
||
|
||
| Achse | Bestehende LLMs | Jev |
|
||
|-------|-----------------|-----|
|
||
| Optimierung | RLHF / RLVR — menschliche Präferenz bzw. verifizierbare Rewards | **RLCD** (Reinforcement Learning for Calibrated Decisions) |
|
||
| Ausgabe | Strings — müssen geparst und validiert werden | **Type-safe structured values**; Ausgabeoptionen und Struktur vorab definiert |
|
||
| Sampling | sequenziell, ein Token nach dem anderen | **parallel**, alle Urteile in einer Query |
|
||
|
||
Zielgröße laut Anbieter: Werte nahe 1 sollen häufiger zutreffen; „If it flags 100 customer messages as having a 90 percent chance of expressing anger, about 90 should express anger" ([[../../people/mike-taylor.md|Mike Taylor]]).
|
||
|
||
## Anbieterangaben zu Kosten und Geschwindigkeit
|
||
|
||
| Kennzahl | TypeSafe-Angabe |
|
||
|----------|-----------------|
|
||
| End-to-end-Latenz | **70–500 ms** (LLMs laut Artikel 3–329 s) |
|
||
| Speedup | 40×–200× „for System One shaped queries"; Homepage-Claim **193,6× schneller** |
|
||
| Kosten-Input | **$0,042 / MTok** = $42 pro Milliarde Tokens |
|
||
| Kosten-Output | **$0** („too cheap to meter", da keine Token generiert werden) |
|
||
| Kosten-CLAIM Homepage | **444,6× günstiger** |
|
||
| Genauigkeit | „near state-of-the-art" auf den eigenen vier Workflows |
|
||
|
||
⚠️ Die im Videotitel/-beschreibung und im Kapitelmarken-Layout kursierende **„400x"**-Zahl findet sich in der Primärquelle nicht; dort stehen **193,6× / 444,6×**, und der Artikel ordnet selbst ein: „we expect that these are on the higher end of real world gains".
|
||
|
||
## Was „keine Halluzination" heißt — und was nicht
|
||
|
||
TypeSafe schreibt, Jev könne nicht halluzinieren; gemeint ist **Type-Safety**: Das Modell kann kein Feld mit falschem Typ füllen und keine Option erfinden, die nicht im Schema steht. Das ist laut Anbieter mathematisch garantiert („Schema matching is guaranteed").
|
||
|
||
Nicht gemeint ist semantische Korrektheit:
|
||
- Jev kann die **falsche Option wählen** — ein Rückerstattungsantrag kann „approve" erhalten, obwohl „reject" richtig wäre ([[../../people/mike-taylor.md|Taylor]] / AI Copium).
|
||
- Das ist keine neue Eigenschaft von Jev: LLMs lassen sich ebenfalls auf Formate zwingen (z. B. OpenAI Structured Outputs, DSPy).
|
||
|
||
**Merksatz fürs Wiki:** Type-Safety ist eine Formatgarantie, keine Wahrheitsgarantie. Der verwandte Mechanismus — Gate vs. probabilistische Generierung — steht in [[harness-vs-standalone-chat-llm.md]].
|
||
|
||
## Unabhängiger Test (Every, 15.09.2026)
|
||
|
||
Zwei Messungen, beide von **[[../../people/mike-taylor.md|Mike Taylor]]** (Head of Evals, [[../../institutions/every.md|Every]]):
|
||
|
||
**Test 1 — 37 Dokumente × 21 Fragen:**
|
||
- 27 eigene Every-Artikel + 10 bewusst KI-stilisierte Gegenstücke
|
||
- **777 Judgments in unter 0,7 Sekunden**, geschätzt **ein Viertel Cent**
|
||
- Eigenbewertung des Testerstellers: markierte KI-lastige Passagen korrekt, aber „I'd want a more thorough accuracy check before putting it into production"
|
||
|
||
**Test 2 — 12 synthetische Passagen, 4 Schreib-Checks ([[../../people/dan-shipper.md|Dan Shipper]]):**
|
||
|
||
| | Jev | Claude Fable 5.1 (high effort) |
|
||
|---|---|---|
|
||
| Median pro Passage | **0,35 s** | **8,83 s** |
|
||
| Geschwindigkeit | ~25× schneller | — |
|
||
| Kosten | ~580× niedriger | — |
|
||
| Defekte gefunden | **6 von 7** | **7 von 7** |
|
||
|
||
Jev verpasste in allen drei Runs dieselbe Passage („a shared appointment calendar that parents and staff teach together"). Über 11 Experimente: 1.709 Judgments für unter einem Cent.
|
||
|
||
**Was der Test nicht zeigt:** Breite über Branchen und Aufgabentypen. Der Autor sagt es selbst; die Zahl der Grundfälle ist einstellig.
|
||
|
||
## Quellenkritik der Benchmarks
|
||
|
||
Die eigenen Workflow-Evals messen **Übereinstimmung mit Referenzantworten** (Durchschnitt aus GPT-6 Astra und Fable 5.1), nicht unabhängig verifizierte Korrektheit. TypeSafe legt die Bias-Richtungen selbst offen:
|
||
|
||
- Referenzwahl „biases answers towards OpenAI and Anthropic's models" → eigene Leistung gegenüber DeepSeek vermutlich unterschätzt.
|
||
- Workflows „made by individuals on our model capabilities team, so some bias could exist" — aber nicht in der Trainingsverteilung.
|
||
- Die Vergleichs-LLMs liefen über einen eigenen Wrapper, der sie zu Wahrscheinlichkeiten zwingt: laut Artikel langsamer und teurer als freie Entscheidungen — das **vergrößert** den gemessenen Abstand.
|
||
- Die „0 %" in den Halluzinations-Plots sind **nicht empirisch**, sondern aus der Schema-Garantie abgeleitet.
|
||
- LLM-Vergleichszahlen stammen von OpenRouter (Routing-Bias möglich).
|
||
- Preis: „We can't prove it isn't subsidized; we'll need the long-term to prove the sustainability of our pricing."
|
||
|
||
## Einordnung
|
||
|
||
- **Neue Achse statt neuer Frontier.** Jev konkurriert nicht mit Chat- und Coding-Frontier-Modellen, sondern mit der Rolle, die bisher DSPy-Pipelines, Klassifikatoren und Guardrail-Modelle gespielt haben — nur als Foundation-Model. Das ist der eigentliche Beitrag: eine eigene Produktkategorie „Modell für Maschinen" (so auch die Presse-Formulierung „model for machines").
|
||
- **Preis als Freigrenze für Häufigkeit.** Die relevante Verschiebung ist nicht „billiger pro Call", sondern „Checks sind so billig, dass man sie während der Arbeit und nicht danach laufen lässt" — 1.709 Urteile für unter einem Cent. Praktische Konsequenz: dauerhafte Verifikation statt Stichprobe am Ende, vgl. [[../agents/agent-budget-breaker.md]] (Kostendeckel als Voraussetzung unbewachter Schleifen).
|
||
- **Der Linter-Vergleich ist stark.** „Ein Code-Linter für Wissensarbeit" beschreibt den Nutzen präziser als jede Benchmark-Zahl: schnell, billig, unvollständig genau, aber besser als gar keine Prüfung. Genau das ist auch seine Grenze — ein Linter ersetzt keinen Test.
|
||
- **Verifikation wird zur eigenen Fehlerquelle.** Wenn Prüf-Urteile von einem Modell kommen, das kalibriert, aber nicht korrekt ist, wandert die Fehlerquelle in das Gate. Kalibrierung ist die entscheidende Eigenschaft: Nur wenn 0,9 wirklich 90 % Trefferquote bedeutet, kann Code sinnvoll auf Wahrscheinlichkeiten branchen.
|
||
- **Latentes Reasoning als Nebenlinie.** Das Video zieht die Parallele zu OpenAIs *recurrent depth / looped transformers* — Reasoning im latenten Raum statt ausgeschriebener Gedankenkette — und nennt die Safety-Warnung, dass das die Überwachung erschwert. Das Video räumt selbst ein: „we don't know that Jev works the same way internally." Hier ist die Parallele Deutung, kein Befund.
|
||
- **Namensgebung als These:** „Jev" nach **William Stanley Jevons** — Jevons-Paradox: sinkende Kosten erhöhen den Verbrauch. Der Name ist das Programmm: Intelligenz wird billiger, also wird mehr davon verbraucht.
|
||
- Bezug zur Harness-Deutung unseres Wikis: Jev besetzt **weder Modell-Prompting noch Orchestrierung**, sondern die Gate-Schicht im Ablauf — vgl. [[harness-vs-standalone-chat-llm.md]] („Grounding-Tools verhindern keine probabilistische Generierung — nur Gates tun das") und [[../agents/harness-loop-graph-engineering.md]].
|
||
|
||
## Offene Punkte
|
||
|
||
- ⚠️ **Alle Leistungszahlen sind Anbieterangaben** außer dem einen Every-Einzeltest (37 Dokumente, 12 Passagen, 1.709 Judgments). Keine peer-reviewte Evaluation, keine breite Fremdprüfung.
|
||
- ⚠️ Kein unabhängiger Nachbau der vier Workflows; die Evals-Seite (https://evals.typesafe.ai/) wurde nicht ausgewertet.
|
||
- ⚠️ Architektur, Trainingsverfahren und Datenherkunft von Jev sind nicht veröffentlicht — ob paralleles Sampling die genannten Latenzen erklärt, ist nicht überprüfbar.
|
||
- Offen: ob der Preis ($42/Mrd. Input, $0 Output) nachhaltig ist — der Anbieter räumt Subvention nicht ausgeschlossen aus.
|
||
- Offen: Fehlerkosten bei falscher, aber kalibrierter Entscheidung — der Every-Test liefert dazu nur ein Datenpaar (6/7 vs. 7/7).
|
||
- [[../../institutions/typesafe-ai.md|TypeSafe]] hat drei Gründer (Almeida, Sheng, Gafni), Sitzt in San Francisco und ist **nicht** mit OpenAI verbunden — Almeida ist ehemaliger OpenAI-/Google-Brain-Forscher. Die Video-/Presse-Rahmung „a ChatGPT researcher" ist Zuschreibung, keine Firmenbeziehung.
|
||
|
||
## Verwandte Wiki-Seiten
|
||
|
||
- [[../../institutions/typesafe-ai.md]] — Firma, Team, Manifesto
|
||
- [[../../people/diogo-almeida.md]] — Gründer, InstructGPT-Mitautor
|
||
- [[../../people/mike-taylor.md]] — Autor des unabhängigen Tests
|
||
- [[../../people/dan-shipper.md]] — Every-CEO, Test 2
|
||
- [[../../institutions/every.md]] — Publikation des Fremdtests
|
||
- [[../../people/ai-copium.md]] — Kanal, der das Video gepostet hat
|
||
- [[harness-vs-standalone-chat-llm.md]] — Gate vs. Generierung
|
||
- [[llm-model-catalog.md]] — Modellkatalog
|
||
- [[../agents/agent-budget-breaker.md]] — Kostendeckel für unbewachte Schleifen
|
||
- [[../agents/harness-loop-graph-engineering.md]] — Harness-Ebene
|
||
- [[llm-sycophancy-confabulation.md]] — Fehlerklassen jenseits von Halluzination
|
||
|
||
## Quellen
|
||
|
||
- [TypeSafe: Introducing System One Models & Jev](https://typesafe.ai/blog/introducing-system-one-models-and-jev) (15.09.2026, abgerufen 17.09.2026)
|
||
- [Every: Mini-Vibe Check (Mike Taylor)](https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds) (15.09.2026)
|
||
- [AI Copium: „A ChatGPT Researcher Just Dropped a MASSIVE AI Breakthrough…"](https://www.youtube.com/watch?v=xQtUzjd7-As) (17.09.2026, 14:25, vollständiges Transcript)
|
||
- Raw: `raw/blog/2026-09-15_typesafe-system-one-models-jev.md`, `raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md`, `raw/youtube/2026-09-17_aicopium-typesafe-jev.md`
|
||
- Erwähnung ohne auswertbaren Inhalt: [The Register](https://www.theregister.com/ai-and-ml/2026/09/16/typesafe-ai-debuts-model-for-machines-that-plays-doom/5296711) (16.09.2026; Volltext nicht abrufbar, nur „Are we human?" extrahiert)
|