knowledge-base/raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md
Hector b395bc8c52 ingest(youtube): Typesafe AI — System One Models & Jev (KI Copium 17.09.2026)
Video: https://www.youtube.com/watch?v=xQtUzjd7-As (AI Copium, 17.09.2026, 14:25).
Erstmals vollstaendiges Transcript (Firecrawl) statt metadata-only.
Primaerquellen: TypeSafe-Ankuendigung (Diogo Almeida, 15.09.) + Every-Test (Mike Taylor, 15.09.).

raw: raw/youtube/2026-09-17_aicopium-typesafe-jev.md (neu),
     raw/blog/2026-09-15_typesafe-system-one-models-jev.md (neu),
     raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md (neu),
     raw/blog/2026-09-16_theregister-typesafe-jev-doom.md (neu, Negativbefund)
wiki: concepts/llm/system-one-models-jev.md (neu),
      institutions/typesafe-ai.md (neu), institutions/every.md (neu),
      people/diogo-almeida.md, people/mike-taylor.md, people/dan-shipper.md,
      people/ai-copium.md (alle neu)
      + Cross-Refs in llm-model-catalog, harness-vs-standalone-chat-llm,
        llm-sycophancy-confabulation, agent-budget-breaker,
        harness-loop-graph-engineering
      + index.md (216. Update), log.md
2026-09-17 23:51:03 +02:00

68 lines
6.5 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
type: blog
source_url: https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds
retrieved: 2026-09-17
title: "Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds"
author: "Mike Taylor"
published: 2026-09-15
tags: [typesafe, jev, system-one-models, independent-test, evals, writing-checks, workflow-automation, calibrated-decisions]
---
# Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds
Artikel von **Mike Taylor** („head of evals at Every") in der Every-Publikation *Also True for Humans*. Metadaten: `published_at: 2026-09-15T12:00:45.016-04:00`. Abgerufen am 17.09.2026.
Untertitel: „Its new model turns fuzzy questions into probabilities fast and cheaply enough to check an AI agent's work as it goes".
## Beschreibung des Produkts
- Jev von **TypeSafe** („a new AI lab") wurde am Publikationstag gelauncht; das Modell „designed to produce structured answers that your code can use directly".
- Funktionsweise laut Artikel: Fragen in natürlicher Sprache — auch unscharfe/subjektive — liefern **Wahrscheinlichkeiten** für Ja/Nein-Antworten oder selbst definierte Kategorien.
- Beispiel: „Does this customer sound angry?" → 0.9 = geschätzte 90 % Wahrscheinlichkeit. Auch eigene Kategorien möglich („annoyed", „irritated", „offended", „furious", „enraged") mit Einzelwahrscheinlichkeiten.
- Abgrenzung zu Chatbots: Diese antworten mit blumigem Text statt mit Zahlen, was ein Programm crashen lässt, das eine Zahl zwischen 0 und 1 erwartet.
- Autor vergleicht mit **DSPy** (Python-Framework zum Programmieren von Modellen), das er historisch nutzte, um LLMs zu strukturierten Ausgaben zu zwingen: „Jev does all that work natively, which makes it insanely fast and cheap. Just how well it gets the job done is still an open question."
## Training und Motivation (TypeSafe-Angaben)
- Ziel: Confidence des Modells soll der Trefferquote entsprechen — „If it flags 100 customer messages as having a 90 percent chance of expressing anger, about 90 should express anger."
- Trainingsansatz: **Reinforcement Learning for Calibrated Decisions (RLCD)**.
- Zitat **Diogo Almeida** (TypeSafe-Cofounder) als Motivation: „The problem is the text itself."
- Hintergrund: Almeida war Mitautor des **InstructGPT-Papers (2022, arXiv:2203.02155)**, das zeigte, wie menschliches Feedback Sprachmodelle zuverlässiger Anweisungen befolgen lässt — Arbeit, die den Weg zu ChatGPT ebnete.
- Zitat aus dem TypeSafe-Manifesto: „We're building prod, not God."
- Zur System-One-Architektur: Jev wird nicht durch Token-für-Token-Generierung ausgebremst, kann mehrere Fragen parallel in Sekundenbruchteilen beantworten. Preis **$42 pro Milliarde Tokens** (statt pro Million); Output-Tokens werden nicht berechnet — „too cheap to meter", so Almeida.
## Test 1 — Texte des Autors auf KI-Muster
- Eingabe: Text aller **27 Every-Artikel** des Autors plus **10 bewusst KI-stilisierte Gegenstücke** (37 Dokumente).
- **21 Fragen** gleichzeitig über alle Artikel, abgeleitet aus dem Every-Skill zur Erkennung typischer KI-Muster (u. a. „Does the text repeat an idea without adding evidence?", „Force a symmetrical 'both sides' argument?", „Overexplain a straightforward point?").
- Ergebnis: **777 Judgments in unter 0,7 Sekunden**, geschätzte Kosten **ein Viertel Cent**.
- Screenshot im Artikel: getrennte Wahrscheinlichkeiten je KI-Schreibmuster; Zeilen = Artikel, Spalten = Muster; Werte nahe 1 = möglicher KI-Einsatz.
- Bewertung des Autors: Jev markierte korrekt Passagen, die stärker auf KI stützten, aber „I'd want a more thorough accuracy check before putting it into production". Nützlich als Frühwarnsystem: „The alternative is not checking at all."
## Test 2 — CEO-Vergleich Jev vs. Claude Fable 5.1
- Durchgeführt von **Dan Shipper** (Every-CEO): **12 synthetische Passagen** (sechs klare, sechs mit absichtlich eingebauten Problemen), **vier Schreib-Checks** je Passage (unbegründete Handlung, fehlendes Argumentationsglied, Mechanismus ersetzt das beabsichtigte Ergebnis, Claim verzerrt seine Quelle).
- Ergebnisse: Jev Median **0,35 s** pro Passage; **Fable 5.1 bei High Effort 8,83 s** — rund **25× schneller**; geschätzte Kosten rund **580× niedriger**.
- Genauigkeit: Jev fand **6 von 7** beabsichtigten Defekten, Fable **alle 7**. Wiederholt verpasst wurde dieselbe Passage: ein „shared appointment calendar that parents and staff teach together" — Fable erkannte die unbegründete Handlung, Jev übersah sie in allen drei Runs.
## Weitere Experimente
- Insgesamt **11 Experimente** (Detail-Explainer: typesafe-parallel-judgment-lab.every-4573.chatgpt.site), Beispiele:
- **Finding context:** richtige Code-Datei finden; Agent durch eine Codebase navigieren; die Firmenrichtlinie finden, die eine Frage beantwortet.
- **Checking work:** Support-Antworten benoten; riskante Aktionen eines Agenten flaggen; Texte auf KI-Tells prüfen.
- **Making decisions:** Startup-Pitches sortieren; Kunden priorisieren; Entscheidungen identifizieren, die den CEO brauchen; E-Mails priorisieren; 100 simulierte Personen fragen, welche Anzeige sie klicken würden.
- Über die Experimente: **1.709 Judgments** für geschätzt **unter einem Cent** Gesamtkosten.
- Die Szenarien wurden mit **GPT-6 Astra in Codex** erstellt; LLMs seien gut darin, Queries zu schreiben und strukturierte Ausgaben zu nutzen.
## „Ein Code-Linter für Wissensarbeit"
- Analogie des Autors: Ein Code-Linter analysiert Arbeit nahezu sofort und flaggt Syntaxfehler, Bugs, schlechte Muster, Stilinkonsistenz. Jev könnte diese Rolle für Wissensarbeit übernehmen.
- Vorschlag: Codex oder Claude bekommt Zugriff auf Jev plus Fragenliste und kann damit die eigene Arbeit gegen bekannte Fehler prüfen.
- Every baut intern ein Personal-Benchmark (510 regelmäßige Aufgaben, Beispiele, Präferenzen als Pass/Fail-Checks, u. a. „Is this PowerPoint on brand?", „Does this social media copy have a good hook?"). Wegen Speed und Kosten könnte Jev Checks **mehrfach während der Arbeit** ausführen statt einmal danach.
- Dan Shippers Test (siehe oben) wird im Artikel als „the code linter idea more directly" bezeichnet.
## Einordnung durch den Autor
- Empfehlung: „If you're building with AI, look for a judgment you already need to make repeatedly as a good first test for Jev."
- Für Einsteiger in Workflow-Automatisierung sei Kreativität nötig; Jev lohnt sich überall dort, wo unscharfe Fragen strukturierte Antworten brauchen.
- Abschluss-Maßstab: „The ultimate test is whether acting on the answers makes the work better."