69 lines
6.5 KiB
Markdown
69 lines
6.5 KiB
Markdown
|
|
---
|
|||
|
|
type: blog
|
|||
|
|
source_url: https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds
|
|||
|
|
retrieved: 2026-09-17
|
|||
|
|
title: "Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds"
|
|||
|
|
author: "Mike Taylor"
|
|||
|
|
published: 2026-09-15
|
|||
|
|
tags: [typesafe, jev, system-one-models, independent-test, evals, writing-checks, workflow-automation, calibrated-decisions]
|
|||
|
|
---
|
|||
|
|
|
|||
|
|
# Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds
|
|||
|
|
|
|||
|
|
Artikel von **Mike Taylor** („head of evals at Every") in der Every-Publikation *Also True for Humans*. Metadaten: `published_at: 2026-09-15T12:00:45.016-04:00`. Abgerufen am 17.09.2026.
|
|||
|
|
|
|||
|
|
Untertitel: „Its new model turns fuzzy questions into probabilities fast and cheaply enough to check an AI agent's work as it goes".
|
|||
|
|
|
|||
|
|
## Beschreibung des Produkts
|
|||
|
|
|
|||
|
|
- Jev von **TypeSafe** („a new AI lab") wurde am Publikationstag gelauncht; das Modell „designed to produce structured answers that your code can use directly".
|
|||
|
|
- Funktionsweise laut Artikel: Fragen in natürlicher Sprache — auch unscharfe/subjektive — liefern **Wahrscheinlichkeiten** für Ja/Nein-Antworten oder selbst definierte Kategorien.
|
|||
|
|
- Beispiel: „Does this customer sound angry?" → 0.9 = geschätzte 90 % Wahrscheinlichkeit. Auch eigene Kategorien möglich („annoyed", „irritated", „offended", „furious", „enraged") mit Einzelwahrscheinlichkeiten.
|
|||
|
|
- Abgrenzung zu Chatbots: Diese antworten mit blumigem Text statt mit Zahlen, was ein Programm crashen lässt, das eine Zahl zwischen 0 und 1 erwartet.
|
|||
|
|
- Autor vergleicht mit **DSPy** (Python-Framework zum Programmieren von Modellen), das er historisch nutzte, um LLMs zu strukturierten Ausgaben zu zwingen: „Jev does all that work natively, which makes it insanely fast and cheap. Just how well it gets the job done is still an open question."
|
|||
|
|
|
|||
|
|
## Training und Motivation (TypeSafe-Angaben)
|
|||
|
|
|
|||
|
|
- Ziel: Confidence des Modells soll der Trefferquote entsprechen — „If it flags 100 customer messages as having a 90 percent chance of expressing anger, about 90 should express anger."
|
|||
|
|
- Trainingsansatz: **Reinforcement Learning for Calibrated Decisions (RLCD)**.
|
|||
|
|
- Zitat **Diogo Almeida** (TypeSafe-Cofounder) als Motivation: „The problem is the text itself."
|
|||
|
|
- Hintergrund: Almeida war Mitautor des **InstructGPT-Papers (2022, arXiv:2203.02155)**, das zeigte, wie menschliches Feedback Sprachmodelle zuverlässiger Anweisungen befolgen lässt — Arbeit, die den Weg zu ChatGPT ebnete.
|
|||
|
|
- Zitat aus dem TypeSafe-Manifesto: „We're building prod, not God."
|
|||
|
|
- Zur System-One-Architektur: Jev wird nicht durch Token-für-Token-Generierung ausgebremst, kann mehrere Fragen parallel in Sekundenbruchteilen beantworten. Preis **$42 pro Milliarde Tokens** (statt pro Million); Output-Tokens werden nicht berechnet — „too cheap to meter", so Almeida.
|
|||
|
|
|
|||
|
|
## Test 1 — Texte des Autors auf KI-Muster
|
|||
|
|
|
|||
|
|
- Eingabe: Text aller **27 Every-Artikel** des Autors plus **10 bewusst KI-stilisierte Gegenstücke** (37 Dokumente).
|
|||
|
|
- **21 Fragen** gleichzeitig über alle Artikel, abgeleitet aus dem Every-Skill zur Erkennung typischer KI-Muster (u. a. „Does the text repeat an idea without adding evidence?", „Force a symmetrical 'both sides' argument?", „Overexplain a straightforward point?").
|
|||
|
|
- Ergebnis: **777 Judgments in unter 0,7 Sekunden**, geschätzte Kosten **ein Viertel Cent**.
|
|||
|
|
- Screenshot im Artikel: getrennte Wahrscheinlichkeiten je KI-Schreibmuster; Zeilen = Artikel, Spalten = Muster; Werte nahe 1 = möglicher KI-Einsatz.
|
|||
|
|
- Bewertung des Autors: Jev markierte korrekt Passagen, die stärker auf KI stützten, aber „I'd want a more thorough accuracy check before putting it into production". Nützlich als Frühwarnsystem: „The alternative is not checking at all."
|
|||
|
|
|
|||
|
|
## Test 2 — CEO-Vergleich Jev vs. Claude Fable 5.1
|
|||
|
|
|
|||
|
|
- Durchgeführt von **Dan Shipper** (Every-CEO): **12 synthetische Passagen** (sechs klare, sechs mit absichtlich eingebauten Problemen), **vier Schreib-Checks** je Passage (unbegründete Handlung, fehlendes Argumentationsglied, Mechanismus ersetzt das beabsichtigte Ergebnis, Claim verzerrt seine Quelle).
|
|||
|
|
- Ergebnisse: Jev Median **0,35 s** pro Passage; **Fable 5.1 bei High Effort 8,83 s** — rund **25× schneller**; geschätzte Kosten rund **580× niedriger**.
|
|||
|
|
- Genauigkeit: Jev fand **6 von 7** beabsichtigten Defekten, Fable **alle 7**. Wiederholt verpasst wurde dieselbe Passage: ein „shared appointment calendar that parents and staff teach together" — Fable erkannte die unbegründete Handlung, Jev übersah sie in allen drei Runs.
|
|||
|
|
|
|||
|
|
## Weitere Experimente
|
|||
|
|
|
|||
|
|
- Insgesamt **11 Experimente** (Detail-Explainer: typesafe-parallel-judgment-lab.every-4573.chatgpt.site), Beispiele:
|
|||
|
|
- **Finding context:** richtige Code-Datei finden; Agent durch eine Codebase navigieren; die Firmenrichtlinie finden, die eine Frage beantwortet.
|
|||
|
|
- **Checking work:** Support-Antworten benoten; riskante Aktionen eines Agenten flaggen; Texte auf KI-Tells prüfen.
|
|||
|
|
- **Making decisions:** Startup-Pitches sortieren; Kunden priorisieren; Entscheidungen identifizieren, die den CEO brauchen; E-Mails priorisieren; 100 simulierte Personen fragen, welche Anzeige sie klicken würden.
|
|||
|
|
- Über die Experimente: **1.709 Judgments** für geschätzt **unter einem Cent** Gesamtkosten.
|
|||
|
|
- Die Szenarien wurden mit **GPT-6 Astra in Codex** erstellt; LLMs seien gut darin, Queries zu schreiben und strukturierte Ausgaben zu nutzen.
|
|||
|
|
|
|||
|
|
## „Ein Code-Linter für Wissensarbeit"
|
|||
|
|
|
|||
|
|
- Analogie des Autors: Ein Code-Linter analysiert Arbeit nahezu sofort und flaggt Syntaxfehler, Bugs, schlechte Muster, Stilinkonsistenz. Jev könnte diese Rolle für Wissensarbeit übernehmen.
|
|||
|
|
- Vorschlag: Codex oder Claude bekommt Zugriff auf Jev plus Fragenliste und kann damit die eigene Arbeit gegen bekannte Fehler prüfen.
|
|||
|
|
- Every baut intern ein Personal-Benchmark (5–10 regelmäßige Aufgaben, Beispiele, Präferenzen als Pass/Fail-Checks, u. a. „Is this PowerPoint on brand?", „Does this social media copy have a good hook?"). Wegen Speed und Kosten könnte Jev Checks **mehrfach während der Arbeit** ausführen statt einmal danach.
|
|||
|
|
- Dan Shippers Test (siehe oben) wird im Artikel als „the code linter idea more directly" bezeichnet.
|
|||
|
|
|
|||
|
|
## Einordnung durch den Autor
|
|||
|
|
|
|||
|
|
- Empfehlung: „If you're building with AI, look for a judgment you already need to make repeatedly as a good first test for Jev."
|
|||
|
|
- Für Einsteiger in Workflow-Automatisierung sei Kreativität nötig; Jev lohnt sich überall dort, wo unscharfe Fragen strukturierte Antworten brauchen.
|
|||
|
|
- Abschluss-Maßstab: „The ultimate test is whether acting on the answers makes the work better."
|