knowledge-base/raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md
Hector b395bc8c52 ingest(youtube): Typesafe AI — System One Models & Jev (KI Copium 17.09.2026)
Video: https://www.youtube.com/watch?v=xQtUzjd7-As (AI Copium, 17.09.2026, 14:25).
Erstmals vollstaendiges Transcript (Firecrawl) statt metadata-only.
Primaerquellen: TypeSafe-Ankuendigung (Diogo Almeida, 15.09.) + Every-Test (Mike Taylor, 15.09.).

raw: raw/youtube/2026-09-17_aicopium-typesafe-jev.md (neu),
     raw/blog/2026-09-15_typesafe-system-one-models-jev.md (neu),
     raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md (neu),
     raw/blog/2026-09-16_theregister-typesafe-jev-doom.md (neu, Negativbefund)
wiki: concepts/llm/system-one-models-jev.md (neu),
      institutions/typesafe-ai.md (neu), institutions/every.md (neu),
      people/diogo-almeida.md, people/mike-taylor.md, people/dan-shipper.md,
      people/ai-copium.md (alle neu)
      + Cross-Refs in llm-model-catalog, harness-vs-standalone-chat-llm,
        llm-sycophancy-confabulation, agent-budget-breaker,
        harness-loop-graph-engineering
      + index.md (216. Update), log.md
2026-09-17 23:51:03 +02:00

6.5 KiB
Raw Permalink Blame History

type source_url retrieved title author published tags
blog https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds 2026-09-17 Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds Mike Taylor 2026-09-15
typesafe
jev
system-one-models
independent-test
evals
writing-checks
workflow-automation
calibrated-decisions

Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds

Artikel von Mike Taylor („head of evals at Every") in der Every-Publikation Also True for Humans. Metadaten: published_at: 2026-09-15T12:00:45.016-04:00. Abgerufen am 17.09.2026.

Untertitel: „Its new model turns fuzzy questions into probabilities fast and cheaply enough to check an AI agent's work as it goes".

Beschreibung des Produkts

  • Jev von TypeSafe („a new AI lab") wurde am Publikationstag gelauncht; das Modell „designed to produce structured answers that your code can use directly".
  • Funktionsweise laut Artikel: Fragen in natürlicher Sprache — auch unscharfe/subjektive — liefern Wahrscheinlichkeiten für Ja/Nein-Antworten oder selbst definierte Kategorien.
  • Beispiel: „Does this customer sound angry?" → 0.9 = geschätzte 90 % Wahrscheinlichkeit. Auch eigene Kategorien möglich („annoyed", „irritated", „offended", „furious", „enraged") mit Einzelwahrscheinlichkeiten.
  • Abgrenzung zu Chatbots: Diese antworten mit blumigem Text statt mit Zahlen, was ein Programm crashen lässt, das eine Zahl zwischen 0 und 1 erwartet.
  • Autor vergleicht mit DSPy (Python-Framework zum Programmieren von Modellen), das er historisch nutzte, um LLMs zu strukturierten Ausgaben zu zwingen: „Jev does all that work natively, which makes it insanely fast and cheap. Just how well it gets the job done is still an open question."

Training und Motivation (TypeSafe-Angaben)

  • Ziel: Confidence des Modells soll der Trefferquote entsprechen — „If it flags 100 customer messages as having a 90 percent chance of expressing anger, about 90 should express anger."
  • Trainingsansatz: Reinforcement Learning for Calibrated Decisions (RLCD).
  • Zitat Diogo Almeida (TypeSafe-Cofounder) als Motivation: „The problem is the text itself."
  • Hintergrund: Almeida war Mitautor des InstructGPT-Papers (2022, arXiv:2203.02155), das zeigte, wie menschliches Feedback Sprachmodelle zuverlässiger Anweisungen befolgen lässt — Arbeit, die den Weg zu ChatGPT ebnete.
  • Zitat aus dem TypeSafe-Manifesto: „We're building prod, not God."
  • Zur System-One-Architektur: Jev wird nicht durch Token-für-Token-Generierung ausgebremst, kann mehrere Fragen parallel in Sekundenbruchteilen beantworten. Preis $42 pro Milliarde Tokens (statt pro Million); Output-Tokens werden nicht berechnet — „too cheap to meter", so Almeida.

Test 1 — Texte des Autors auf KI-Muster

  • Eingabe: Text aller 27 Every-Artikel des Autors plus 10 bewusst KI-stilisierte Gegenstücke (37 Dokumente).
  • 21 Fragen gleichzeitig über alle Artikel, abgeleitet aus dem Every-Skill zur Erkennung typischer KI-Muster (u. a. „Does the text repeat an idea without adding evidence?", „Force a symmetrical 'both sides' argument?", „Overexplain a straightforward point?").
  • Ergebnis: 777 Judgments in unter 0,7 Sekunden, geschätzte Kosten ein Viertel Cent.
  • Screenshot im Artikel: getrennte Wahrscheinlichkeiten je KI-Schreibmuster; Zeilen = Artikel, Spalten = Muster; Werte nahe 1 = möglicher KI-Einsatz.
  • Bewertung des Autors: Jev markierte korrekt Passagen, die stärker auf KI stützten, aber „I'd want a more thorough accuracy check before putting it into production". Nützlich als Frühwarnsystem: „The alternative is not checking at all."

Test 2 — CEO-Vergleich Jev vs. Claude Fable 5.1

  • Durchgeführt von Dan Shipper (Every-CEO): 12 synthetische Passagen (sechs klare, sechs mit absichtlich eingebauten Problemen), vier Schreib-Checks je Passage (unbegründete Handlung, fehlendes Argumentationsglied, Mechanismus ersetzt das beabsichtigte Ergebnis, Claim verzerrt seine Quelle).
  • Ergebnisse: Jev Median 0,35 s pro Passage; Fable 5.1 bei High Effort 8,83 s — rund 25× schneller; geschätzte Kosten rund 580× niedriger.
  • Genauigkeit: Jev fand 6 von 7 beabsichtigten Defekten, Fable alle 7. Wiederholt verpasst wurde dieselbe Passage: ein „shared appointment calendar that parents and staff teach together" — Fable erkannte die unbegründete Handlung, Jev übersah sie in allen drei Runs.

Weitere Experimente

  • Insgesamt 11 Experimente (Detail-Explainer: typesafe-parallel-judgment-lab.every-4573.chatgpt.site), Beispiele:
    • Finding context: richtige Code-Datei finden; Agent durch eine Codebase navigieren; die Firmenrichtlinie finden, die eine Frage beantwortet.
    • Checking work: Support-Antworten benoten; riskante Aktionen eines Agenten flaggen; Texte auf KI-Tells prüfen.
    • Making decisions: Startup-Pitches sortieren; Kunden priorisieren; Entscheidungen identifizieren, die den CEO brauchen; E-Mails priorisieren; 100 simulierte Personen fragen, welche Anzeige sie klicken würden.
  • Über die Experimente: 1.709 Judgments für geschätzt unter einem Cent Gesamtkosten.
  • Die Szenarien wurden mit GPT-6 Astra in Codex erstellt; LLMs seien gut darin, Queries zu schreiben und strukturierte Ausgaben zu nutzen.

„Ein Code-Linter für Wissensarbeit"

  • Analogie des Autors: Ein Code-Linter analysiert Arbeit nahezu sofort und flaggt Syntaxfehler, Bugs, schlechte Muster, Stilinkonsistenz. Jev könnte diese Rolle für Wissensarbeit übernehmen.
  • Vorschlag: Codex oder Claude bekommt Zugriff auf Jev plus Fragenliste und kann damit die eigene Arbeit gegen bekannte Fehler prüfen.
  • Every baut intern ein Personal-Benchmark (510 regelmäßige Aufgaben, Beispiele, Präferenzen als Pass/Fail-Checks, u. a. „Is this PowerPoint on brand?", „Does this social media copy have a good hook?"). Wegen Speed und Kosten könnte Jev Checks mehrfach während der Arbeit ausführen statt einmal danach.
  • Dan Shippers Test (siehe oben) wird im Artikel als „the code linter idea more directly" bezeichnet.

Einordnung durch den Autor

  • Empfehlung: „If you're building with AI, look for a judgment you already need to make repeatedly as a good first test for Jev."
  • Für Einsteiger in Workflow-Automatisierung sei Kreativität nötig; Jev lohnt sich überall dort, wo unscharfe Fragen strukturierte Antworten brauchen.
  • Abschluss-Maßstab: „The ultimate test is whether acting on the answers makes the work better."