--- created: 2026-09-17 updated: 2026-09-17 sources: [blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, blog/2026-09-15_typesafe-system-one-models-jev.md, youtube/2026-09-17_aicopium-typesafe-jev.md] tags: [person, mike-taylor, every, evals, benchmark, typesafe-ai, jev] --- # Mike Taylor **Head of Evals bei [[../institutions/every.md|Every]]** und Autor des ersten unabhängigen Tests von **[[../concepts/llm/system-one-models-jev.md|Jev]]** (TypeSafe AI). Der Test erschien am 15.09.2026 in der Every-Publikation *Also True for Humans* unter dem Titel „Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds". - Profil: https://every.to/@mike_2114 - Artikel: https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds ## Der Test (Kurzfassung) | Test | Umfang | Ergebnis | Einordnung des Autors | |------|--------|----------|----------------------| | KI-Muster in eigener Prosa | 37 Dokumente × 21 Fragen = 777 Judgments | unter 0,7 s, geschätzt ein Viertel Cent | markierte KI-lastige Passagen korrekt; „I'd want a more thorough accuracy check before putting it into production" | | Synthetische Passagen vs. Claude Fable 5.1 | 12 Passagen × 4 Checks ([[dan-shipper.md|Dan Shipper]]) | Jev 0,35 s / 6-von-7 Defekten; Fable 8,83 s / 7-von-7 | rund 25× schneller, ~580× günstiger, „six out of seven isn't bad for pennies on the dollar" | Über 11 Experimente: 1.709 Judgments für unter einem Cent. ## Methodische Selbstbegrenzung Bemerkenswert quellensauber ist, dass Taylor die Grenzen seiner eigenen Messung benennt: - „Speed and cost alone doesn't tell us whether the judgments were good." - „This test doesn't establish performance across entire industries or a wide range of tasks." - „Whether you'd trust those results is another question." - Positiv gewendet: Nutzen als **Frühwarnsystem** — „The alternative is not checking at all." - Abschluss-Maßstab: „The ultimate test is whether acting on the answers makes the work better." ## Einordnung Taylor liefert damit den einzigen nicht von TypeSafe stammenden Datenpunkt zu Jev — und er ist **klein**: 37 Dokumente, 12 Passagen, eine Handvoll Grundfälle. Für das Wiki ist das der Unterschied zwischen „Anbieterangabe" und „Fremdprüfung", nicht zwischen „Hype" und „belegt". Sein „Code-Linter für Wissensarbeit"-Bild ist die brauchbarste Kurzbeschreibung des Produkts. ## Verwandte Wiki-Seiten - [[../institutions/every.md]] — Arbeitgeber und Publikation - [[../concepts/llm/system-one-models-jev.md]] — Modell und Testlage - [[dan-shipper.md]] — Every-CEO, führte Test 2 durch - [[diogo-almeida.md]] — TypeSafe-Gründer, Interviewpartner