44 lines
2.7 KiB
Markdown
44 lines
2.7 KiB
Markdown
|
|
---
|
|||
|
|
created: 2026-09-17
|
|||
|
|
updated: 2026-09-17
|
|||
|
|
sources: [blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, blog/2026-09-15_typesafe-system-one-models-jev.md, youtube/2026-09-17_aicopium-typesafe-jev.md]
|
|||
|
|
tags: [person, mike-taylor, every, evals, benchmark, typesafe-ai, jev]
|
|||
|
|
---
|
|||
|
|
|
|||
|
|
# Mike Taylor
|
|||
|
|
|
|||
|
|
**Head of Evals bei [[../institutions/every.md|Every]]** und Autor des ersten unabhängigen Tests von **[[../concepts/llm/system-one-models-jev.md|Jev]]** (TypeSafe AI). Der Test erschien am 15.09.2026 in der Every-Publikation *Also True for Humans* unter dem Titel „Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds".
|
|||
|
|
|
|||
|
|
- Profil: https://every.to/@mike_2114
|
|||
|
|
- Artikel: https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds
|
|||
|
|
|
|||
|
|
## Der Test (Kurzfassung)
|
|||
|
|
|
|||
|
|
| Test | Umfang | Ergebnis | Einordnung des Autors |
|
|||
|
|
|------|--------|----------|----------------------|
|
|||
|
|
| KI-Muster in eigener Prosa | 37 Dokumente × 21 Fragen = 777 Judgments | unter 0,7 s, geschätzt ein Viertel Cent | markierte KI-lastige Passagen korrekt; „I'd want a more thorough accuracy check before putting it into production" |
|
|||
|
|
| Synthetische Passagen vs. Claude Fable 5.1 | 12 Passagen × 4 Checks ([[dan-shipper.md|Dan Shipper]]) | Jev 0,35 s / 6-von-7 Defekten; Fable 8,83 s / 7-von-7 | rund 25× schneller, ~580× günstiger, „six out of seven isn't bad for pennies on the dollar" |
|
|||
|
|
|
|||
|
|
Über 11 Experimente: 1.709 Judgments für unter einem Cent.
|
|||
|
|
|
|||
|
|
## Methodische Selbstbegrenzung
|
|||
|
|
|
|||
|
|
Bemerkenswert quellensauber ist, dass Taylor die Grenzen seiner eigenen Messung benennt:
|
|||
|
|
|
|||
|
|
- „Speed and cost alone doesn't tell us whether the judgments were good."
|
|||
|
|
- „This test doesn't establish performance across entire industries or a wide range of tasks."
|
|||
|
|
- „Whether you'd trust those results is another question."
|
|||
|
|
- Positiv gewendet: Nutzen als **Frühwarnsystem** — „The alternative is not checking at all."
|
|||
|
|
- Abschluss-Maßstab: „The ultimate test is whether acting on the answers makes the work better."
|
|||
|
|
|
|||
|
|
## Einordnung
|
|||
|
|
|
|||
|
|
Taylor liefert damit den einzigen nicht von TypeSafe stammenden Datenpunkt zu Jev — und er ist **klein**: 37 Dokumente, 12 Passagen, eine Handvoll Grundfälle. Für das Wiki ist das der Unterschied zwischen „Anbieterangabe" und „Fremdprüfung", nicht zwischen „Hype" und „belegt". Sein „Code-Linter für Wissensarbeit"-Bild ist die brauchbarste Kurzbeschreibung des Produkts.
|
|||
|
|
|
|||
|
|
## Verwandte Wiki-Seiten
|
|||
|
|
|
|||
|
|
- [[../institutions/every.md]] — Arbeitgeber und Publikation
|
|||
|
|
- [[../concepts/llm/system-one-models-jev.md]] — Modell und Testlage
|
|||
|
|
- [[dan-shipper.md]] — Every-CEO, führte Test 2 durch
|
|||
|
|
- [[diogo-almeida.md]] — TypeSafe-Gründer, Interviewpartner
|