Video: https://www.youtube.com/watch?v=xQtUzjd7-As (AI Copium, 17.09.2026, 14:25). Erstmals vollstaendiges Transcript (Firecrawl) statt metadata-only. Primaerquellen: TypeSafe-Ankuendigung (Diogo Almeida, 15.09.) + Every-Test (Mike Taylor, 15.09.). raw: raw/youtube/2026-09-17_aicopium-typesafe-jev.md (neu), raw/blog/2026-09-15_typesafe-system-one-models-jev.md (neu), raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md (neu), raw/blog/2026-09-16_theregister-typesafe-jev-doom.md (neu, Negativbefund) wiki: concepts/llm/system-one-models-jev.md (neu), institutions/typesafe-ai.md (neu), institutions/every.md (neu), people/diogo-almeida.md, people/mike-taylor.md, people/dan-shipper.md, people/ai-copium.md (alle neu) + Cross-Refs in llm-model-catalog, harness-vs-standalone-chat-llm, llm-sycophancy-confabulation, agent-budget-breaker, harness-loop-graph-engineering + index.md (216. Update), log.md
43 lines
2.7 KiB
Markdown
43 lines
2.7 KiB
Markdown
---
|
||
created: 2026-09-17
|
||
updated: 2026-09-17
|
||
sources: [blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, blog/2026-09-15_typesafe-system-one-models-jev.md, youtube/2026-09-17_aicopium-typesafe-jev.md]
|
||
tags: [person, mike-taylor, every, evals, benchmark, typesafe-ai, jev]
|
||
---
|
||
|
||
# Mike Taylor
|
||
|
||
**Head of Evals bei [[../institutions/every.md|Every]]** und Autor des ersten unabhängigen Tests von **[[../concepts/llm/system-one-models-jev.md|Jev]]** (TypeSafe AI). Der Test erschien am 15.09.2026 in der Every-Publikation *Also True for Humans* unter dem Titel „Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds".
|
||
|
||
- Profil: https://every.to/@mike_2114
|
||
- Artikel: https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds
|
||
|
||
## Der Test (Kurzfassung)
|
||
|
||
| Test | Umfang | Ergebnis | Einordnung des Autors |
|
||
|------|--------|----------|----------------------|
|
||
| KI-Muster in eigener Prosa | 37 Dokumente × 21 Fragen = 777 Judgments | unter 0,7 s, geschätzt ein Viertel Cent | markierte KI-lastige Passagen korrekt; „I'd want a more thorough accuracy check before putting it into production" |
|
||
| Synthetische Passagen vs. Claude Fable 5.1 | 12 Passagen × 4 Checks ([[dan-shipper.md|Dan Shipper]]) | Jev 0,35 s / 6-von-7 Defekten; Fable 8,83 s / 7-von-7 | rund 25× schneller, ~580× günstiger, „six out of seven isn't bad for pennies on the dollar" |
|
||
|
||
Über 11 Experimente: 1.709 Judgments für unter einem Cent.
|
||
|
||
## Methodische Selbstbegrenzung
|
||
|
||
Bemerkenswert quellensauber ist, dass Taylor die Grenzen seiner eigenen Messung benennt:
|
||
|
||
- „Speed and cost alone doesn't tell us whether the judgments were good."
|
||
- „This test doesn't establish performance across entire industries or a wide range of tasks."
|
||
- „Whether you'd trust those results is another question."
|
||
- Positiv gewendet: Nutzen als **Frühwarnsystem** — „The alternative is not checking at all."
|
||
- Abschluss-Maßstab: „The ultimate test is whether acting on the answers makes the work better."
|
||
|
||
## Einordnung
|
||
|
||
Taylor liefert damit den einzigen nicht von TypeSafe stammenden Datenpunkt zu Jev — und er ist **klein**: 37 Dokumente, 12 Passagen, eine Handvoll Grundfälle. Für das Wiki ist das der Unterschied zwischen „Anbieterangabe" und „Fremdprüfung", nicht zwischen „Hype" und „belegt". Sein „Code-Linter für Wissensarbeit"-Bild ist die brauchbarste Kurzbeschreibung des Produkts.
|
||
|
||
## Verwandte Wiki-Seiten
|
||
|
||
- [[../institutions/every.md]] — Arbeitgeber und Publikation
|
||
- [[../concepts/llm/system-one-models-jev.md]] — Modell und Testlage
|
||
- [[dan-shipper.md]] — Every-CEO, führte Test 2 durch
|
||
- [[diogo-almeida.md]] — TypeSafe-Gründer, Interviewpartner
|