knowledge-base/wiki/people/mike-taylor.md
Hector b395bc8c52 ingest(youtube): Typesafe AI — System One Models & Jev (KI Copium 17.09.2026)
Video: https://www.youtube.com/watch?v=xQtUzjd7-As (AI Copium, 17.09.2026, 14:25).
Erstmals vollstaendiges Transcript (Firecrawl) statt metadata-only.
Primaerquellen: TypeSafe-Ankuendigung (Diogo Almeida, 15.09.) + Every-Test (Mike Taylor, 15.09.).

raw: raw/youtube/2026-09-17_aicopium-typesafe-jev.md (neu),
     raw/blog/2026-09-15_typesafe-system-one-models-jev.md (neu),
     raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md (neu),
     raw/blog/2026-09-16_theregister-typesafe-jev-doom.md (neu, Negativbefund)
wiki: concepts/llm/system-one-models-jev.md (neu),
      institutions/typesafe-ai.md (neu), institutions/every.md (neu),
      people/diogo-almeida.md, people/mike-taylor.md, people/dan-shipper.md,
      people/ai-copium.md (alle neu)
      + Cross-Refs in llm-model-catalog, harness-vs-standalone-chat-llm,
        llm-sycophancy-confabulation, agent-budget-breaker,
        harness-loop-graph-engineering
      + index.md (216. Update), log.md
2026-09-17 23:51:03 +02:00

43 lines
2.7 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-09-17
updated: 2026-09-17
sources: [blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, blog/2026-09-15_typesafe-system-one-models-jev.md, youtube/2026-09-17_aicopium-typesafe-jev.md]
tags: [person, mike-taylor, every, evals, benchmark, typesafe-ai, jev]
---
# Mike Taylor
**Head of Evals bei [[../institutions/every.md|Every]]** und Autor des ersten unabhängigen Tests von **[[../concepts/llm/system-one-models-jev.md|Jev]]** (TypeSafe AI). Der Test erschien am 15.09.2026 in der Every-Publikation *Also True for Humans* unter dem Titel „Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds".
- Profil: https://every.to/@mike_2114
- Artikel: https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds
## Der Test (Kurzfassung)
| Test | Umfang | Ergebnis | Einordnung des Autors |
|------|--------|----------|----------------------|
| KI-Muster in eigener Prosa | 37 Dokumente × 21 Fragen = 777 Judgments | unter 0,7 s, geschätzt ein Viertel Cent | markierte KI-lastige Passagen korrekt; „I'd want a more thorough accuracy check before putting it into production" |
| Synthetische Passagen vs. Claude Fable 5.1 | 12 Passagen × 4 Checks ([[dan-shipper.md|Dan Shipper]]) | Jev 0,35 s / 6-von-7 Defekten; Fable 8,83 s / 7-von-7 | rund 25× schneller, ~580× günstiger, „six out of seven isn't bad for pennies on the dollar" |
Über 11 Experimente: 1.709 Judgments für unter einem Cent.
## Methodische Selbstbegrenzung
Bemerkenswert quellensauber ist, dass Taylor die Grenzen seiner eigenen Messung benennt:
- „Speed and cost alone doesn't tell us whether the judgments were good."
- „This test doesn't establish performance across entire industries or a wide range of tasks."
- „Whether you'd trust those results is another question."
- Positiv gewendet: Nutzen als **Frühwarnsystem** — „The alternative is not checking at all."
- Abschluss-Maßstab: „The ultimate test is whether acting on the answers makes the work better."
## Einordnung
Taylor liefert damit den einzigen nicht von TypeSafe stammenden Datenpunkt zu Jev — und er ist **klein**: 37 Dokumente, 12 Passagen, eine Handvoll Grundfälle. Für das Wiki ist das der Unterschied zwischen „Anbieterangabe" und „Fremdprüfung", nicht zwischen „Hype" und „belegt". Sein „Code-Linter für Wissensarbeit"-Bild ist die brauchbarste Kurzbeschreibung des Produkts.
## Verwandte Wiki-Seiten
- [[../institutions/every.md]] — Arbeitgeber und Publikation
- [[../concepts/llm/system-one-models-jev.md]] — Modell und Testlage
- [[dan-shipper.md]] — Every-CEO, führte Test 2 durch
- [[diogo-almeida.md]] — TypeSafe-Gründer, Interviewpartner