knowledge-base/wiki/people/mike-taylor.md
Hector b395bc8c52 ingest(youtube): Typesafe AI — System One Models & Jev (KI Copium 17.09.2026)
Video: https://www.youtube.com/watch?v=xQtUzjd7-As (AI Copium, 17.09.2026, 14:25).
Erstmals vollstaendiges Transcript (Firecrawl) statt metadata-only.
Primaerquellen: TypeSafe-Ankuendigung (Diogo Almeida, 15.09.) + Every-Test (Mike Taylor, 15.09.).

raw: raw/youtube/2026-09-17_aicopium-typesafe-jev.md (neu),
     raw/blog/2026-09-15_typesafe-system-one-models-jev.md (neu),
     raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md (neu),
     raw/blog/2026-09-16_theregister-typesafe-jev-doom.md (neu, Negativbefund)
wiki: concepts/llm/system-one-models-jev.md (neu),
      institutions/typesafe-ai.md (neu), institutions/every.md (neu),
      people/diogo-almeida.md, people/mike-taylor.md, people/dan-shipper.md,
      people/ai-copium.md (alle neu)
      + Cross-Refs in llm-model-catalog, harness-vs-standalone-chat-llm,
        llm-sycophancy-confabulation, agent-budget-breaker,
        harness-loop-graph-engineering
      + index.md (216. Update), log.md
2026-09-17 23:51:03 +02:00

2.7 KiB
Raw Blame History

created updated sources tags
2026-09-17 2026-09-17
blog/2026-09-15_every-mike-taylor-jev-vibe-check.md
blog/2026-09-15_typesafe-system-one-models-jev.md
youtube/2026-09-17_aicopium-typesafe-jev.md
person
mike-taylor
every
evals
benchmark
typesafe-ai
jev

Mike Taylor

Head of Evals bei ../institutions/every.md und Autor des ersten unabhängigen Tests von ../concepts/llm/system-one-models-jev.md (TypeSafe AI). Der Test erschien am 15.09.2026 in der Every-Publikation Also True for Humans unter dem Titel „Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds".

Der Test (Kurzfassung)

Test Umfang Ergebnis Einordnung des Autors
KI-Muster in eigener Prosa 37 Dokumente × 21 Fragen = 777 Judgments unter 0,7 s, geschätzt ein Viertel Cent markierte KI-lastige Passagen korrekt; „I'd want a more thorough accuracy check before putting it into production"
Synthetische Passagen vs. Claude Fable 5.1 12 Passagen × 4 Checks ([[dan-shipper.md Dan Shipper]]) Jev 0,35 s / 6-von-7 Defekten; Fable 8,83 s / 7-von-7

Über 11 Experimente: 1.709 Judgments für unter einem Cent.

Methodische Selbstbegrenzung

Bemerkenswert quellensauber ist, dass Taylor die Grenzen seiner eigenen Messung benennt:

  • „Speed and cost alone doesn't tell us whether the judgments were good."
  • „This test doesn't establish performance across entire industries or a wide range of tasks."
  • „Whether you'd trust those results is another question."
  • Positiv gewendet: Nutzen als Frühwarnsystem — „The alternative is not checking at all."
  • Abschluss-Maßstab: „The ultimate test is whether acting on the answers makes the work better."

Einordnung

Taylor liefert damit den einzigen nicht von TypeSafe stammenden Datenpunkt zu Jev — und er ist klein: 37 Dokumente, 12 Passagen, eine Handvoll Grundfälle. Für das Wiki ist das der Unterschied zwischen „Anbieterangabe" und „Fremdprüfung", nicht zwischen „Hype" und „belegt". Sein „Code-Linter für Wissensarbeit"-Bild ist die brauchbarste Kurzbeschreibung des Produkts.

Verwandte Wiki-Seiten