Video: https://www.youtube.com/watch?v=xQtUzjd7-As (AI Copium, 17.09.2026, 14:25). Erstmals vollstaendiges Transcript (Firecrawl) statt metadata-only. Primaerquellen: TypeSafe-Ankuendigung (Diogo Almeida, 15.09.) + Every-Test (Mike Taylor, 15.09.). raw: raw/youtube/2026-09-17_aicopium-typesafe-jev.md (neu), raw/blog/2026-09-15_typesafe-system-one-models-jev.md (neu), raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md (neu), raw/blog/2026-09-16_theregister-typesafe-jev-doom.md (neu, Negativbefund) wiki: concepts/llm/system-one-models-jev.md (neu), institutions/typesafe-ai.md (neu), institutions/every.md (neu), people/diogo-almeida.md, people/mike-taylor.md, people/dan-shipper.md, people/ai-copium.md (alle neu) + Cross-Refs in llm-model-catalog, harness-vs-standalone-chat-llm, llm-sycophancy-confabulation, agent-budget-breaker, harness-loop-graph-engineering + index.md (216. Update), log.md
2.7 KiB
| created | updated | sources | tags | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-09-17 | 2026-09-17 |
|
|
Mike Taylor
Head of Evals bei ../institutions/every.md und Autor des ersten unabhängigen Tests von ../concepts/llm/system-one-models-jev.md (TypeSafe AI). Der Test erschien am 15.09.2026 in der Every-Publikation Also True for Humans unter dem Titel „Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds".
- Profil: https://every.to/@mike_2114
- Artikel: https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds
Der Test (Kurzfassung)
| Test | Umfang | Ergebnis | Einordnung des Autors |
|---|---|---|---|
| KI-Muster in eigener Prosa | 37 Dokumente × 21 Fragen = 777 Judgments | unter 0,7 s, geschätzt ein Viertel Cent | markierte KI-lastige Passagen korrekt; „I'd want a more thorough accuracy check before putting it into production" |
| Synthetische Passagen vs. Claude Fable 5.1 | 12 Passagen × 4 Checks ([[dan-shipper.md | Dan Shipper]]) | Jev 0,35 s / 6-von-7 Defekten; Fable 8,83 s / 7-von-7 |
Über 11 Experimente: 1.709 Judgments für unter einem Cent.
Methodische Selbstbegrenzung
Bemerkenswert quellensauber ist, dass Taylor die Grenzen seiner eigenen Messung benennt:
- „Speed and cost alone doesn't tell us whether the judgments were good."
- „This test doesn't establish performance across entire industries or a wide range of tasks."
- „Whether you'd trust those results is another question."
- Positiv gewendet: Nutzen als Frühwarnsystem — „The alternative is not checking at all."
- Abschluss-Maßstab: „The ultimate test is whether acting on the answers makes the work better."
Einordnung
Taylor liefert damit den einzigen nicht von TypeSafe stammenden Datenpunkt zu Jev — und er ist klein: 37 Dokumente, 12 Passagen, eine Handvoll Grundfälle. Für das Wiki ist das der Unterschied zwischen „Anbieterangabe" und „Fremdprüfung", nicht zwischen „Hype" und „belegt". Sein „Code-Linter für Wissensarbeit"-Bild ist die brauchbarste Kurzbeschreibung des Produkts.
Verwandte Wiki-Seiten
- ../institutions/every.md — Arbeitgeber und Publikation
- ../concepts/llm/system-one-models-jev.md — Modell und Testlage
- dan-shipper.md — Every-CEO, führte Test 2 durch
- diogo-almeida.md — TypeSafe-Gründer, Interviewpartner