Video: https://www.youtube.com/watch?v=xQtUzjd7-As (AI Copium, 17.09.2026, 14:25). Erstmals vollstaendiges Transcript (Firecrawl) statt metadata-only. Primaerquellen: TypeSafe-Ankuendigung (Diogo Almeida, 15.09.) + Every-Test (Mike Taylor, 15.09.). raw: raw/youtube/2026-09-17_aicopium-typesafe-jev.md (neu), raw/blog/2026-09-15_typesafe-system-one-models-jev.md (neu), raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md (neu), raw/blog/2026-09-16_theregister-typesafe-jev-doom.md (neu, Negativbefund) wiki: concepts/llm/system-one-models-jev.md (neu), institutions/typesafe-ai.md (neu), institutions/every.md (neu), people/diogo-almeida.md, people/mike-taylor.md, people/dan-shipper.md, people/ai-copium.md (alle neu) + Cross-Refs in llm-model-catalog, harness-vs-standalone-chat-llm, llm-sycophancy-confabulation, agent-budget-breaker, harness-loop-graph-engineering + index.md (216. Update), log.md
2.2 KiB
| created | updated | sources | tags | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-09-17 | 2026-09-17 |
|
|
Dan Shipper
CEO von ../institutions/every.md. Im Wiki erstmals greifbar als Durchführender des zweiten, direkteren Tests von ../concepts/llm/system-one-models-jev.md (15.09.2026) — dokumentiert von mike-taylor.md.
- Profil: https://every.to/@danshipper
Sein Test (Jev vs. Claude Fable 5.1)
- Design: 12 synthetische Passagen — sechs klare, sechs mit absichtlich eingebauten Problemen. Vier Schreib-Checks je Passage: unbegründete Handlung, fehlendes Argumentationsglied, Mechanismus ersetzt das beabsichtigte Ergebnis, Claim verzerrt seine Quelle.
- Ergebnis: Jev Median 0,35 s pro Passage, geschätzte Kosten ~580× niedriger; Fable 5.1 (high effort) 8,83 s, rund 25× langsamer.
- Genauigkeit: Jev fand 6 von 7 beabsichtigten Defekten, Fable alle 7. Jev verpasste in allen drei Runs dieselbe Passage — „a shared appointment calendar that parents and staff teach together", bei der unklar bleibt, was es heißt, einen Kalender zu unterrichten.
Der Test wurde von Taylor als „the code linter idea more directly" bezeichnet: nicht Text-Qualität allgemein, sondern definierte Fehlerklassen in definierten Passagen — also genau der Ablauf, den Jev im Agenten-Loop übernehmen soll.
Einordnung
Shippers Rolle hier ist die des Anwendungs-Prüfers: Er testet Jev nicht als Modell gegen Benchmarks, sondern als Prüfinstanz in einem Arbeitsablauf, den Every selbst betreibt (Personal-Benchmarks, Modell-Vergleiche). Das ist der praktisch relevanteste Datenpunkt der ganzen Ankündigung — und er fällt zwiespältig aus: Die Kostenlücke ist dramatisch, die Genauigkeitslücke klein, aber sichtbar und reproduzierbar (derselbe verpasste Defekt in drei Runs).
Verwandte Wiki-Seiten
- ../institutions/every.md — Firma
- ../concepts/llm/system-one-models-jev.md — Modell und Testlage
- mike-taylor.md — Head of Evals, dokumentierte den Test
- diogo-almeida.md — TypeSafe-Gründer