Video: https://www.youtube.com/watch?v=xQtUzjd7-As (AI Copium, 17.09.2026, 14:25). Erstmals vollstaendiges Transcript (Firecrawl) statt metadata-only. Primaerquellen: TypeSafe-Ankuendigung (Diogo Almeida, 15.09.) + Every-Test (Mike Taylor, 15.09.). raw: raw/youtube/2026-09-17_aicopium-typesafe-jev.md (neu), raw/blog/2026-09-15_typesafe-system-one-models-jev.md (neu), raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md (neu), raw/blog/2026-09-16_theregister-typesafe-jev-doom.md (neu, Negativbefund) wiki: concepts/llm/system-one-models-jev.md (neu), institutions/typesafe-ai.md (neu), institutions/every.md (neu), people/diogo-almeida.md, people/mike-taylor.md, people/dan-shipper.md, people/ai-copium.md (alle neu) + Cross-Refs in llm-model-catalog, harness-vs-standalone-chat-llm, llm-sycophancy-confabulation, agent-budget-breaker, harness-loop-graph-engineering + index.md (216. Update), log.md
31 lines
2.2 KiB
Markdown
31 lines
2.2 KiB
Markdown
---
|
||
created: 2026-09-17
|
||
updated: 2026-09-17
|
||
sources: [blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, blog/2026-09-15_typesafe-system-one-models-jev.md]
|
||
tags: [person, dan-shipper, every, benchmarks, evals, typesafe-ai, jev]
|
||
---
|
||
|
||
# Dan Shipper
|
||
|
||
**CEO von [[../institutions/every.md|Every]]**. Im Wiki erstmals greifbar als Durchführender des zweiten, direkteren Tests von **[[../concepts/llm/system-one-models-jev.md|Jev]]** (15.09.2026) — dokumentiert von [[mike-taylor.md|Mike Taylor]].
|
||
|
||
- Profil: https://every.to/@danshipper
|
||
|
||
## Sein Test (Jev vs. Claude Fable 5.1)
|
||
|
||
- **Design:** 12 synthetische Passagen — sechs klare, sechs mit absichtlich eingebauten Problemen. Vier Schreib-Checks je Passage: unbegründete Handlung, fehlendes Argumentationsglied, Mechanismus ersetzt das beabsichtigte Ergebnis, Claim verzerrt seine Quelle.
|
||
- **Ergebnis:** Jev Median **0,35 s** pro Passage, geschätzte Kosten **~580× niedriger**; **Fable 5.1 (high effort) 8,83 s**, rund 25× langsamer.
|
||
- **Genauigkeit:** Jev fand **6 von 7** beabsichtigten Defekten, Fable **alle 7**. Jev verpasste in allen drei Runs dieselbe Passage — „a shared appointment calendar that parents and staff teach together", bei der unklar bleibt, was es heißt, einen Kalender zu unterrichten.
|
||
|
||
Der Test wurde von Taylor als „the code linter idea more directly" bezeichnet: nicht Text-Qualität allgemein, sondern **definierte Fehlerklassen in definierten Passagen** — also genau der Ablauf, den Jev im Agenten-Loop übernehmen soll.
|
||
|
||
## Einordnung
|
||
|
||
Shippers Rolle hier ist die des **Anwendungs-Prüfers**: Er testet Jev nicht als Modell gegen Benchmarks, sondern als Prüfinstanz in einem Arbeitsablauf, den Every selbst betreibt (Personal-Benchmarks, Modell-Vergleiche). Das ist der praktisch relevanteste Datenpunkt der ganzen Ankündigung — und er fällt zwiespältig aus: Die Kostenlücke ist dramatisch, die Genauigkeitslücke klein, aber sichtbar und **reproduzierbar** (derselbe verpasste Defekt in drei Runs).
|
||
|
||
## Verwandte Wiki-Seiten
|
||
|
||
- [[../institutions/every.md]] — Firma
|
||
- [[../concepts/llm/system-one-models-jev.md]] — Modell und Testlage
|
||
- [[mike-taylor.md]] — Head of Evals, dokumentierte den Test
|
||
- [[diogo-almeida.md]] — TypeSafe-Gründer
|