knowledge-base/wiki/people/dan-shipper.md
Hector b395bc8c52 ingest(youtube): Typesafe AI — System One Models & Jev (KI Copium 17.09.2026)
Video: https://www.youtube.com/watch?v=xQtUzjd7-As (AI Copium, 17.09.2026, 14:25).
Erstmals vollstaendiges Transcript (Firecrawl) statt metadata-only.
Primaerquellen: TypeSafe-Ankuendigung (Diogo Almeida, 15.09.) + Every-Test (Mike Taylor, 15.09.).

raw: raw/youtube/2026-09-17_aicopium-typesafe-jev.md (neu),
     raw/blog/2026-09-15_typesafe-system-one-models-jev.md (neu),
     raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md (neu),
     raw/blog/2026-09-16_theregister-typesafe-jev-doom.md (neu, Negativbefund)
wiki: concepts/llm/system-one-models-jev.md (neu),
      institutions/typesafe-ai.md (neu), institutions/every.md (neu),
      people/diogo-almeida.md, people/mike-taylor.md, people/dan-shipper.md,
      people/ai-copium.md (alle neu)
      + Cross-Refs in llm-model-catalog, harness-vs-standalone-chat-llm,
        llm-sycophancy-confabulation, agent-budget-breaker,
        harness-loop-graph-engineering
      + index.md (216. Update), log.md
2026-09-17 23:51:03 +02:00

31 lines
2.2 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-09-17
updated: 2026-09-17
sources: [blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, blog/2026-09-15_typesafe-system-one-models-jev.md]
tags: [person, dan-shipper, every, benchmarks, evals, typesafe-ai, jev]
---
# Dan Shipper
**CEO von [[../institutions/every.md|Every]]**. Im Wiki erstmals greifbar als Durchführender des zweiten, direkteren Tests von **[[../concepts/llm/system-one-models-jev.md|Jev]]** (15.09.2026) — dokumentiert von [[mike-taylor.md|Mike Taylor]].
- Profil: https://every.to/@danshipper
## Sein Test (Jev vs. Claude Fable 5.1)
- **Design:** 12 synthetische Passagen — sechs klare, sechs mit absichtlich eingebauten Problemen. Vier Schreib-Checks je Passage: unbegründete Handlung, fehlendes Argumentationsglied, Mechanismus ersetzt das beabsichtigte Ergebnis, Claim verzerrt seine Quelle.
- **Ergebnis:** Jev Median **0,35 s** pro Passage, geschätzte Kosten **~580× niedriger**; **Fable 5.1 (high effort) 8,83 s**, rund 25× langsamer.
- **Genauigkeit:** Jev fand **6 von 7** beabsichtigten Defekten, Fable **alle 7**. Jev verpasste in allen drei Runs dieselbe Passage — „a shared appointment calendar that parents and staff teach together", bei der unklar bleibt, was es heißt, einen Kalender zu unterrichten.
Der Test wurde von Taylor als „the code linter idea more directly" bezeichnet: nicht Text-Qualität allgemein, sondern **definierte Fehlerklassen in definierten Passagen** — also genau der Ablauf, den Jev im Agenten-Loop übernehmen soll.
## Einordnung
Shippers Rolle hier ist die des **Anwendungs-Prüfers**: Er testet Jev nicht als Modell gegen Benchmarks, sondern als Prüfinstanz in einem Arbeitsablauf, den Every selbst betreibt (Personal-Benchmarks, Modell-Vergleiche). Das ist der praktisch relevanteste Datenpunkt der ganzen Ankündigung — und er fällt zwiespältig aus: Die Kostenlücke ist dramatisch, die Genauigkeitslücke klein, aber sichtbar und **reproduzierbar** (derselbe verpasste Defekt in drei Runs).
## Verwandte Wiki-Seiten
- [[../institutions/every.md]] — Firma
- [[../concepts/llm/system-one-models-jev.md]] — Modell und Testlage
- [[mike-taylor.md]] — Head of Evals, dokumentierte den Test
- [[diogo-almeida.md]] — TypeSafe-Gründer