knowledge-base/wiki/people/dan-shipper.md
Hector b395bc8c52 ingest(youtube): Typesafe AI — System One Models & Jev (KI Copium 17.09.2026)
Video: https://www.youtube.com/watch?v=xQtUzjd7-As (AI Copium, 17.09.2026, 14:25).
Erstmals vollstaendiges Transcript (Firecrawl) statt metadata-only.
Primaerquellen: TypeSafe-Ankuendigung (Diogo Almeida, 15.09.) + Every-Test (Mike Taylor, 15.09.).

raw: raw/youtube/2026-09-17_aicopium-typesafe-jev.md (neu),
     raw/blog/2026-09-15_typesafe-system-one-models-jev.md (neu),
     raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md (neu),
     raw/blog/2026-09-16_theregister-typesafe-jev-doom.md (neu, Negativbefund)
wiki: concepts/llm/system-one-models-jev.md (neu),
      institutions/typesafe-ai.md (neu), institutions/every.md (neu),
      people/diogo-almeida.md, people/mike-taylor.md, people/dan-shipper.md,
      people/ai-copium.md (alle neu)
      + Cross-Refs in llm-model-catalog, harness-vs-standalone-chat-llm,
        llm-sycophancy-confabulation, agent-budget-breaker,
        harness-loop-graph-engineering
      + index.md (216. Update), log.md
2026-09-17 23:51:03 +02:00

2.2 KiB
Raw Blame History

created updated sources tags
2026-09-17 2026-09-17
blog/2026-09-15_every-mike-taylor-jev-vibe-check.md
blog/2026-09-15_typesafe-system-one-models-jev.md
person
dan-shipper
every
benchmarks
evals
typesafe-ai
jev

Dan Shipper

CEO von ../institutions/every.md. Im Wiki erstmals greifbar als Durchführender des zweiten, direkteren Tests von ../concepts/llm/system-one-models-jev.md (15.09.2026) — dokumentiert von mike-taylor.md.

Sein Test (Jev vs. Claude Fable 5.1)

  • Design: 12 synthetische Passagen — sechs klare, sechs mit absichtlich eingebauten Problemen. Vier Schreib-Checks je Passage: unbegründete Handlung, fehlendes Argumentationsglied, Mechanismus ersetzt das beabsichtigte Ergebnis, Claim verzerrt seine Quelle.
  • Ergebnis: Jev Median 0,35 s pro Passage, geschätzte Kosten ~580× niedriger; Fable 5.1 (high effort) 8,83 s, rund 25× langsamer.
  • Genauigkeit: Jev fand 6 von 7 beabsichtigten Defekten, Fable alle 7. Jev verpasste in allen drei Runs dieselbe Passage — „a shared appointment calendar that parents and staff teach together", bei der unklar bleibt, was es heißt, einen Kalender zu unterrichten.

Der Test wurde von Taylor als „the code linter idea more directly" bezeichnet: nicht Text-Qualität allgemein, sondern definierte Fehlerklassen in definierten Passagen — also genau der Ablauf, den Jev im Agenten-Loop übernehmen soll.

Einordnung

Shippers Rolle hier ist die des Anwendungs-Prüfers: Er testet Jev nicht als Modell gegen Benchmarks, sondern als Prüfinstanz in einem Arbeitsablauf, den Every selbst betreibt (Personal-Benchmarks, Modell-Vergleiche). Das ist der praktisch relevanteste Datenpunkt der ganzen Ankündigung — und er fällt zwiespältig aus: Die Kostenlücke ist dramatisch, die Genauigkeitslücke klein, aber sichtbar und reproduzierbar (derselbe verpasste Defekt in drei Runs).

Verwandte Wiki-Seiten