32 lines
2.2 KiB
Markdown
32 lines
2.2 KiB
Markdown
|
|
---
|
|||
|
|
created: 2026-09-17
|
|||
|
|
updated: 2026-09-17
|
|||
|
|
sources: [blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, blog/2026-09-15_typesafe-system-one-models-jev.md]
|
|||
|
|
tags: [person, dan-shipper, every, benchmarks, evals, typesafe-ai, jev]
|
|||
|
|
---
|
|||
|
|
|
|||
|
|
# Dan Shipper
|
|||
|
|
|
|||
|
|
**CEO von [[../institutions/every.md|Every]]**. Im Wiki erstmals greifbar als Durchführender des zweiten, direkteren Tests von **[[../concepts/llm/system-one-models-jev.md|Jev]]** (15.09.2026) — dokumentiert von [[mike-taylor.md|Mike Taylor]].
|
|||
|
|
|
|||
|
|
- Profil: https://every.to/@danshipper
|
|||
|
|
|
|||
|
|
## Sein Test (Jev vs. Claude Fable 5.1)
|
|||
|
|
|
|||
|
|
- **Design:** 12 synthetische Passagen — sechs klare, sechs mit absichtlich eingebauten Problemen. Vier Schreib-Checks je Passage: unbegründete Handlung, fehlendes Argumentationsglied, Mechanismus ersetzt das beabsichtigte Ergebnis, Claim verzerrt seine Quelle.
|
|||
|
|
- **Ergebnis:** Jev Median **0,35 s** pro Passage, geschätzte Kosten **~580× niedriger**; **Fable 5.1 (high effort) 8,83 s**, rund 25× langsamer.
|
|||
|
|
- **Genauigkeit:** Jev fand **6 von 7** beabsichtigten Defekten, Fable **alle 7**. Jev verpasste in allen drei Runs dieselbe Passage — „a shared appointment calendar that parents and staff teach together", bei der unklar bleibt, was es heißt, einen Kalender zu unterrichten.
|
|||
|
|
|
|||
|
|
Der Test wurde von Taylor als „the code linter idea more directly" bezeichnet: nicht Text-Qualität allgemein, sondern **definierte Fehlerklassen in definierten Passagen** — also genau der Ablauf, den Jev im Agenten-Loop übernehmen soll.
|
|||
|
|
|
|||
|
|
## Einordnung
|
|||
|
|
|
|||
|
|
Shippers Rolle hier ist die des **Anwendungs-Prüfers**: Er testet Jev nicht als Modell gegen Benchmarks, sondern als Prüfinstanz in einem Arbeitsablauf, den Every selbst betreibt (Personal-Benchmarks, Modell-Vergleiche). Das ist der praktisch relevanteste Datenpunkt der ganzen Ankündigung — und er fällt zwiespältig aus: Die Kostenlücke ist dramatisch, die Genauigkeitslücke klein, aber sichtbar und **reproduzierbar** (derselbe verpasste Defekt in drei Runs).
|
|||
|
|
|
|||
|
|
## Verwandte Wiki-Seiten
|
|||
|
|
|
|||
|
|
- [[../institutions/every.md]] — Firma
|
|||
|
|
- [[../concepts/llm/system-one-models-jev.md]] — Modell und Testlage
|
|||
|
|
- [[mike-taylor.md]] — Head of Evals, dokumentierte den Test
|
|||
|
|
- [[diogo-almeida.md]] — TypeSafe-Gründer
|