knowledge-base/wiki/institutions/every.md
Hector b395bc8c52 ingest(youtube): Typesafe AI — System One Models & Jev (KI Copium 17.09.2026)
Video: https://www.youtube.com/watch?v=xQtUzjd7-As (AI Copium, 17.09.2026, 14:25).
Erstmals vollstaendiges Transcript (Firecrawl) statt metadata-only.
Primaerquellen: TypeSafe-Ankuendigung (Diogo Almeida, 15.09.) + Every-Test (Mike Taylor, 15.09.).

raw: raw/youtube/2026-09-17_aicopium-typesafe-jev.md (neu),
     raw/blog/2026-09-15_typesafe-system-one-models-jev.md (neu),
     raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md (neu),
     raw/blog/2026-09-16_theregister-typesafe-jev-doom.md (neu, Negativbefund)
wiki: concepts/llm/system-one-models-jev.md (neu),
      institutions/typesafe-ai.md (neu), institutions/every.md (neu),
      people/diogo-almeida.md, people/mike-taylor.md, people/dan-shipper.md,
      people/ai-copium.md (alle neu)
      + Cross-Refs in llm-model-catalog, harness-vs-standalone-chat-llm,
        llm-sycophancy-confabulation, agent-budget-breaker,
        harness-loop-graph-engineering
      + index.md (216. Update), log.md
2026-09-17 23:51:03 +02:00

2.7 KiB
Raw Blame History

created updated sources tags
2026-09-17 2026-09-17
blog/2026-09-15_every-mike-taylor-jev-vibe-check.md
blog/2026-09-15_typesafe-system-one-models-jev.md
institution
every
media
newsletter
evals
benchmarks
publications

Every

US-amerikanische Medien- und Weiterbildungs-Publikation für KI- und Builder-Themen (every.to). Im Wiki vertreten als Ort des ersten unabhängigen Tests von Jev (TypeSafe AI).

Relevanz fürs Wiki

Publikation des Jev-Fremdtests (15.09.2026): ../people/mike-taylor.md (Head of Evals) veröffentlichte in der Rubrik Also True for Humans den Artikel „Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds" — 777 Judgments in 0,7 s (37 Dokumente × 21 Fragen, ein Viertel Cent) und der Vergleich Jev vs. Claude Fable 5.1 über 12 synthetische Passagen, durchgeführt von ../people/dan-shipper.md.

Eigene Infrastruktur, die im Artikel sichtbar wird:

  • Personal Benchmarks: 510 regelmäßig ausgeführte Aufgaben, gespeicherte Beispiele, Präferenzen als Pass/Fail-Checks („Is this PowerPoint on brand?", „Does this social media copy have a good hook?", „Did the model recommend the same thing I would?"), Abgleich mit dem eigenen Urteil und Verfeinerung der Checks.
  • Skill zur Erkennung von KI-Schreibmustern — die 21 Fragen des Jev-Tests wurden daraus abgeleitet (u. a. „Does the text repeat an idea without adding evidence?", „Force a symmetrical 'both sides' argument?", „Overexplain a straightforward point?").
  • Judgment-Lab: eine eigene Experimentier-Umgebung (typesafe-parallel-judgment-lab.every-4573.chatgpt.site) mit 11 dokumentierten Jev-Experimenten.

Der Artikel nennt Every-Formate wie „Vibe Check"-Modellreviews (verlinkt auf GPT-6 Astra) und Mitgliedschaftsmodelle (Builder Pack, All Access).

Einordnung

Every ist hier nicht Quelle, sondern Prüfinstanz: Die Publikation betreibt Evals als Redaktionshandwerk und dokumentiert ihre eigene Methodik samt Schwächen („This test doesn't establish performance across entire industries or a wide range of tasks"). Für das Wiki ist das ein brauchbares Muster für Fremdprüfung — eigener kleiner Datensatz, dokumentierte Fragenliste, benannter Durchführender, offengelegte Grenzen.

Verwandte Wiki-Seiten