Video: https://www.youtube.com/watch?v=xQtUzjd7-As (AI Copium, 17.09.2026, 14:25). Erstmals vollstaendiges Transcript (Firecrawl) statt metadata-only. Primaerquellen: TypeSafe-Ankuendigung (Diogo Almeida, 15.09.) + Every-Test (Mike Taylor, 15.09.). raw: raw/youtube/2026-09-17_aicopium-typesafe-jev.md (neu), raw/blog/2026-09-15_typesafe-system-one-models-jev.md (neu), raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md (neu), raw/blog/2026-09-16_theregister-typesafe-jev-doom.md (neu, Negativbefund) wiki: concepts/llm/system-one-models-jev.md (neu), institutions/typesafe-ai.md (neu), institutions/every.md (neu), people/diogo-almeida.md, people/mike-taylor.md, people/dan-shipper.md, people/ai-copium.md (alle neu) + Cross-Refs in llm-model-catalog, harness-vs-standalone-chat-llm, llm-sycophancy-confabulation, agent-budget-breaker, harness-loop-graph-engineering + index.md (216. Update), log.md
2.7 KiB
| created | updated | sources | tags | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-09-17 | 2026-09-17 |
|
|
Every
US-amerikanische Medien- und Weiterbildungs-Publikation für KI- und Builder-Themen (every.to). Im Wiki vertreten als Ort des ersten unabhängigen Tests von Jev (TypeSafe AI).
- Website: https://every.to/ · Newsletter-Abos: https://every.to/subscribe
- X: @every · LinkedIn: https://www.linkedin.com/company/everyinc/
Relevanz fürs Wiki
Publikation des Jev-Fremdtests (15.09.2026): ../people/mike-taylor.md (Head of Evals) veröffentlichte in der Rubrik Also True for Humans den Artikel „Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds" — 777 Judgments in 0,7 s (37 Dokumente × 21 Fragen, ein Viertel Cent) und der Vergleich Jev vs. Claude Fable 5.1 über 12 synthetische Passagen, durchgeführt von ../people/dan-shipper.md.
Eigene Infrastruktur, die im Artikel sichtbar wird:
- Personal Benchmarks: 5–10 regelmäßig ausgeführte Aufgaben, gespeicherte Beispiele, Präferenzen als Pass/Fail-Checks („Is this PowerPoint on brand?", „Does this social media copy have a good hook?", „Did the model recommend the same thing I would?"), Abgleich mit dem eigenen Urteil und Verfeinerung der Checks.
- Skill zur Erkennung von KI-Schreibmustern — die 21 Fragen des Jev-Tests wurden daraus abgeleitet (u. a. „Does the text repeat an idea without adding evidence?", „Force a symmetrical 'both sides' argument?", „Overexplain a straightforward point?").
- Judgment-Lab: eine eigene Experimentier-Umgebung (typesafe-parallel-judgment-lab.every-4573.chatgpt.site) mit 11 dokumentierten Jev-Experimenten.
Der Artikel nennt Every-Formate wie „Vibe Check"-Modellreviews (verlinkt auf GPT-6 Astra) und Mitgliedschaftsmodelle (Builder Pack, All Access).
Einordnung
Every ist hier nicht Quelle, sondern Prüfinstanz: Die Publikation betreibt Evals als Redaktionshandwerk und dokumentiert ihre eigene Methodik samt Schwächen („This test doesn't establish performance across entire industries or a wide range of tasks"). Für das Wiki ist das ein brauchbares Muster für Fremdprüfung — eigener kleiner Datensatz, dokumentierte Fragenliste, benannter Durchführender, offengelegte Grenzen.
Verwandte Wiki-Seiten
- ../people/mike-taylor.md, ../people/dan-shipper.md — Autoren/Durchführende
- ../concepts/llm/system-one-models-jev.md — Modell und Testlage
- ../institutions/typesafe-ai.md — getesteter Anbieter