--- created: 2026-09-17 updated: 2026-09-17 sources: [blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, blog/2026-09-15_typesafe-system-one-models-jev.md] tags: [institution, every, media, newsletter, evals, benchmarks, publications] --- # Every US-amerikanische Medien- und Weiterbildungs-Publikation für KI- und Builder-Themen (every.to). Im Wiki vertreten als **Ort des ersten unabhängigen Tests von Jev** (TypeSafe AI). - Website: https://every.to/ · Newsletter-Abos: https://every.to/subscribe - X: [@every](http://twitter.com/every) · LinkedIn: https://www.linkedin.com/company/everyinc/ ## Relevanz fürs Wiki **Publikation des Jev-Fremdtests (15.09.2026):** [[../people/mike-taylor.md|Mike Taylor]] (Head of Evals) veröffentlichte in der Rubrik *Also True for Humans* den Artikel „Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds" — 777 Judgments in 0,7 s (37 Dokumente × 21 Fragen, ein Viertel Cent) und der Vergleich Jev vs. Claude Fable 5.1 über 12 synthetische Passagen, durchgeführt von [[../people/dan-shipper.md|Dan Shipper]]. **Eigene Infrastruktur, die im Artikel sichtbar wird:** - **Personal Benchmarks:** 5–10 regelmäßig ausgeführte Aufgaben, gespeicherte Beispiele, Präferenzen als Pass/Fail-Checks („Is this PowerPoint on brand?", „Does this social media copy have a good hook?", „Did the model recommend the same thing I would?"), Abgleich mit dem eigenen Urteil und Verfeinerung der Checks. - **Skill zur Erkennung von KI-Schreibmustern** — die 21 Fragen des Jev-Tests wurden daraus abgeleitet (u. a. „Does the text repeat an idea without adding evidence?", „Force a symmetrical 'both sides' argument?", „Overexplain a straightforward point?"). - **Judgment-Lab:** eine eigene Experimentier-Umgebung (typesafe-parallel-judgment-lab.every-4573.chatgpt.site) mit 11 dokumentierten Jev-Experimenten. Der Artikel nennt Every-Formate wie „Vibe Check"-Modellreviews (verlinkt auf GPT-6 Astra) und Mitgliedschaftsmodelle (Builder Pack, All Access). ## Einordnung Every ist hier nicht Quelle, sondern **Prüfinstanz**: Die Publikation betreibt Evals als Redaktionshandwerk und dokumentiert ihre eigene Methodik samt Schwächen („This test doesn't establish performance across entire industries or a wide range of tasks"). Für das Wiki ist das ein brauchbares Muster für Fremdprüfung — eigener kleiner Datensatz, dokumentierte Fragenliste, benannter Durchführender, offengelegte Grenzen. ## Verwandte Wiki-Seiten - [[../people/mike-taylor.md]], [[../people/dan-shipper.md]] — Autoren/Durchführende - [[../concepts/llm/system-one-models-jev.md]] — Modell und Testlage - [[../institutions/typesafe-ai.md]] — getesteter Anbieter