knowledge-base/wiki/institutions/every.md

35 lines
2.7 KiB
Markdown
Raw Normal View History

---
created: 2026-09-17
updated: 2026-09-17
sources: [blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, blog/2026-09-15_typesafe-system-one-models-jev.md]
tags: [institution, every, media, newsletter, evals, benchmarks, publications]
---
# Every
US-amerikanische Medien- und Weiterbildungs-Publikation für KI- und Builder-Themen (every.to). Im Wiki vertreten als **Ort des ersten unabhängigen Tests von Jev** (TypeSafe AI).
- Website: https://every.to/ · Newsletter-Abos: https://every.to/subscribe
- X: [@every](http://twitter.com/every) · LinkedIn: https://www.linkedin.com/company/everyinc/
## Relevanz fürs Wiki
**Publikation des Jev-Fremdtests (15.09.2026):** [[../people/mike-taylor.md|Mike Taylor]] (Head of Evals) veröffentlichte in der Rubrik *Also True for Humans* den Artikel „Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds" — 777 Judgments in 0,7 s (37 Dokumente × 21 Fragen, ein Viertel Cent) und der Vergleich Jev vs. Claude Fable 5.1 über 12 synthetische Passagen, durchgeführt von [[../people/dan-shipper.md|Dan Shipper]].
**Eigene Infrastruktur, die im Artikel sichtbar wird:**
- **Personal Benchmarks:** 510 regelmäßig ausgeführte Aufgaben, gespeicherte Beispiele, Präferenzen als Pass/Fail-Checks („Is this PowerPoint on brand?", „Does this social media copy have a good hook?", „Did the model recommend the same thing I would?"), Abgleich mit dem eigenen Urteil und Verfeinerung der Checks.
- **Skill zur Erkennung von KI-Schreibmustern** — die 21 Fragen des Jev-Tests wurden daraus abgeleitet (u. a. „Does the text repeat an idea without adding evidence?", „Force a symmetrical 'both sides' argument?", „Overexplain a straightforward point?").
- **Judgment-Lab:** eine eigene Experimentier-Umgebung (typesafe-parallel-judgment-lab.every-4573.chatgpt.site) mit 11 dokumentierten Jev-Experimenten.
Der Artikel nennt Every-Formate wie „Vibe Check"-Modellreviews (verlinkt auf GPT-6 Astra) und Mitgliedschaftsmodelle (Builder Pack, All Access).
## Einordnung
Every ist hier nicht Quelle, sondern **Prüfinstanz**: Die Publikation betreibt Evals als Redaktionshandwerk und dokumentiert ihre eigene Methodik samt Schwächen („This test doesn't establish performance across entire industries or a wide range of tasks"). Für das Wiki ist das ein brauchbares Muster für Fremdprüfung — eigener kleiner Datensatz, dokumentierte Fragenliste, benannter Durchführender, offengelegte Grenzen.
## Verwandte Wiki-Seiten
- [[../people/mike-taylor.md]], [[../people/dan-shipper.md]] — Autoren/Durchführende
- [[../concepts/llm/system-one-models-jev.md]] — Modell und Testlage
- [[../institutions/typesafe-ai.md]] — getesteter Anbieter