knowledge-base/wiki/concepts/llm/jev-praxis-demos.md
Hector e58c72ed4b ingest(youtube): berman 'we need to talk about jev' + demo-welle + almeida-launch-post
- raw: berman-video (18.09.2026, kein transcript, beschreibung+quellenliste) + almeida launch-post (15.09.2026)
- wiki neu: concepts/llm/jev-praxis-demos, people/matthew-berman, people/kitze, people/riley-brown, people/justin-schroeder, people/alex-the-alex, institutions/ai-ml-api
- wiki update: system-one-models-jev (ankündigungspost + demo-welle), diogo-almeida (launch-post)
- index 221. update + log
2026-09-18 23:37:47 +02:00

8 KiB
Raw Blame History

created updated sources tags
2026-09-18 2026-09-18
youtube/2026-09-18_berman-jev.md
xpost/2026-09-15_almeida-jev-launch-post.md
xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md
concept
llm
jev
typesafe-ai
bauprojekte
doom
wikipedia-race
schach
agent-loop
sponsoring
kalibrierung

Jev in der Praxis — Demo-Urteile und ihre Belastbarkeit

Quelle: Matthew Berman, „We need to talk about Jev..." (18.09.2026, 12:30, https://www.youtube.com/watch?v=2z-7pIj57f8, 82.291 Aufrufe bei Abruf) + dessen Quellenliste + Ankündigungspost von Diogo Almeida. ⚠️ Kein Transcript — das Video wurde nicht inhaltlich ausgewertet; seine Aussagen sind hier über Beschreibung, Quellenliste und eine Sekundärzusammenfassung belegt. Modell und Testlage: system-one-models-jev.md. Verteilung: jev-vercel-ai-gateway.md.

Warum diese Seite existiert

Zwischen dem Launch (15.09.2026) und dem 18.09.2026 entstand eine Welle von Bauprojekten, die Jev nicht als Klassifikator zeigen, sondern als Ingredienz in Schleifen. Diese Demos sind die informativste Evidenzlage, die es zu Jev gibt — informativer als die Benchmark-Tabellen, weil sie sichtbar machen, was das Modell tatsächlich trägt und was nicht. Belastbarkeit: überwiegend Selbstdarstellung von Erbauern (⚠️), ein Fall mit dokumentiertem Ausgang (AI/ML API).

Die Demos und was sie jeweils beweisen

Bauprojekt Autor (Datum) Was gezeigt wird Belastbarkeit
Wikipedia-Races Matthew Berman (18.09.2026) Link-Klicken als Sequenz von Choice-Entscheidungen; Zielerreichung in Bruchteilen von Sekunden statt Sekunden bei LLMs (GPT-5.6 Terra, Haiku, Sonnet 5) ⚠️ Video, kein Transcript; Konkurrenzwerte nicht nachvollzogen
Doom spielen Matthew Berman Entscheidung pro Tick („was jetzt tun?") in einer Echtzeit-Schleife ⚠️ Demo, kein Messaufbau veröffentlicht
Kleinstadt-Simulation Matthew Berman Charaktere reagieren parallel auf Ereignisse (Bäckerei-Ausverkauf, Schlangen-Bedrohung) in unter einer Sekunde ⚠️ Demo
Skittles-Sortierung Matthew Berman Massenhafte Score-/Choice-Urteile pro Sekunde ⚠️ Demo
Schach (Blitz 5+0) [[../../institutions/ai-ml-api.md AI/ML API]] (16.09.2026) Ein API-Call pro Zug. Gegen Fable 5.1: materiell unterlegen (nach Zug 29 16), aber Fable verbrannte 615 s pro Zug auf Analyse und verlor auf Zeit; Jev antwortete in ~2,6 s. Gegen GPT-6 Astra: Matt in 18 Zügen (Qe1#), Astra mit 2:27 Restzeit
Unclutter (Ad-/Slop-Blocker) [[../../people/kitze.md kitze]] (17.09.2026) Browser-Erweiterung, die Seiten von Ads, Cookie-Bannern, Upsells und Dialogen befreit; BYOK, Open Source
Agent mit Jev-Modellrouter [[../../people/riley-brown.md Riley Brown]] (17.09.2026) Jev als Router-Entscheider im Agenten (deckt sich mit TypeSafes dokumentiertem Muster „nächsten Tool/Subagent wählen")
„Tesla FSD nachgebaut in <1 h" [[../../people/justin-schroeder.md Justin Schroeder]] (16.09.2026) 568.108 Views, 4.580 Likes — der viralste Einzelpost nach der Ankündigung
Melee spielen [[../../people/alex-the-alex.md @The_Alex]] (17.09.2026) Spielentscheidungen im Loop

Zur Vorsicht bei der Zuordnung: Die Zuschreibungen stammen aus der Quellenliste des Videos und den dort verlinkten Posts, nicht aus einer Video-Auswertung.

Was die Reihe zusammen zeigt

  • Der Schleifen-Slot ist real. Die Demos funktionieren alle nach demselben Muster: Ein System liefert einen sich schnell ändernden Zustand, Jev wählt daraus in Millisekunden die nächste Aktion. Das ist genau der Slot, den im Wiki ../agents/harness-loop-graph-engineering.md beschreibt — nur ohne Sprachmodell darin.
  • Geschwindigkeit schlägt Qualität pro Zug — manchmal. Das Schach-Resultat ist das lehrreichste Datum der ganzen Welle: Fable 5.1 spielte besser und verlor trotzdem, weil die Zeitökonomie des Formats den besseren Bewerter nicht trug. Das ist die klarste Illustration des Verkaufsarguments („Checks sind so billig, dass man sie laufend macht", siehe ../agents/agent-budget-breaker.md) — und zugleich seine Grenze: Wo Qualität pro Zug die einzige Metrik ist, hilft Tempo nicht.
  • Der Sponsor sitzt am Rand, nicht im Kern. Das Video läuft mit ausgewiesener bezahlter Werbung (Zapier). Der Produktkern wird nicht über den Sponsor erklärt, sondern über eigene Demos — das trennt diesen Beitrag von einem reinen Werbespot, macht ihn aber auch nicht unabhängig.
  • Viralität misst Aufmerksamkeit, nicht Substanz. Der FSD-Post ist der reichweitenstärkste und der inhaltsleerste. Wer aus Engagement auf Belastbarkeit schließt, liegt hier komplett daneben.

Einordnung: Demo-Welle statt Benchmark-Debatte

Das Muster erinnert an die ersten Wochen anderer Basismodelle: Solange keine unabhängigen Benchmarks existieren, entsteht Ersatz-Evidenz durch öffentlich nachbaubare Projekte. Das hat Vor- und Nachteile.

Vorteile: Demos zeigen Fähigkeiten, die kein Benchmark abfragt — Echtzeitverhalten, Verhalten im Loop, Verhalten unter Zeitdruck. Der Schach-Fall etwa wäre in keinem Standard-Eval aufgetaucht.

Nachteile: Demos sind nicht reproduzierbar, nicht kontrolliert und fast immer selbstveröffentlicht. Sie messen den Enthusiasmus des Erbauers mit. Für die TypSafe-Bewertung im Wiki bleibt daher die Reihenfolge: Anbieterangabe → unabhängiger Einzeltest (Every) → Demo-Welle (diese Seite) → alles weitere offen.

Offene Punkte

  • ⚠️ Kein Transcript des Berman-Videos; die Demos sind über die Beschreibung, die Quellenliste und eine Sekundärzusammenfassung beschrieben.
  • ⚠️ Kein einziger Demo-Aufbau ist veröffentlicht (Code, Daten, Wiederholungen); Reproduzierbarkeit durch Dritte nicht gegeben.
  • ⚠️ Ob die genannten Modelle (GPT-5.6 Terra, Haiku, Sonnet 5) im Vergleich dieselbe Aufruf-Ökonomie hatten, ist nicht dokumentiert.
  • Offen: ob Jev im Takt einer Echtzeitschleife stabil bleibt (Drift, Kalibrierung über längere Läufe) — dazu sagt keine Demo etwas.
  • Offen: die im Video verwendete Jev-Version. Der Schach-Post nennt „Jev V13", die Launch-Kommunikation nennt keine Versionsnummer.

Verwandte Wiki-Seiten

Quellen