73 lines
8 KiB
Markdown
73 lines
8 KiB
Markdown
|
|
---
|
|||
|
|
created: 2026-09-18
|
|||
|
|
updated: 2026-09-18
|
|||
|
|
sources: [youtube/2026-09-18_berman-jev.md, xpost/2026-09-15_almeida-jev-launch-post.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md]
|
|||
|
|
tags: [concept, llm, jev, typesafe-ai, bauprojekte, doom, wikipedia-race, schach, agent-loop, sponsoring, kalibrierung]
|
|||
|
|
---
|
|||
|
|
|
|||
|
|
# Jev in der Praxis — Demo-Urteile und ihre Belastbarkeit
|
|||
|
|
|
|||
|
|
> **Quelle:** Matthew Berman, „We need to talk about Jev..." (18.09.2026, 12:30, https://www.youtube.com/watch?v=2z-7pIj57f8, 82.291 Aufrufe bei Abruf) + dessen Quellenliste + Ankündigungspost von Diogo Almeida. ⚠️ **Kein Transcript** — das Video wurde nicht inhaltlich ausgewertet; seine Aussagen sind hier über Beschreibung, Quellenliste und eine Sekundärzusammenfassung belegt. Modell und Testlage: [[system-one-models-jev.md]]. Verteilung: [[jev-vercel-ai-gateway.md]].
|
|||
|
|
|
|||
|
|
## Warum diese Seite existiert
|
|||
|
|
|
|||
|
|
Zwischen dem Launch (15.09.2026) und dem 18.09.2026 entstand eine Welle von **Bauprojekten**, die Jev nicht als Klassifikator zeigen, sondern als **Ingredienz in Schleifen**. Diese Demos sind die informativste Evidenzlage, die es zu Jev gibt — informativer als die Benchmark-Tabellen, weil sie sichtbar machen, was das Modell tatsächlich trägt und was nicht. Belastbarkeit: überwiegend Selbstdarstellung von Erbauern (⚠️), ein Fall mit dokumentiertem Ausgang (AI/ML API).
|
|||
|
|
|
|||
|
|
## Die Demos und was sie jeweils beweisen
|
|||
|
|
|
|||
|
|
| Bauprojekt | Autor (Datum) | Was gezeigt wird | Belastbarkeit |
|
|||
|
|
|-----------|---------------|------------------|---------------|
|
|||
|
|
| **Wikipedia-Races** | Matthew Berman (18.09.2026) | Link-Klicken als Sequenz von `Choice`-Entscheidungen; Zielerreichung in Bruchteilen von Sekunden statt Sekunden bei LLMs (GPT-5.6 Terra, Haiku, Sonnet 5) | ⚠️ Video, kein Transcript; Konkurrenzwerte nicht nachvollzogen |
|
|||
|
|
| **Doom spielen** | Matthew Berman | Entscheidung pro Tick („was jetzt tun?") in einer Echtzeit-Schleife | ⚠️ Demo, kein Messaufbau veröffentlicht |
|
|||
|
|
| **Kleinstadt-Simulation** | Matthew Berman | Charaktere reagieren parallel auf Ereignisse (Bäckerei-Ausverkauf, Schlangen-Bedrohung) in unter einer Sekunde | ⚠️ Demo |
|
|||
|
|
| **Skittles-Sortierung** | Matthew Berman | Massenhafte Score-/Choice-Urteile pro Sekunde | ⚠️ Demo |
|
|||
|
|
| **Schach (Blitz 5+0)** | [[../../institutions/ai-ml-api.md|AI/ML API]] (16.09.2026) | Ein API-Call pro Zug. **Gegen Fable 5.1:** materiell unterlegen (nach Zug 29 −16), aber Fable verbrannte 6–15 s pro Zug auf Analyse und verlor **auf Zeit**; Jev antwortete in ~2,6 s. **Gegen GPT-6 Astra:** Matt in 18 Zügen (Qe1#), Astra mit 2:27 Restzeit | ✅ **Dokumentierter Ausgang**, aber Einzeltest ohne Wiederholung; Autorenangabe |
|
|||
|
|
| **Unclutter** (Ad-/Slop-Blocker) | [[../../people/kitze.md|kitze]] (17.09.2026) | Browser-Erweiterung, die Seiten von Ads, Cookie-Bannern, Upsells und Dialogen befreit; BYOK, Open Source | ⚠️ Produktankündigung; Wirksamkeit nicht nachgeprüft |
|
|||
|
|
| **Agent mit Jev-Modellrouter** | [[../../people/riley-brown.md|Riley Brown]] (17.09.2026) | Jev als Router-Entscheider im Agenten (deckt sich mit TypeSafes dokumentiertem Muster „nächsten Tool/Subagent wählen") | ⚠️ Ankündigung |
|
|||
|
|
| **„Tesla FSD nachgebaut in <1 h"** | [[../../people/justin-schroeder.md|Justin Schroeder]] (16.09.2026) | 568.108 Views, 4.580 Likes — der viralste Einzelpost nach der Ankündigung | ⚠️⚠️ **Höchstgradig vage**: „rebuilt Tesla Full Self Driving" beschreibt keinen messbaren Aufbau; mit Abstand die schwächste Evidenz der Reihe |
|
|||
|
|
| **Melee spielen** | [[../../people/alex-the-alex.md|@The_Alex]] (17.09.2026) | Spielentscheidungen im Loop | ⚠️ Kleiner Post (2.478 Views) |
|
|||
|
|
|
|||
|
|
Zur Vorsicht bei der Zuordnung: Die Zuschreibungen stammen aus der **Quellenliste des Videos** und den dort verlinkten Posts, nicht aus einer Video-Auswertung.
|
|||
|
|
|
|||
|
|
## Was die Reihe zusammen zeigt
|
|||
|
|
|
|||
|
|
- **Der Schleifen-Slot ist real.** Die Demos funktionieren alle nach demselben Muster: Ein System liefert einen sich schnell ändernden Zustand, Jev wählt daraus in Millisekunden die nächste Aktion. Das ist genau der Slot, den im Wiki [[../agents/harness-loop-graph-engineering.md|die Harness-Ebene]] beschreibt — nur ohne Sprachmodell darin.
|
|||
|
|
- **Geschwindigkeit schlägt Qualität pro Zug — manchmal.** Das Schach-Resultat ist das lehrreichste Datum der ganzen Welle: Fable 5.1 spielte besser und verlor trotzdem, weil die **Zeitökonomie** des Formats den besseren Bewerter nicht trug. Das ist die klarste Illustration des Verkaufsarguments („Checks sind so billig, dass man sie laufend macht", siehe [[../agents/agent-budget-breaker.md|Kostendeckel]]) — und zugleich seine Grenze: Wo Qualität pro Zug die einzige Metrik ist, hilft Tempo nicht.
|
|||
|
|
- **Der Sponsor sitzt am Rand, nicht im Kern.** Das Video läuft mit ausgewiesener bezahlter Werbung (Zapier). Der Produktkern wird nicht über den Sponsor erklärt, sondern über eigene Demos — das trennt diesen Beitrag von einem reinen Werbespot, macht ihn aber auch nicht unabhängig.
|
|||
|
|
- **Viralität misst Aufmerksamkeit, nicht Substanz.** Der FSD-Post ist der reichweitenstärkste und der inhaltsleerste. Wer aus Engagement auf Belastbarkeit schließt, liegt hier komplett daneben.
|
|||
|
|
|
|||
|
|
## Einordnung: Demo-Welle statt Benchmark-Debatte
|
|||
|
|
|
|||
|
|
Das Muster erinnert an die ersten Wochen anderer Basismodelle: Solange keine unabhängigen Benchmarks existieren, entsteht Ersatz-Evidenz durch **öffentlich nachbaubare Projekte**. Das hat Vor- und Nachteile.
|
|||
|
|
|
|||
|
|
Vorteile: Demos zeigen Fähigkeiten, die kein Benchmark abfragt — Echtzeitverhalten, Verhalten im Loop, Verhalten unter Zeitdruck. Der Schach-Fall etwa wäre in keinem Standard-Eval aufgetaucht.
|
|||
|
|
|
|||
|
|
Nachteile: Demos sind nicht reproduzierbar, nicht kontrolliert und fast immer selbstveröffentlicht. Sie messen den Enthusiasmus des Erbauers mit. Für die TypSafe-Bewertung im Wiki bleibt daher die Reihenfolge: Anbieterangabe → unabhängiger Einzeltest (Every) → Demo-Welle (diese Seite) → alles weitere offen.
|
|||
|
|
|
|||
|
|
## Offene Punkte
|
|||
|
|
|
|||
|
|
- ⚠️ **Kein Transcript** des Berman-Videos; die Demos sind über die Beschreibung, die Quellenliste und eine Sekundärzusammenfassung beschrieben.
|
|||
|
|
- ⚠️ Kein einziger Demo-Aufbau ist veröffentlicht (Code, Daten, Wiederholungen); Reproduzierbarkeit durch Dritte nicht gegeben.
|
|||
|
|
- ⚠️ Ob die genannten Modelle (GPT-5.6 Terra, Haiku, Sonnet 5) im Vergleich dieselbe Aufruf-Ökonomie hatten, ist nicht dokumentiert.
|
|||
|
|
- Offen: ob Jev **im Takt** einer Echtzeitschleife stabil bleibt (Drift, Kalibrierung über längere Läufe) — dazu sagt keine Demo etwas.
|
|||
|
|
- Offen: die im Video verwendete Jev-Version. Der Schach-Post nennt „Jev V13", die Launch-Kommunikation nennt keine Versionsnummer.
|
|||
|
|
|
|||
|
|
## Verwandte Wiki-Seiten
|
|||
|
|
|
|||
|
|
- [[system-one-models-jev.md]] — Modell, RLCD, Anbieterangaben, unabhängiger Every-Test
|
|||
|
|
- [[jev-vercel-ai-gateway.md]] — Verteilung über den Gateway, Isenberg-Post
|
|||
|
|
- [[../../institutions/typesafe-ai.md]] — Anbieter
|
|||
|
|
- [[../../people/matthew-berman.md]] — Kanal, der die Welle gebündelt hat
|
|||
|
|
- [[../../people/diogo-almeida.md]] — Ankündigungspost 15.09.2026
|
|||
|
|
- [[../agents/harness-loop-graph-engineering.md]] — Schleifen-Ebene
|
|||
|
|
- [[../agents/agent-budget-breaker.md]] — Kostendeckel und Freigrenzen
|
|||
|
|
- [[harness-vs-standalone-chat-llm.md]] — Gate vs. Generierung
|
|||
|
|
|
|||
|
|
## Quellen
|
|||
|
|
|
|||
|
|
- [YouTube: „We need to talk about Jev..."](https://www.youtube.com/watch?v=2z-7pIj57f8) (Matthew Berman, 18.09.2026, 12:30; mit Werbekennzeichnung; kein Transcript abrufbar)
|
|||
|
|
- [Diogo Almeida: Jev-Launch-Post](https://x.com/CompleteSkeptic/status/2099925682726002904) (15.09.2026, 34,9 Mio. Views)
|
|||
|
|
- [AI/ML API: Jev vs. Fable 5.1 vs. GPT-6 Astra (Schach)](https://x.com/aimlapi/status/2100372930282573876) (16.09.2026)
|
|||
|
|
- [kitze: Unclutter](https://x.com/thekitze/status/2100595129874817340) (17.09.2026) · [Riley Brown: Jev-Modellrouter](https://x.com/rileybrown/status/2100607709317861879) (17.09.2026) · [Justin Schroeder](https://x.com/jpschroeder/status/2100347770867458384) (16.09.2026) · [@The_Alex](https://x.com/The_Alex/status/2100431093862367696) (17.09.2026)
|
|||
|
|
- Raw: `raw/youtube/2026-09-18_berman-jev.md`, `raw/xpost/2026-09-15_almeida-jev-launch-post.md`
|