knowledge-base/wiki/concepts/llm/jev-praxis-demos.md
Hector 0953e8d44a ingest(xpost): jev als desktop-agent - sprachsteuerung (andy gao, video lokal ausgewertet)
- raw: post + stt-transkript + 9 frames, belegtabelle kernaussage
- wiki neu: concepts/agents/jev-sprachsteuerung-computer-use, people/andy-gao
- wiki update: concepts/llm/jev-praxis-demos (zeile + crossref)
- index 224. update + log
2026-09-19 00:47:26 +02:00

74 lines
8.6 KiB
Markdown
Raw Blame History

This file contains invisible Unicode characters

This file contains invisible Unicode characters that are indistinguishable to humans but may be processed differently by a computer. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-09-18
updated: 2026-09-18
sources: [youtube/2026-09-18_berman-jev.md, xpost/2026-09-15_almeida-jev-launch-post.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md]
tags: [concept, llm, jev, typesafe-ai, bauprojekte, doom, wikipedia-race, schach, agent-loop, sponsoring, kalibrierung]
---
# Jev in der Praxis — Demo-Urteile und ihre Belastbarkeit
> **Quelle:** Matthew Berman, „We need to talk about Jev..." (18.09.2026, 12:30, https://www.youtube.com/watch?v=2z-7pIj57f8, 82.291 Aufrufe bei Abruf) + dessen Quellenliste + Ankündigungspost von Diogo Almeida. ⚠️ **Kein Transcript** — das Video wurde nicht inhaltlich ausgewertet; seine Aussagen sind hier über Beschreibung, Quellenliste und eine Sekundärzusammenfassung belegt. Modell und Testlage: [[system-one-models-jev.md]]. Verteilung: [[jev-vercel-ai-gateway.md]].
## Warum diese Seite existiert
Zwischen dem Launch (15.09.2026) und dem 18.09.2026 entstand eine Welle von **Bauprojekten**, die Jev nicht als Klassifikator zeigen, sondern als **Ingredienz in Schleifen**. Diese Demos sind die informativste Evidenzlage, die es zu Jev gibt — informativer als die Benchmark-Tabellen, weil sie sichtbar machen, was das Modell tatsächlich trägt und was nicht. Belastbarkeit: überwiegend Selbstdarstellung von Erbauern (⚠️), ein Fall mit dokumentiertem Ausgang (AI/ML API).
## Die Demos und was sie jeweils beweisen
| Bauprojekt | Autor (Datum) | Was gezeigt wird | Belastbarkeit |
|-----------|---------------|------------------|---------------|
| **Wikipedia-Races** | Matthew Berman (18.09.2026) | Link-Klicken als Sequenz von `Choice`-Entscheidungen; Zielerreichung in Bruchteilen von Sekunden statt Sekunden bei LLMs (GPT-5.6 Terra, Haiku, Sonnet 5) | ⚠️ Video, kein Transcript; Konkurrenzwerte nicht nachvollzogen |
| **Doom spielen** | Matthew Berman | Entscheidung pro Tick („was jetzt tun?") in einer Echtzeit-Schleife | ⚠️ Demo, kein Messaufbau veröffentlicht |
| **Kleinstadt-Simulation** | Matthew Berman | Charaktere reagieren parallel auf Ereignisse (Bäckerei-Ausverkauf, Schlangen-Bedrohung) in unter einer Sekunde | ⚠️ Demo |
| **Skittles-Sortierung** | Matthew Berman | Massenhafte Score-/Choice-Urteile pro Sekunde | ⚠️ Demo |
| **Schach (Blitz 5+0)** | [[../../institutions/ai-ml-api.md|AI/ML API]] (16.09.2026) | Ein API-Call pro Zug. **Gegen Fable 5.1:** materiell unterlegen (nach Zug 29 16), aber Fable verbrannte 615 s pro Zug auf Analyse und verlor **auf Zeit**; Jev antwortete in ~2,6 s. **Gegen GPT-6 Astra:** Matt in 18 Zügen (Qe1#), Astra mit 2:27 Restzeit | ✅ **Dokumentierter Ausgang**, aber Einzeltest ohne Wiederholung; Autorenangabe |
| **Unclutter** (Ad-/Slop-Blocker) | [[../../people/kitze.md|kitze]] (17.09.2026) | Browser-Erweiterung, die Seiten von Ads, Cookie-Bannern, Upsells und Dialogen befreit; BYOK, Open Source | ⚠️ Produktankündigung; Wirksamkeit nicht nachgeprüft |
| **Agent mit Jev-Modellrouter** | [[../../people/riley-brown.md|Riley Brown]] (17.09.2026) | Jev als Router-Entscheider im Agenten (deckt sich mit TypeSafes dokumentiertem Muster „nächsten Tool/Subagent wählen") | ⚠️ Ankündigung |
| **„Tesla FSD nachgebaut in <1 h"** | [[../../people/justin-schroeder.md|Justin Schroeder]] (16.09.2026) | 568.108 Views, 4.580 Likes der viralste Einzelpost nach der Ankündigung | **Höchstgradig vage**: rebuilt Tesla Full Self Driving" beschreibt keinen messbaren Aufbau; mit Abstand die schwächste Evidenz der Reihe |
| **Melee spielen** | [[../../people/alex-the-alex.md|@The_Alex]] (17.09.2026) | Spielentscheidungen im Loop | Kleiner Post (2.478 Views) |
| **Sprachsteuerung Mac** (Notes, Arc, Google, x.com, Photo Booth) | [[../../people/andy-gao.md|Andy Gao]] (18.09.2026) | Sprechbefehl UI-Aktion; App offen, während der Satz noch läuft. **Lokal ausgewertet** (STT + 9 Standbilder): Zielzustände sichtbar, während das Transkript-Overlay unvollständig ist belastbarste Einzelaussage der Welle | Keine Messung, kein Code; ein lokales STT mit Schlüsselwort-Matching würde dieselben Bilder erzeugen |
Zur Vorsicht bei der Zuordnung: Die Zuschreibungen stammen aus der **Quellenliste des Videos** und den dort verlinkten Posts, nicht aus einer Video-Auswertung.
## Was die Reihe zusammen zeigt
- **Der Schleifen-Slot ist real.** Die Demos funktionieren alle nach demselben Muster: Ein System liefert einen sich schnell ändernden Zustand, Jev wählt daraus in Millisekunden die nächste Aktion. Das ist genau der Slot, den im Wiki [[../agents/harness-loop-graph-engineering.md|die Harness-Ebene]] beschreibt nur ohne Sprachmodell darin.
- **Geschwindigkeit schlägt Qualität pro Zug manchmal.** Das Schach-Resultat ist das lehrreichste Datum der ganzen Welle: Fable 5.1 spielte besser und verlor trotzdem, weil die **Zeitökonomie** des Formats den besseren Bewerter nicht trug. Das ist die klarste Illustration des Verkaufsarguments („Checks sind so billig, dass man sie laufend macht", siehe [[../agents/agent-budget-breaker.md|Kostendeckel]]) und zugleich seine Grenze: Wo Qualität pro Zug die einzige Metrik ist, hilft Tempo nicht.
- **Der Sponsor sitzt am Rand, nicht im Kern.** Das Video läuft mit ausgewiesener bezahlter Werbung (Zapier). Der Produktkern wird nicht über den Sponsor erklärt, sondern über eigene Demos das trennt diesen Beitrag von einem reinen Werbespot, macht ihn aber auch nicht unabhängig.
- **Viralität misst Aufmerksamkeit, nicht Substanz.** Der FSD-Post ist der reichweitenstärkste und der inhaltsleerste. Wer aus Engagement auf Belastbarkeit schließt, liegt hier komplett daneben.
## Einordnung: Demo-Welle statt Benchmark-Debatte
Das Muster erinnert an die ersten Wochen anderer Basismodelle: Solange keine unabhängigen Benchmarks existieren, entsteht Ersatz-Evidenz durch **öffentlich nachbaubare Projekte**. Das hat Vor- und Nachteile.
Vorteile: Demos zeigen Fähigkeiten, die kein Benchmark abfragt Echtzeitverhalten, Verhalten im Loop, Verhalten unter Zeitdruck. Der Schach-Fall etwa wäre in keinem Standard-Eval aufgetaucht.
Nachteile: Demos sind nicht reproduzierbar, nicht kontrolliert und fast immer selbstveröffentlicht. Sie messen den Enthusiasmus des Erbauers mit. Für die TypSafe-Bewertung im Wiki bleibt daher die Reihenfolge: Anbieterangabe unabhängiger Einzeltest (Every) Demo-Welle (diese Seite) alles weitere offen.
## Offene Punkte
- **Kein Transcript** des Berman-Videos; die Demos sind über die Beschreibung, die Quellenliste und eine Sekundärzusammenfassung beschrieben.
- Kein einziger Demo-Aufbau ist veröffentlicht (Code, Daten, Wiederholungen); Reproduzierbarkeit durch Dritte nicht gegeben.
- Ob die genannten Modelle (GPT-5.6 Terra, Haiku, Sonnet 5) im Vergleich dieselbe Aufruf-Ökonomie hatten, ist nicht dokumentiert.
- Offen: ob Jev **im Takt** einer Echtzeitschleife stabil bleibt (Drift, Kalibrierung über längere Läufe) dazu sagt keine Demo etwas.
- Offen: die im Video verwendete Jev-Version. Der Schach-Post nennt Jev V13", die Launch-Kommunikation nennt keine Versionsnummer.
## Verwandte Wiki-Seiten
- [[system-one-models-jev.md]] Modell, RLCD, Anbieterangaben, unabhängiger Every-Test
- [[jev-vercel-ai-gateway.md]] Verteilung über den Gateway, Isenberg-Post
- [[../../institutions/typesafe-ai.md]] Anbieter
- [[../../people/matthew-berman.md]] Kanal, der die Welle gebündelt hat
- [[../../people/diogo-almeida.md]] Ankündigungspost 15.09.2026
- [[../agents/jev-sprachsteuerung-computer-use.md]] Sprachsteuerung als Computer-Use (Andy Gao, lokal geprüft)
- [[../agents/harness-loop-graph-engineering.md]] Schleifen-Ebene
- [[../agents/agent-budget-breaker.md]] Kostendeckel und Freigrenzen
- [[harness-vs-standalone-chat-llm.md]] Gate vs. Generierung
## Quellen
- [YouTube: „We need to talk about Jev..."](https://www.youtube.com/watch?v=2z-7pIj57f8) (Matthew Berman, 18.09.2026, 12:30; mit Werbekennzeichnung; kein Transcript abrufbar)
- [Diogo Almeida: Jev-Launch-Post](https://x.com/CompleteSkeptic/status/2099925682726002904) (15.09.2026, 34,9 Mio. Views)
- [AI/ML API: Jev vs. Fable 5.1 vs. GPT-6 Astra (Schach)](https://x.com/aimlapi/status/2100372930282573876) (16.09.2026)
- [kitze: Unclutter](https://x.com/thekitze/status/2100595129874817340) (17.09.2026) · [Riley Brown: Jev-Modellrouter](https://x.com/rileybrown/status/2100607709317861879) (17.09.2026) · [Justin Schroeder](https://x.com/jpschroeder/status/2100347770867458384) (16.09.2026) · [@The_Alex](https://x.com/The_Alex/status/2100431093862367696) (17.09.2026)
- Raw: `raw/youtube/2026-09-18_berman-jev.md`, `raw/xpost/2026-09-15_almeida-jev-launch-post.md`