knowledge-base/wiki/concepts/llm/jev-praxis-demos.md

137 lines
18 KiB
Markdown
Raw Permalink Blame History

This file contains invisible Unicode characters

This file contains invisible Unicode characters that are indistinguishable to humans but may be processed differently by a computer. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-09-18
updated: 2026-09-22
sources: [youtube/2026-09-18_berman-jev.md, youtube/2026-09-19_nate-herk-jev-12-use-cases.md, xpost/2026-09-15_almeida-jev-launch-post.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, other/2026-09-19_jev-flyer-kombi-revolution.md, other/2026-09-19_jev-flyer-v11-korrektur.md, xpost/2026-09-18_brivael-jev-demo-recap.md]
tags: [concept, llm, jev, typesafe-ai, bauprojekte, doom, wikipedia-race, schach, agent-loop, sponsoring, kalibrierung]
---
# Jev in der Praxis — Demo-Urteile und ihre Belastbarkeit
> **Quelle:** Matthew Berman, „We need to talk about Jev..." (18.09.2026, 12:30, https://www.youtube.com/watch?v=2z-7pIj57f8, 82.291 Aufrufe bei Abruf) + dessen Quellenliste + Ankündigungspost von Diogo Almeida. ⚠️ **Kein Transcript** — das Video wurde nicht inhaltlich ausgewertet; seine Aussagen sind hier über Beschreibung, Quellenliste und eine Sekundärzusammenfassung belegt. Modell und Testlage: [[system-one-models-jev.md]]. Verteilung: [[jev-vercel-ai-gateway.md]].
## Warum diese Seite existiert
Zwischen dem Launch (15.09.2026) und dem 18.09.2026 entstand eine Welle von **Bauprojekten**, die Jev nicht als Klassifikator zeigen, sondern als **Ingredienz in Schleifen**. Diese Demos sind die informativste Evidenzlage, die es zu Jev gibt — informativer als die Benchmark-Tabellen, weil sie sichtbar machen, was das Modell tatsächlich trägt und was nicht. Belastbarkeit: überwiegend Selbstdarstellung von Erbauern (⚠️), ein Fall mit dokumentiertem Ausgang (AI/ML API).
## Die Demos und was sie jeweils beweisen
| Bauprojekt | Autor (Datum) | Was gezeigt wird | Belastbarkeit |
|-----------|---------------|------------------|---------------|
| **Wikipedia-Races** | Matthew Berman (18.09.2026) | Link-Klicken als Sequenz von `Choice`-Entscheidungen; Zielerreichung in Bruchteilen von Sekunden statt Sekunden bei LLMs (GPT-5.6 Terra, Haiku, Sonnet 5) | ⚠️ Video, kein Transcript; Konkurrenzwerte nicht nachvollzogen |
| **Doom spielen** | Matthew Berman | Entscheidung pro Tick („was jetzt tun?") in einer Echtzeit-Schleife | ⚠️ Demo, kein Messaufbau veröffentlicht |
| **Kleinstadt-Simulation** | Matthew Berman | Charaktere reagieren parallel auf Ereignisse (Bäckerei-Ausverkauf, Schlangen-Bedrohung) in unter einer Sekunde | ⚠️ Demo |
| **Skittles-Sortierung** | Matthew Berman | Massenhafte Score-/Choice-Urteile pro Sekunde | ⚠️ Demo |
| **Schach (Blitz 5+0)** | [[../../institutions/ai-ml-api.md|AI/ML API]] (16.09.2026) | Ein API-Call pro Zug. **Gegen Fable 5.1:** materiell unterlegen (nach Zug 29 16), aber Fable verbrannte 615 s pro Zug auf Analyse und verlor **auf Zeit**; Jev antwortete in ~2,6 s. **Gegen GPT-6 Astra:** Matt in 18 Zügen (Qe1#), Astra mit 2:27 Restzeit | ✅ **Dokumentierter Ausgang**, aber Einzeltest ohne Wiederholung; Autorenangabe |
| **Unclutter** (Ad-/Slop-Blocker) | [[../../people/kitze.md|kitze]] (17.09.2026) | Browser-Erweiterung, die Seiten von Ads, Cookie-Bannern, Upsells und Dialogen befreit; BYOK, Open Source | ⚠️ Produktankündigung; Wirksamkeit nicht nachgeprüft |
| **Agent mit Jev-Modellrouter** | [[../../people/riley-brown.md|Riley Brown]] (17.09.2026) | Jev als Router-Entscheider im Agenten (deckt sich mit TypeSafes dokumentiertem Muster „nächsten Tool/Subagent wählen") | ⚠️ Ankündigung |
| **„Tesla FSD nachgebaut in <1 h"** | [[../../people/justin-schroeder.md|Justin Schroeder]] (16.09.2026) | 568.108 Views, 4.580 Likes der viralste Einzelpost nach der Ankündigung | **Höchstgradig vage**: rebuilt Tesla Full Self Driving" beschreibt keinen messbaren Aufbau; mit Abstand die schwächste Evidenz der Reihe |
| **Melee spielen** | [[../../people/alex-the-alex.md|@The_Alex]] (17.09.2026) | Spielentscheidungen im Loop | Kleiner Post (2.478 Views) |
| **Sprachsteuerung Mac** (Notes, Arc, Google, x.com, Photo Booth) | [[../../people/andy-gao.md|Andy Gao]] (18.09.2026) | Sprechbefehl UI-Aktion; App offen, während der Satz noch läuft. **Lokal ausgewertet** (STT + 9 Standbilder): Zielzustände sichtbar, während das Transkript-Overlay unvollständig ist belastbarste Einzelaussage der Welle | Keine Messung, kein Code; ein lokales STT mit Schlüsselwort-Matching würde dieselben Bilder erzeugen |
Zur Vorsicht bei der Zuordnung: Die Zuschreibungen stammen aus der **Quellenliste des Videos** und den dort verlinkten Posts, nicht aus einer Video-Auswertung.
## Was die Reihe zusammen zeigt
- **Der Schleifen-Slot ist real.** Die Demos funktionieren alle nach demselben Muster: Ein System liefert einen sich schnell ändernden Zustand, Jev wählt daraus in Millisekunden die nächste Aktion. Das ist genau der Slot, den im Wiki [[../agents/harness-loop-graph-engineering.md|die Harness-Ebene]] beschreibt nur ohne Sprachmodell darin.
- **Geschwindigkeit schlägt Qualität pro Zug manchmal.** Das Schach-Resultat ist das lehrreichste Datum der ganzen Welle: Fable 5.1 spielte besser und verlor trotzdem, weil die **Zeitökonomie** des Formats den besseren Bewerter nicht trug. Das ist die klarste Illustration des Verkaufsarguments („Checks sind so billig, dass man sie laufend macht", siehe [[../agents/agent-budget-breaker.md|Kostendeckel]]) und zugleich seine Grenze: Wo Qualität pro Zug die einzige Metrik ist, hilft Tempo nicht.
- **Der Sponsor sitzt am Rand, nicht im Kern.** Das Video läuft mit ausgewiesener bezahlter Werbung (Zapier). Der Produktkern wird nicht über den Sponsor erklärt, sondern über eigene Demos das trennt diesen Beitrag von einem reinen Werbespot, macht ihn aber auch nicht unabhängig.
- **Viralität misst Aufmerksamkeit, nicht Substanz.** Der FSD-Post ist der reichweitenstärkste und der inhaltsleerste. Wer aus Engagement auf Belastbarkeit schließt, liegt hier komplett daneben.
## Einordnung: Demo-Welle statt Benchmark-Debatte
Das Muster erinnert an die ersten Wochen anderer Basismodelle: Solange keine unabhängigen Benchmarks existieren, entsteht Ersatz-Evidenz durch **öffentlich nachbaubare Projekte**. Das hat Vor- und Nachteile.
Vorteile: Demos zeigen Fähigkeiten, die kein Benchmark abfragt Echtzeitverhalten, Verhalten im Loop, Verhalten unter Zeitdruck. Der Schach-Fall etwa wäre in keinem Standard-Eval aufgetaucht.
Nachteile: Demos sind nicht reproduzierbar, nicht kontrolliert und fast immer selbstveröffentlicht. Sie messen den Enthusiasmus des Erbauers mit. Für die TypSafe-Bewertung im Wiki bleibt daher die Reihenfolge: Anbieterangabe unabhängiger Einzeltest (Every) Demo-Welle (diese Seite) alles weitere offen.
## Offene Punkte
- **Kein Transcript** des Berman-Videos; die Demos sind über die Beschreibung, die Quellenliste und eine Sekundärzusammenfassung beschrieben.
- Kein einziger Demo-Aufbau ist veröffentlicht (Code, Daten, Wiederholungen); Reproduzierbarkeit durch Dritte nicht gegeben.
- Ob die genannten Modelle (GPT-5.6 Terra, Haiku, Sonnet 5) im Vergleich dieselbe Aufruf-Ökonomie hatten, ist nicht dokumentiert.
- Offen: ob Jev **im Takt** einer Echtzeitschleife stabil bleibt (Drift, Kalibrierung über längere Läufe) dazu sagt keine Demo etwas.
- Offen: die im Video verwendete Jev-Version. Der Schach-Post nennt Jev V13", die Launch-Kommunikation nennt keine Versionsnummer.
## Dateisortierung — Eigenmessung aus der Gruppe (19.09.2026)
Der greifbarste Anwendungsfall stammt aus der eigenen Runde: Pit Weber veröffentlichte am 19.09.2026 einen deutschsprachigen Erklär-Flyer („Jev Die Kombi-Revolution", mit GrokBot und Sprachsteuerung erstellt), der einen **eigenen Live-Test** dokumentiert 304 Objekte aus einem Dokumente-Ordner, sortiert in 7 Kategorien plus `_Archiv`, mit Vorher-/Nachher-Bildern (Raw: `raw/other/2026-09-19_jev-flyer-kombi-revolution.md`).
Die Zahlen des Flyers, gegen die Anbieter-Limits gerechnet:
| Angabe im Flyer | Eigene Rechnung | Befund |
|-----------------|-----------------|--------|
| 304 Dateien in **0,09 s** | bei 250.000 Token/s max. 22.500 Token ** 74 Token pro Datei** | passt zu Dateinamen; die **Selbstkorrektur des Flyers** („war Namens-/Format-Heuristik") wird von den Limits gestützt |
| 304 Dateien für **$0,15** | entspricht 3,57 Mio. Input-Token Mindestdauer ** 14,3 s** | **unvereinbar mit den 0,09 s** die beiden Werte können nicht denselben Lauf beschreiben |
| „**181-mal schneller**" | Zeitverhältnis 408 s / 0,09 s = **~4.533×**; Kostenverhältnis 0,48/0,15 = **3,2×** | 181 folgt aus **keiner** der genannten Zahlen |
| 400 PDFs, **340 klassifiziert** (~1,2 min) | Erfolgsquote **85 %**, 60 ohne Klassifikation | Qualitätszahl, nicht als solche ausgewiesen |
| 400 PDFs öffnen, Text extrahieren, klassifizieren" | Jev nimmt **nur Text** entgegen | Öffnen und Textextraktion sind **Fremdschritte**; bei 0,18 s pro PDF liegt die Laufzeit praktisch vollständig dort, nicht bei Jev |
**Kein Angriff auf den Flyer, sondern seine Fortsetzung:** Er korrigiert sich in Punkt 7 selbst und trennt Namens-Heuristik von Inhaltsprüfung. Die Rechnung liefert zu dieser Ehrlichkeit die Bestätigung mit der Einschränkung, dass die beiden Headline-Zahlen vor der weiteren Verbreitung nachgezogen werden sollten. Es ist dasselbe Muster wie in dieser ganzen Akte: **die Größenordnung stimmt, die konkreten Faktoren werden beim Weitererzählen jedes Mal größer.**
### Folge: Version 11 (verifizierte Korrektur, 19.09.2026 12:55 UTC)
Der Flyer wurde nach dieser Prüfung **überarbeitet**; der Kurzlink https://telegra.ph/Jev-Flyer-09-19 führt fest auf die jeweils aktuelle Fassung. Korrektur-Raw mit Fassungsvergleich: `raw/other/2026-09-19_jev-flyer-v11-korrektur.md`; die Erstfassung bleibt unverändert in `raw/other/2026-09-19_jev-flyer-kombi-revolution.md`. Übernommen und am Text von v11 verifiziert:
- **Trennung der zwei Läufe:** reine Entscheidungszeit 0,09 Sekunden nur die Sortierentscheidung, nicht das Öffnen gegen Gesamtlauf inkl. Öffnen/Extrahieren: rund 14 Sekunden. Kosten gesamt: 0,15 Dollar“, samt Rechenweg im Text.
- **„181ד entfernt** die Zeichenkette kommt in v11 nicht mehr vor; der LLM-Wert ist als Gesamtprojektion gekennzeichnet.
- **Konsistenzcheck Stufe 2** ergänzt: 0,18 s pro PDF als Wandzeit mit Extraktion, bewusst nicht mit der 0,09-s-Heuristik vermischt.
**Verbleibende Beanstandung (Stand v11):** Die neue Zahl „~4.500× schneller **in der reinen Entscheidungszeit** mischt weiterhin zwei Bezugsgrößen der Zähler (408 s) ist die *Gesamtprojektion* des LLM-Wegs, der Nenner (0,09 s) Jevs *reine Entscheidung*. Sauber wären **Gesamt gegen Gesamt ≈ 29×**, oder der Hinweis, dass für den LLM-Weg kein reiner Entscheidungswert vorliegt. Dazu ein abgebrochenes Zitat („Die frühere Formel „“) und ein Jeff statt Jev in Abschnitt 9.
Der Kern bleibt belastbar: **Die 0,09 Sekunden sind eine Mikroentscheidungs-Latenz, kein vollständiger Inhaltsanalyse-Lauf.** Das ist die erste Stelle in dieser Akte, an der eine Behauptung nach Prüfung tatsächlich nachgezogen wurde, statt nur weiterzuwandern.
## Praxistests auf Workflow-Ebene (19.09.2026)
Der bislang praxisnächste Test kommt von **[[../../people/nate-herk.md|Nate Herk]]** („I Tested Jev on 12 Real Use Cases", 19.09.2026, 13.549 Aufrufe, kein Transkript; Raw: `raw/youtube/2026-09-19_nate-herk-jev-12-use-cases.md`). Anwendungsfälle: E-Mail-/Support-Triage, Kommentar-Routing, X-Feed-Classifier (Erweiterung), Clip-/CRM-/Vertrags-Vorfilter, Paper-Trading-Prototyp.
Seine Zahlen, gegen Preis und Rate Limits gerechnet:
| Test | laut Video | Token (aus $0,042/MTok) | pro Einheit |
|------|-----------|--------------------------|-------------|
| 1.000 Mails, 7 Regeln | 6 s / 9 Cent (vorher 70 s / 9 Cent) | 2,14 Mio. | ~2.143 |
| 1.000 Mails, 1 Ja/Nein-Regel | 4 s / 5 Cent | 1,19 Mio. | ~1.190 |
| 1.000 YouTube-Kommentare | 5 s / 5 Cent | 1,19 Mio. | ~1.190 |
| Dashboard | 20.000 Requests / 85 Cent | 20,24 Mio. | ~1.012 |
| LLM-Vergleich, 1.000 Mails | 5 min / 62 Cent | | |
**Befund 1 — die Kostenwerte sind intern konsistent.** Die Differenz zwischen 7-Regel- und 1-Regel-Lauf (≈950 Token) entspricht rund 160 Token pro Zusatzfrage; die 1.012 Token pro Request aus dem Dashboard liegen zwischen beiden Mail-Werten. Alle vier Angaben sind mit **derselben** Preisformel vereinbar das ist in dieser Akte die Ausnahme.
**Befund 2 — die Laufzeiten liegen an oder über den dokumentierten Limits.** 2,14 Mio. Token in 6 s verlangen ~357.000 Token/s gegen 250.000 dokumentierte (**1,43×**); 1,19 Mio. in 4 s verlangen ~298.000 (**1,19×**); die 5-s-Angabe bleibt mit ~238.000 innerhalb. Auf der Request-Seite wären 1.000 Mails in 6 s bei einem Aufruf pro Mail **10.000 Requests/Minute** das Achtfache des dokumentierten Limits (1.200/min). Das geht nur mit Bündelung mehrerer Mails pro Aufruf (bei ~2.100 Token/Mail erlauben die 64k/32k-Grenzen etwa 14) oder mit erhöhtem Kontingent. **Nicht als Widerspruch geführt**, sondern als offene Frage: konservative Doku, Sonderkontingent oder optimistische Stoppuhr.
**Befund 3 — der Praktiker zieht die richtige Grenze.** Jev ersetzt kein LLM": es schreibt nicht, fasst nicht frei zusammen, erkennt keine offenen Muster; es braucht vorab definierte Fragen, Kategorien und Skalen. Für Browser-Steuerung muss es an etwas übergeben, das tatsächlich handelt. Seine Empfehlung **Evals mit Golden Dataset** gegen stärkere LLMs vor jedem Produktiveinsatz deckt sich mit der Label-Kritik ([[../../people/gabriel-anhaia.md|Anhaia]]) und mit [[../../people/cj-zafir.md|CJ Zafirs]] Jev + LLMs".
Kein Transkript erreichbar (Bot-Check), Zahlen über das Bot-Briefing; **Genauigkeitswerte nennt das Briefing nicht** verglichen werden Geschwindigkeit und Kosten, nicht Korrektheit. Beschreibung mit werblichen Elementen (Glaido, Hostinger).
## Demo-Recap brivael (18.09.2026, verifiziert 22.09.)
**[[../../people/brivael.md|Brivael Le Pogam]]** (@brivael, CEO&CTO von Argil AI) veröffentlichte am 18.09.2026 den bislang einzigen **französischsprachigen, namentlich personifizierten Recap der Demo-Welle** (32.726 Views / 380 Bookmarks; Raw: `raw/xpost/2026-09-18_brivael-jev-demo-recap.md`; geteilt von Rüdiger mit Verifiziere."). Er nennt zehn Demos mit Zahlen darunter mehrere, die im Wiki bislang fehlen: Voice-Browser („~300 ms, $0,0002 pro Entscheidung"), Trading-Bot auf Monad (real, alle 300 ms), **Ads-Klassifikation in Serie** (724 Ads/40 s/9 ¢ und 1.891 Ads/19 s/12 ¢), **Compaction-Plugin** („1 Mio. Token 86k in einer Sekunde"), UI-Assemblierung (153 Fragen parallel in ~1 s), und das **Confidence-Gate** („Confiant on saute le LLM. Pas sûr le frontier reste. Sur 10 items, 6 ne touchent plus jamais le modèle cher") exakt die Gate-Logik, die Almeida am 21.09. selbst als Design beschreibt.
**Prüfungsergebnis (Preis/Limits):**
- Doku-Angaben korrekt: $42/Btok, 70500 ms, Stealth, Choice/Score/Boolean; S'il n'est pas sûr, il le dit" deckt sich mit N8s Kalibrierung (ECE 1,74 pp).
- **Ian: 4,2 Mio. Token für „13 centimes"** bei $0,042/MTok sind das 17,6 Cent; 13 Cent ergeben nur 3,1 Mio. Token (~26 % Abweichung). Isenberg nennt 18 Cent bei denselben 4,2 Mio. Token die Recaps widersprechen einander.
- **Alex: „1 Mio. Token in einer Sekunde"** Lesen von 1 Mio. Token braucht bei 250.000 Token/s **mindestens ~4 s**; der Faktor ~4 ist physikalisch nicht unterschreitbar.
- **Michael: 153 Fragen parallel in ~1 s** = ~9.180 Requests/Minute gegen 1.200 nur mit Bündelung möglich (gleiche offene Frage wie bei [[../../people/nate-herk.md|Nate Herk]]).
- ✅/⚠ Übrige Zahlen limit-konform (Moritz ~159k tok/s, Matt ~54k, Ori ~150k, Jarrod 200 RPM), aber unverifiziert.
**Der Tweet verlinkt keine der zitierten Original-Demos** kein Handle, keine Post-URLs. Der Recap bleibt deshalb Verbreitungssignal und Demo-Inventar; die neuen Zahlen gelten als nicht verifiziert, bis die Original-Posts auftauchen. Identifizierung mit den oben dokumentierten Demos (Flug Isenberg 7,1 s; Voice Andy Gao) bleibt unklar.
## Verwandte Wiki-Seiten
- [[system-one-models-jev.md]] Modell, RLCD, Anbieterangaben, unabhängiger Every-Test
- [[jev-vercel-ai-gateway.md]] Verteilung über den Gateway, Isenberg-Post
- [[../../institutions/typesafe-ai.md]] Anbieter
- [[../../people/matthew-berman.md]] Kanal, der die Welle gebündelt hat
- [[../../people/diogo-almeida.md]] Ankündigungspost 15.09.2026
- [[../agents/jev-sprachsteuerung-computer-use.md]] Sprachsteuerung als Computer-Use (Andy Gao, lokal geprüft)
- [[../agents/harness-loop-graph-engineering.md]] Schleifen-Ebene
- [[../agents/agent-budget-breaker.md]] Kostendeckel und Freigrenzen
- [[harness-vs-standalone-chat-llm.md]] Gate vs. Generierung
## Quellen
- [YouTube: „We need to talk about Jev..."](https://www.youtube.com/watch?v=2z-7pIj57f8) (Matthew Berman, 18.09.2026, 12:30; mit Werbekennzeichnung; kein Transcript abrufbar)
- [Diogo Almeida: Jev-Launch-Post](https://x.com/CompleteSkeptic/status/2099925682726002904) (15.09.2026, 34,9 Mio. Views)
- [AI/ML API: Jev vs. Fable 5.1 vs. GPT-6 Astra (Schach)](https://x.com/aimlapi/status/2100372930282573876) (16.09.2026)
- [kitze: Unclutter](https://x.com/thekitze/status/2100595129874817340) (17.09.2026) · [Riley Brown: Jev-Modellrouter](https://x.com/rileybrown/status/2100607709317861879) (17.09.2026) · [Justin Schroeder](https://x.com/jpschroeder/status/2100347770867458384) (16.09.2026) · [@The_Alex](https://x.com/The_Alex/status/2100431093862367696) (17.09.2026)
- Raw: `raw/youtube/2026-09-18_berman-jev.md`, `raw/xpost/2026-09-15_almeida-jev-launch-post.md`