knowledge-base/wiki/concepts/llm/jev-praxis-demos.md
Hector bb9c1e1efb ingest(other): jev-flyer v11 - korrektur verifiziert (0,09s vs ~14s getrennt, 181x entfernt)
- raw: fassungsvergleich v10/v11, nachpruefung, restbeanstandungen
- wiki: jev-praxis-demos (abschnitt 'folge: version 11')
- index 229. update + log
2026-09-19 15:03:25 +02:00

102 lines
12 KiB
Markdown
Raw Blame History

This file contains invisible Unicode characters

This file contains invisible Unicode characters that are indistinguishable to humans but may be processed differently by a computer. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-09-18
updated: 2026-09-18
sources: [youtube/2026-09-18_berman-jev.md, xpost/2026-09-15_almeida-jev-launch-post.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, other/2026-09-19_jev-flyer-kombi-revolution.md, other/2026-09-19_jev-flyer-v11-korrektur.md]
tags: [concept, llm, jev, typesafe-ai, bauprojekte, doom, wikipedia-race, schach, agent-loop, sponsoring, kalibrierung]
---
# Jev in der Praxis — Demo-Urteile und ihre Belastbarkeit
> **Quelle:** Matthew Berman, „We need to talk about Jev..." (18.09.2026, 12:30, https://www.youtube.com/watch?v=2z-7pIj57f8, 82.291 Aufrufe bei Abruf) + dessen Quellenliste + Ankündigungspost von Diogo Almeida. ⚠️ **Kein Transcript** — das Video wurde nicht inhaltlich ausgewertet; seine Aussagen sind hier über Beschreibung, Quellenliste und eine Sekundärzusammenfassung belegt. Modell und Testlage: [[system-one-models-jev.md]]. Verteilung: [[jev-vercel-ai-gateway.md]].
## Warum diese Seite existiert
Zwischen dem Launch (15.09.2026) und dem 18.09.2026 entstand eine Welle von **Bauprojekten**, die Jev nicht als Klassifikator zeigen, sondern als **Ingredienz in Schleifen**. Diese Demos sind die informativste Evidenzlage, die es zu Jev gibt — informativer als die Benchmark-Tabellen, weil sie sichtbar machen, was das Modell tatsächlich trägt und was nicht. Belastbarkeit: überwiegend Selbstdarstellung von Erbauern (⚠️), ein Fall mit dokumentiertem Ausgang (AI/ML API).
## Die Demos und was sie jeweils beweisen
| Bauprojekt | Autor (Datum) | Was gezeigt wird | Belastbarkeit |
|-----------|---------------|------------------|---------------|
| **Wikipedia-Races** | Matthew Berman (18.09.2026) | Link-Klicken als Sequenz von `Choice`-Entscheidungen; Zielerreichung in Bruchteilen von Sekunden statt Sekunden bei LLMs (GPT-5.6 Terra, Haiku, Sonnet 5) | ⚠️ Video, kein Transcript; Konkurrenzwerte nicht nachvollzogen |
| **Doom spielen** | Matthew Berman | Entscheidung pro Tick („was jetzt tun?") in einer Echtzeit-Schleife | ⚠️ Demo, kein Messaufbau veröffentlicht |
| **Kleinstadt-Simulation** | Matthew Berman | Charaktere reagieren parallel auf Ereignisse (Bäckerei-Ausverkauf, Schlangen-Bedrohung) in unter einer Sekunde | ⚠️ Demo |
| **Skittles-Sortierung** | Matthew Berman | Massenhafte Score-/Choice-Urteile pro Sekunde | ⚠️ Demo |
| **Schach (Blitz 5+0)** | [[../../institutions/ai-ml-api.md|AI/ML API]] (16.09.2026) | Ein API-Call pro Zug. **Gegen Fable 5.1:** materiell unterlegen (nach Zug 29 16), aber Fable verbrannte 615 s pro Zug auf Analyse und verlor **auf Zeit**; Jev antwortete in ~2,6 s. **Gegen GPT-6 Astra:** Matt in 18 Zügen (Qe1#), Astra mit 2:27 Restzeit | ✅ **Dokumentierter Ausgang**, aber Einzeltest ohne Wiederholung; Autorenangabe |
| **Unclutter** (Ad-/Slop-Blocker) | [[../../people/kitze.md|kitze]] (17.09.2026) | Browser-Erweiterung, die Seiten von Ads, Cookie-Bannern, Upsells und Dialogen befreit; BYOK, Open Source | ⚠️ Produktankündigung; Wirksamkeit nicht nachgeprüft |
| **Agent mit Jev-Modellrouter** | [[../../people/riley-brown.md|Riley Brown]] (17.09.2026) | Jev als Router-Entscheider im Agenten (deckt sich mit TypeSafes dokumentiertem Muster „nächsten Tool/Subagent wählen") | ⚠️ Ankündigung |
| **„Tesla FSD nachgebaut in <1 h"** | [[../../people/justin-schroeder.md|Justin Schroeder]] (16.09.2026) | 568.108 Views, 4.580 Likes der viralste Einzelpost nach der Ankündigung | **Höchstgradig vage**: rebuilt Tesla Full Self Driving" beschreibt keinen messbaren Aufbau; mit Abstand die schwächste Evidenz der Reihe |
| **Melee spielen** | [[../../people/alex-the-alex.md|@The_Alex]] (17.09.2026) | Spielentscheidungen im Loop | Kleiner Post (2.478 Views) |
| **Sprachsteuerung Mac** (Notes, Arc, Google, x.com, Photo Booth) | [[../../people/andy-gao.md|Andy Gao]] (18.09.2026) | Sprechbefehl UI-Aktion; App offen, während der Satz noch läuft. **Lokal ausgewertet** (STT + 9 Standbilder): Zielzustände sichtbar, während das Transkript-Overlay unvollständig ist belastbarste Einzelaussage der Welle | Keine Messung, kein Code; ein lokales STT mit Schlüsselwort-Matching würde dieselben Bilder erzeugen |
Zur Vorsicht bei der Zuordnung: Die Zuschreibungen stammen aus der **Quellenliste des Videos** und den dort verlinkten Posts, nicht aus einer Video-Auswertung.
## Was die Reihe zusammen zeigt
- **Der Schleifen-Slot ist real.** Die Demos funktionieren alle nach demselben Muster: Ein System liefert einen sich schnell ändernden Zustand, Jev wählt daraus in Millisekunden die nächste Aktion. Das ist genau der Slot, den im Wiki [[../agents/harness-loop-graph-engineering.md|die Harness-Ebene]] beschreibt nur ohne Sprachmodell darin.
- **Geschwindigkeit schlägt Qualität pro Zug manchmal.** Das Schach-Resultat ist das lehrreichste Datum der ganzen Welle: Fable 5.1 spielte besser und verlor trotzdem, weil die **Zeitökonomie** des Formats den besseren Bewerter nicht trug. Das ist die klarste Illustration des Verkaufsarguments („Checks sind so billig, dass man sie laufend macht", siehe [[../agents/agent-budget-breaker.md|Kostendeckel]]) und zugleich seine Grenze: Wo Qualität pro Zug die einzige Metrik ist, hilft Tempo nicht.
- **Der Sponsor sitzt am Rand, nicht im Kern.** Das Video läuft mit ausgewiesener bezahlter Werbung (Zapier). Der Produktkern wird nicht über den Sponsor erklärt, sondern über eigene Demos das trennt diesen Beitrag von einem reinen Werbespot, macht ihn aber auch nicht unabhängig.
- **Viralität misst Aufmerksamkeit, nicht Substanz.** Der FSD-Post ist der reichweitenstärkste und der inhaltsleerste. Wer aus Engagement auf Belastbarkeit schließt, liegt hier komplett daneben.
## Einordnung: Demo-Welle statt Benchmark-Debatte
Das Muster erinnert an die ersten Wochen anderer Basismodelle: Solange keine unabhängigen Benchmarks existieren, entsteht Ersatz-Evidenz durch **öffentlich nachbaubare Projekte**. Das hat Vor- und Nachteile.
Vorteile: Demos zeigen Fähigkeiten, die kein Benchmark abfragt Echtzeitverhalten, Verhalten im Loop, Verhalten unter Zeitdruck. Der Schach-Fall etwa wäre in keinem Standard-Eval aufgetaucht.
Nachteile: Demos sind nicht reproduzierbar, nicht kontrolliert und fast immer selbstveröffentlicht. Sie messen den Enthusiasmus des Erbauers mit. Für die TypSafe-Bewertung im Wiki bleibt daher die Reihenfolge: Anbieterangabe unabhängiger Einzeltest (Every) Demo-Welle (diese Seite) alles weitere offen.
## Offene Punkte
- **Kein Transcript** des Berman-Videos; die Demos sind über die Beschreibung, die Quellenliste und eine Sekundärzusammenfassung beschrieben.
- Kein einziger Demo-Aufbau ist veröffentlicht (Code, Daten, Wiederholungen); Reproduzierbarkeit durch Dritte nicht gegeben.
- Ob die genannten Modelle (GPT-5.6 Terra, Haiku, Sonnet 5) im Vergleich dieselbe Aufruf-Ökonomie hatten, ist nicht dokumentiert.
- Offen: ob Jev **im Takt** einer Echtzeitschleife stabil bleibt (Drift, Kalibrierung über längere Läufe) dazu sagt keine Demo etwas.
- Offen: die im Video verwendete Jev-Version. Der Schach-Post nennt Jev V13", die Launch-Kommunikation nennt keine Versionsnummer.
## Dateisortierung — Eigenmessung aus der Gruppe (19.09.2026)
Der greifbarste Anwendungsfall stammt aus der eigenen Runde: Pit Weber veröffentlichte am 19.09.2026 einen deutschsprachigen Erklär-Flyer („Jev Die Kombi-Revolution", mit GrokBot und Sprachsteuerung erstellt), der einen **eigenen Live-Test** dokumentiert 304 Objekte aus einem Dokumente-Ordner, sortiert in 7 Kategorien plus `_Archiv`, mit Vorher-/Nachher-Bildern (Raw: `raw/other/2026-09-19_jev-flyer-kombi-revolution.md`).
Die Zahlen des Flyers, gegen die Anbieter-Limits gerechnet:
| Angabe im Flyer | Eigene Rechnung | Befund |
|-----------------|-----------------|--------|
| 304 Dateien in **0,09 s** | bei 250.000 Token/s max. 22.500 Token ** 74 Token pro Datei** | passt zu Dateinamen; die **Selbstkorrektur des Flyers** („war Namens-/Format-Heuristik") wird von den Limits gestützt |
| 304 Dateien für **$0,15** | entspricht 3,57 Mio. Input-Token Mindestdauer ** 14,3 s** | **unvereinbar mit den 0,09 s** die beiden Werte können nicht denselben Lauf beschreiben |
| „**181-mal schneller**" | Zeitverhältnis 408 s / 0,09 s = **~4.533×**; Kostenverhältnis 0,48/0,15 = **3,2×** | 181 folgt aus **keiner** der genannten Zahlen |
| 400 PDFs, **340 klassifiziert** (~1,2 min) | Erfolgsquote **85 %**, 60 ohne Klassifikation | Qualitätszahl, nicht als solche ausgewiesen |
| 400 PDFs öffnen, Text extrahieren, klassifizieren" | Jev nimmt **nur Text** entgegen | Öffnen und Textextraktion sind **Fremdschritte**; bei 0,18 s pro PDF liegt die Laufzeit praktisch vollständig dort, nicht bei Jev |
**Kein Angriff auf den Flyer, sondern seine Fortsetzung:** Er korrigiert sich in Punkt 7 selbst und trennt Namens-Heuristik von Inhaltsprüfung. Die Rechnung liefert zu dieser Ehrlichkeit die Bestätigung mit der Einschränkung, dass die beiden Headline-Zahlen vor der weiteren Verbreitung nachgezogen werden sollten. Es ist dasselbe Muster wie in dieser ganzen Akte: **die Größenordnung stimmt, die konkreten Faktoren werden beim Weitererzählen jedes Mal größer.**
### Folge: Version 11 (verifizierte Korrektur, 19.09.2026 12:55 UTC)
Der Flyer wurde nach dieser Prüfung **überarbeitet**; der Kurzlink https://telegra.ph/Jev-Flyer-09-19 führt fest auf die jeweils aktuelle Fassung. Korrektur-Raw mit Fassungsvergleich: `raw/other/2026-09-19_jev-flyer-v11-korrektur.md`; die Erstfassung bleibt unverändert in `raw/other/2026-09-19_jev-flyer-kombi-revolution.md`. Übernommen und am Text von v11 verifiziert:
- **Trennung der zwei Läufe:** reine Entscheidungszeit 0,09 Sekunden nur die Sortierentscheidung, nicht das Öffnen gegen Gesamtlauf inkl. Öffnen/Extrahieren: rund 14 Sekunden. Kosten gesamt: 0,15 Dollar“, samt Rechenweg im Text.
- **„181ד entfernt** die Zeichenkette kommt in v11 nicht mehr vor; der LLM-Wert ist als Gesamtprojektion gekennzeichnet.
- **Konsistenzcheck Stufe 2** ergänzt: 0,18 s pro PDF als Wandzeit mit Extraktion, bewusst nicht mit der 0,09-s-Heuristik vermischt.
**Verbleibende Beanstandung (Stand v11):** Die neue Zahl „~4.500× schneller **in der reinen Entscheidungszeit** mischt weiterhin zwei Bezugsgrößen der Zähler (408 s) ist die *Gesamtprojektion* des LLM-Wegs, der Nenner (0,09 s) Jevs *reine Entscheidung*. Sauber wären **Gesamt gegen Gesamt ≈ 29×**, oder der Hinweis, dass für den LLM-Weg kein reiner Entscheidungswert vorliegt. Dazu ein abgebrochenes Zitat („Die frühere Formel „“) und ein Jeff statt Jev in Abschnitt 9.
Der Kern bleibt belastbar: **Die 0,09 Sekunden sind eine Mikroentscheidungs-Latenz, kein vollständiger Inhaltsanalyse-Lauf.** Das ist die erste Stelle in dieser Akte, an der eine Behauptung nach Prüfung tatsächlich nachgezogen wurde, statt nur weiterzuwandern.
## Verwandte Wiki-Seiten
- [[system-one-models-jev.md]] Modell, RLCD, Anbieterangaben, unabhängiger Every-Test
- [[jev-vercel-ai-gateway.md]] Verteilung über den Gateway, Isenberg-Post
- [[../../institutions/typesafe-ai.md]] Anbieter
- [[../../people/matthew-berman.md]] Kanal, der die Welle gebündelt hat
- [[../../people/diogo-almeida.md]] Ankündigungspost 15.09.2026
- [[../agents/jev-sprachsteuerung-computer-use.md]] Sprachsteuerung als Computer-Use (Andy Gao, lokal geprüft)
- [[../agents/harness-loop-graph-engineering.md]] Schleifen-Ebene
- [[../agents/agent-budget-breaker.md]] Kostendeckel und Freigrenzen
- [[harness-vs-standalone-chat-llm.md]] Gate vs. Generierung
## Quellen
- [YouTube: „We need to talk about Jev..."](https://www.youtube.com/watch?v=2z-7pIj57f8) (Matthew Berman, 18.09.2026, 12:30; mit Werbekennzeichnung; kein Transcript abrufbar)
- [Diogo Almeida: Jev-Launch-Post](https://x.com/CompleteSkeptic/status/2099925682726002904) (15.09.2026, 34,9 Mio. Views)
- [AI/ML API: Jev vs. Fable 5.1 vs. GPT-6 Astra (Schach)](https://x.com/aimlapi/status/2100372930282573876) (16.09.2026)
- [kitze: Unclutter](https://x.com/thekitze/status/2100595129874817340) (17.09.2026) · [Riley Brown: Jev-Modellrouter](https://x.com/rileybrown/status/2100607709317861879) (17.09.2026) · [Justin Schroeder](https://x.com/jpschroeder/status/2100347770867458384) (16.09.2026) · [@The_Alex](https://x.com/The_Alex/status/2100431093862367696) (17.09.2026)
- Raw: `raw/youtube/2026-09-18_berman-jev.md`, `raw/xpost/2026-09-15_almeida-jev-launch-post.md`