137 lines
18 KiB
Markdown
137 lines
18 KiB
Markdown
---
|
||
created: 2026-09-18
|
||
updated: 2026-09-22
|
||
sources: [youtube/2026-09-18_berman-jev.md, youtube/2026-09-19_nate-herk-jev-12-use-cases.md, xpost/2026-09-15_almeida-jev-launch-post.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, other/2026-09-19_jev-flyer-kombi-revolution.md, other/2026-09-19_jev-flyer-v11-korrektur.md, xpost/2026-09-18_brivael-jev-demo-recap.md]
|
||
tags: [concept, llm, jev, typesafe-ai, bauprojekte, doom, wikipedia-race, schach, agent-loop, sponsoring, kalibrierung]
|
||
---
|
||
|
||
# Jev in der Praxis — Demo-Urteile und ihre Belastbarkeit
|
||
|
||
> **Quelle:** Matthew Berman, „We need to talk about Jev..." (18.09.2026, 12:30, https://www.youtube.com/watch?v=2z-7pIj57f8, 82.291 Aufrufe bei Abruf) + dessen Quellenliste + Ankündigungspost von Diogo Almeida. ⚠️ **Kein Transcript** — das Video wurde nicht inhaltlich ausgewertet; seine Aussagen sind hier über Beschreibung, Quellenliste und eine Sekundärzusammenfassung belegt. Modell und Testlage: [[system-one-models-jev.md]]. Verteilung: [[jev-vercel-ai-gateway.md]].
|
||
|
||
## Warum diese Seite existiert
|
||
|
||
Zwischen dem Launch (15.09.2026) und dem 18.09.2026 entstand eine Welle von **Bauprojekten**, die Jev nicht als Klassifikator zeigen, sondern als **Ingredienz in Schleifen**. Diese Demos sind die informativste Evidenzlage, die es zu Jev gibt — informativer als die Benchmark-Tabellen, weil sie sichtbar machen, was das Modell tatsächlich trägt und was nicht. Belastbarkeit: überwiegend Selbstdarstellung von Erbauern (⚠️), ein Fall mit dokumentiertem Ausgang (AI/ML API).
|
||
|
||
## Die Demos und was sie jeweils beweisen
|
||
|
||
| Bauprojekt | Autor (Datum) | Was gezeigt wird | Belastbarkeit |
|
||
|-----------|---------------|------------------|---------------|
|
||
| **Wikipedia-Races** | Matthew Berman (18.09.2026) | Link-Klicken als Sequenz von `Choice`-Entscheidungen; Zielerreichung in Bruchteilen von Sekunden statt Sekunden bei LLMs (GPT-5.6 Terra, Haiku, Sonnet 5) | ⚠️ Video, kein Transcript; Konkurrenzwerte nicht nachvollzogen |
|
||
| **Doom spielen** | Matthew Berman | Entscheidung pro Tick („was jetzt tun?") in einer Echtzeit-Schleife | ⚠️ Demo, kein Messaufbau veröffentlicht |
|
||
| **Kleinstadt-Simulation** | Matthew Berman | Charaktere reagieren parallel auf Ereignisse (Bäckerei-Ausverkauf, Schlangen-Bedrohung) in unter einer Sekunde | ⚠️ Demo |
|
||
| **Skittles-Sortierung** | Matthew Berman | Massenhafte Score-/Choice-Urteile pro Sekunde | ⚠️ Demo |
|
||
| **Schach (Blitz 5+0)** | [[../../institutions/ai-ml-api.md|AI/ML API]] (16.09.2026) | Ein API-Call pro Zug. **Gegen Fable 5.1:** materiell unterlegen (nach Zug 29 −16), aber Fable verbrannte 6–15 s pro Zug auf Analyse und verlor **auf Zeit**; Jev antwortete in ~2,6 s. **Gegen GPT-6 Astra:** Matt in 18 Zügen (Qe1#), Astra mit 2:27 Restzeit | ✅ **Dokumentierter Ausgang**, aber Einzeltest ohne Wiederholung; Autorenangabe |
|
||
| **Unclutter** (Ad-/Slop-Blocker) | [[../../people/kitze.md|kitze]] (17.09.2026) | Browser-Erweiterung, die Seiten von Ads, Cookie-Bannern, Upsells und Dialogen befreit; BYOK, Open Source | ⚠️ Produktankündigung; Wirksamkeit nicht nachgeprüft |
|
||
| **Agent mit Jev-Modellrouter** | [[../../people/riley-brown.md|Riley Brown]] (17.09.2026) | Jev als Router-Entscheider im Agenten (deckt sich mit TypeSafes dokumentiertem Muster „nächsten Tool/Subagent wählen") | ⚠️ Ankündigung |
|
||
| **„Tesla FSD nachgebaut in <1 h"** | [[../../people/justin-schroeder.md|Justin Schroeder]] (16.09.2026) | 568.108 Views, 4.580 Likes — der viralste Einzelpost nach der Ankündigung | ⚠️⚠️ **Höchstgradig vage**: „rebuilt Tesla Full Self Driving" beschreibt keinen messbaren Aufbau; mit Abstand die schwächste Evidenz der Reihe |
|
||
| **Melee spielen** | [[../../people/alex-the-alex.md|@The_Alex]] (17.09.2026) | Spielentscheidungen im Loop | ⚠️ Kleiner Post (2.478 Views) |
|
||
| **Sprachsteuerung Mac** (Notes, Arc, Google, x.com, Photo Booth) | [[../../people/andy-gao.md|Andy Gao]] (18.09.2026) | Sprechbefehl → UI-Aktion; App offen, während der Satz noch läuft. **Lokal ausgewertet** (STT + 9 Standbilder): Zielzustände sichtbar, während das Transkript-Overlay unvollständig ist — belastbarste Einzelaussage der Welle | ⚠️ Keine Messung, kein Code; ein lokales STT mit Schlüsselwort-Matching würde dieselben Bilder erzeugen |
|
||
|
||
Zur Vorsicht bei der Zuordnung: Die Zuschreibungen stammen aus der **Quellenliste des Videos** und den dort verlinkten Posts, nicht aus einer Video-Auswertung.
|
||
|
||
## Was die Reihe zusammen zeigt
|
||
|
||
- **Der Schleifen-Slot ist real.** Die Demos funktionieren alle nach demselben Muster: Ein System liefert einen sich schnell ändernden Zustand, Jev wählt daraus in Millisekunden die nächste Aktion. Das ist genau der Slot, den im Wiki [[../agents/harness-loop-graph-engineering.md|die Harness-Ebene]] beschreibt — nur ohne Sprachmodell darin.
|
||
- **Geschwindigkeit schlägt Qualität pro Zug — manchmal.** Das Schach-Resultat ist das lehrreichste Datum der ganzen Welle: Fable 5.1 spielte besser und verlor trotzdem, weil die **Zeitökonomie** des Formats den besseren Bewerter nicht trug. Das ist die klarste Illustration des Verkaufsarguments („Checks sind so billig, dass man sie laufend macht", siehe [[../agents/agent-budget-breaker.md|Kostendeckel]]) — und zugleich seine Grenze: Wo Qualität pro Zug die einzige Metrik ist, hilft Tempo nicht.
|
||
- **Der Sponsor sitzt am Rand, nicht im Kern.** Das Video läuft mit ausgewiesener bezahlter Werbung (Zapier). Der Produktkern wird nicht über den Sponsor erklärt, sondern über eigene Demos — das trennt diesen Beitrag von einem reinen Werbespot, macht ihn aber auch nicht unabhängig.
|
||
- **Viralität misst Aufmerksamkeit, nicht Substanz.** Der FSD-Post ist der reichweitenstärkste und der inhaltsleerste. Wer aus Engagement auf Belastbarkeit schließt, liegt hier komplett daneben.
|
||
|
||
## Einordnung: Demo-Welle statt Benchmark-Debatte
|
||
|
||
Das Muster erinnert an die ersten Wochen anderer Basismodelle: Solange keine unabhängigen Benchmarks existieren, entsteht Ersatz-Evidenz durch **öffentlich nachbaubare Projekte**. Das hat Vor- und Nachteile.
|
||
|
||
Vorteile: Demos zeigen Fähigkeiten, die kein Benchmark abfragt — Echtzeitverhalten, Verhalten im Loop, Verhalten unter Zeitdruck. Der Schach-Fall etwa wäre in keinem Standard-Eval aufgetaucht.
|
||
|
||
Nachteile: Demos sind nicht reproduzierbar, nicht kontrolliert und fast immer selbstveröffentlicht. Sie messen den Enthusiasmus des Erbauers mit. Für die TypSafe-Bewertung im Wiki bleibt daher die Reihenfolge: Anbieterangabe → unabhängiger Einzeltest (Every) → Demo-Welle (diese Seite) → alles weitere offen.
|
||
|
||
## Offene Punkte
|
||
|
||
- ⚠️ **Kein Transcript** des Berman-Videos; die Demos sind über die Beschreibung, die Quellenliste und eine Sekundärzusammenfassung beschrieben.
|
||
- ⚠️ Kein einziger Demo-Aufbau ist veröffentlicht (Code, Daten, Wiederholungen); Reproduzierbarkeit durch Dritte nicht gegeben.
|
||
- ⚠️ Ob die genannten Modelle (GPT-5.6 Terra, Haiku, Sonnet 5) im Vergleich dieselbe Aufruf-Ökonomie hatten, ist nicht dokumentiert.
|
||
- Offen: ob Jev **im Takt** einer Echtzeitschleife stabil bleibt (Drift, Kalibrierung über längere Läufe) — dazu sagt keine Demo etwas.
|
||
- Offen: die im Video verwendete Jev-Version. Der Schach-Post nennt „Jev V13", die Launch-Kommunikation nennt keine Versionsnummer.
|
||
|
||
## Dateisortierung — Eigenmessung aus der Gruppe (19.09.2026)
|
||
|
||
Der greifbarste Anwendungsfall stammt aus der eigenen Runde: Pit Weber veröffentlichte am 19.09.2026 einen deutschsprachigen Erklär-Flyer („Jev — Die Kombi-Revolution", mit GrokBot und Sprachsteuerung erstellt), der einen **eigenen Live-Test** dokumentiert — 304 Objekte aus einem Dokumente-Ordner, sortiert in 7 Kategorien plus `_Archiv`, mit Vorher-/Nachher-Bildern (Raw: `raw/other/2026-09-19_jev-flyer-kombi-revolution.md`).
|
||
|
||
Die Zahlen des Flyers, gegen die Anbieter-Limits gerechnet:
|
||
|
||
| Angabe im Flyer | Eigene Rechnung | Befund |
|
||
|-----------------|-----------------|--------|
|
||
| 304 Dateien in **0,09 s** | bei 250.000 Token/s max. 22.500 Token → **≤ 74 Token pro Datei** | ✅ passt zu Dateinamen; die **Selbstkorrektur des Flyers** („war Namens-/Format-Heuristik") wird von den Limits gestützt |
|
||
| 304 Dateien für **$0,15** | entspricht 3,57 Mio. Input-Token → Mindestdauer **≈ 14,3 s** | ⚠️ **unvereinbar mit den 0,09 s** — die beiden Werte können nicht denselben Lauf beschreiben |
|
||
| „**181-mal schneller**" | Zeitverhältnis 408 s / 0,09 s = **~4.533×**; Kostenverhältnis 0,48/0,15 = **3,2×** | ⚠️ 181 folgt aus **keiner** der genannten Zahlen |
|
||
| 400 PDFs, **340 klassifiziert** (~1,2 min) | Erfolgsquote **85 %**, 60 ohne Klassifikation | ⚠️ Qualitätszahl, nicht als solche ausgewiesen |
|
||
| „400 PDFs öffnen, Text extrahieren, klassifizieren" | Jev nimmt **nur Text** entgegen | ⚠️ Öffnen und Textextraktion sind **Fremdschritte**; bei 0,18 s pro PDF liegt die Laufzeit praktisch vollständig dort, nicht bei Jev |
|
||
|
||
**Kein Angriff auf den Flyer, sondern seine Fortsetzung:** Er korrigiert sich in Punkt 7 selbst und trennt Namens-Heuristik von Inhaltsprüfung. Die Rechnung liefert zu dieser Ehrlichkeit die Bestätigung — mit der Einschränkung, dass die beiden Headline-Zahlen vor der weiteren Verbreitung nachgezogen werden sollten. Es ist dasselbe Muster wie in dieser ganzen Akte: **die Größenordnung stimmt, die konkreten Faktoren werden beim Weitererzählen jedes Mal größer.**
|
||
|
||
### Folge: Version 11 (verifizierte Korrektur, 19.09.2026 12:55 UTC)
|
||
|
||
Der Flyer wurde nach dieser Prüfung **überarbeitet**; der Kurzlink https://telegra.ph/Jev-Flyer-09-19 führt fest auf die jeweils aktuelle Fassung. Korrektur-Raw mit Fassungsvergleich: `raw/other/2026-09-19_jev-flyer-v11-korrektur.md`; die Erstfassung bleibt unverändert in `raw/other/2026-09-19_jev-flyer-kombi-revolution.md`. Übernommen und am Text von v11 verifiziert:
|
||
|
||
- **Trennung der zwei Läufe:** „reine Entscheidungszeit … 0,09 Sekunden — nur die Sortierentscheidung, nicht das Öffnen“ gegen „Gesamtlauf inkl. Öffnen/Extrahieren: rund 14 Sekunden. Kosten gesamt: 0,15 Dollar“, samt Rechenweg im Text.
|
||
- **„181ד entfernt** — die Zeichenkette kommt in v11 nicht mehr vor; der LLM-Wert ist als „Gesamtprojektion“ gekennzeichnet.
|
||
- **Konsistenzcheck Stufe 2** ergänzt: 0,18 s pro PDF als Wandzeit mit Extraktion, bewusst nicht mit der 0,09-s-Heuristik vermischt.
|
||
|
||
**Verbleibende Beanstandung (Stand v11):** Die neue Zahl „~4.500× schneller **in der reinen Entscheidungszeit**“ mischt weiterhin zwei Bezugsgrößen — der Zähler (408 s) ist die *Gesamtprojektion* des LLM-Wegs, der Nenner (0,09 s) Jevs *reine Entscheidung*. Sauber wären **Gesamt gegen Gesamt ≈ 29×**, oder der Hinweis, dass für den LLM-Weg kein reiner Entscheidungswert vorliegt. Dazu ein abgebrochenes Zitat („Die frühere Formel „“) und ein „Jeff“ statt „Jev“ in Abschnitt 9.
|
||
|
||
Der Kern bleibt belastbar: **Die 0,09 Sekunden sind eine Mikroentscheidungs-Latenz, kein vollständiger Inhaltsanalyse-Lauf.** Das ist die erste Stelle in dieser Akte, an der eine Behauptung nach Prüfung tatsächlich nachgezogen wurde, statt nur weiterzuwandern.
|
||
|
||
## Praxistests auf Workflow-Ebene (19.09.2026)
|
||
|
||
Der bislang praxisnächste Test kommt von **[[../../people/nate-herk.md|Nate Herk]]** („I Tested Jev on 12 Real Use Cases", 19.09.2026, 13.549 Aufrufe, kein Transkript; Raw: `raw/youtube/2026-09-19_nate-herk-jev-12-use-cases.md`). Anwendungsfälle: E-Mail-/Support-Triage, Kommentar-Routing, X-Feed-Classifier (Erweiterung), Clip-/CRM-/Vertrags-Vorfilter, Paper-Trading-Prototyp.
|
||
|
||
Seine Zahlen, gegen Preis und Rate Limits gerechnet:
|
||
|
||
| Test | laut Video | Token (aus $0,042/MTok) | pro Einheit |
|
||
|------|-----------|--------------------------|-------------|
|
||
| 1.000 Mails, 7 Regeln | 6 s / 9 Cent (vorher 70 s / 9 Cent) | 2,14 Mio. | ~2.143 |
|
||
| 1.000 Mails, 1 Ja/Nein-Regel | 4 s / 5 Cent | 1,19 Mio. | ~1.190 |
|
||
| 1.000 YouTube-Kommentare | 5 s / 5 Cent | 1,19 Mio. | ~1.190 |
|
||
| Dashboard | 20.000 Requests / 85 Cent | 20,24 Mio. | ~1.012 |
|
||
| LLM-Vergleich, 1.000 Mails | 5 min / 62 Cent | — | — |
|
||
|
||
**Befund 1 — die Kostenwerte sind intern konsistent.** Die Differenz zwischen 7-Regel- und 1-Regel-Lauf (≈950 Token) entspricht rund 160 Token pro Zusatzfrage; die 1.012 Token pro Request aus dem Dashboard liegen zwischen beiden Mail-Werten. Alle vier Angaben sind mit **derselben** Preisformel vereinbar — das ist in dieser Akte die Ausnahme.
|
||
|
||
**Befund 2 — die Laufzeiten liegen an oder über den dokumentierten Limits.** 2,14 Mio. Token in 6 s verlangen ~357.000 Token/s gegen 250.000 dokumentierte (**1,43×**); 1,19 Mio. in 4 s verlangen ~298.000 (**1,19×**); die 5-s-Angabe bleibt mit ~238.000 innerhalb. Auf der Request-Seite wären 1.000 Mails in 6 s bei einem Aufruf pro Mail **10.000 Requests/Minute** — das Achtfache des dokumentierten Limits (1.200/min). Das geht nur mit Bündelung mehrerer Mails pro Aufruf (bei ~2.100 Token/Mail erlauben die 64k/32k-Grenzen etwa 14) oder mit erhöhtem Kontingent. **Nicht als Widerspruch geführt**, sondern als offene Frage: konservative Doku, Sonderkontingent oder optimistische Stoppuhr.
|
||
|
||
**Befund 3 — der Praktiker zieht die richtige Grenze.** „Jev ersetzt kein LLM": es schreibt nicht, fasst nicht frei zusammen, erkennt keine offenen Muster; es braucht vorab definierte Fragen, Kategorien und Skalen. Für Browser-Steuerung muss es an etwas übergeben, das tatsächlich handelt. Seine Empfehlung — **Evals mit Golden Dataset** gegen stärkere LLMs vor jedem Produktiveinsatz — deckt sich mit der Label-Kritik ([[../../people/gabriel-anhaia.md|Anhaia]]) und mit [[../../people/cj-zafir.md|CJ Zafirs]] „Jev + LLMs".
|
||
|
||
⚠️ Kein Transkript erreichbar (Bot-Check), Zahlen über das Bot-Briefing; **Genauigkeitswerte nennt das Briefing nicht** — verglichen werden Geschwindigkeit und Kosten, nicht Korrektheit. Beschreibung mit werblichen Elementen (Glaido, Hostinger).
|
||
|
||
## Demo-Recap brivael (18.09.2026, verifiziert 22.09.)
|
||
|
||
**[[../../people/brivael.md|Brivael Le Pogam]]** (@brivael, CEO&CTO von Argil AI) veröffentlichte am 18.09.2026 den bislang einzigen **französischsprachigen, namentlich personifizierten Recap der Demo-Welle** (32.726 Views / 380 Bookmarks; Raw: `raw/xpost/2026-09-18_brivael-jev-demo-recap.md`; geteilt von Rüdiger mit „Verifiziere."). Er nennt zehn Demos mit Zahlen — darunter mehrere, die im Wiki bislang fehlen: Voice-Browser („~300 ms, $0,0002 pro Entscheidung"), Trading-Bot auf Monad (real, alle 300 ms), **Ads-Klassifikation in Serie** (724 Ads/40 s/9 ¢ und 1.891 Ads/19 s/12 ¢), **Compaction-Plugin** („1 Mio. Token → 86k in einer Sekunde"), UI-Assemblierung (153 Fragen parallel in ~1 s), und das **Confidence-Gate** („Confiant → on saute le LLM. Pas sûr → le frontier reste. Sur 10 items, 6 ne touchent plus jamais le modèle cher") — exakt die Gate-Logik, die Almeida am 21.09. selbst als Design beschreibt.
|
||
|
||
**Prüfungsergebnis (Preis/Limits):**
|
||
- ✅ Doku-Angaben korrekt: $42/Btok, 70–500 ms, Stealth, Choice/Score/Boolean; „S'il n'est pas sûr, il le dit" deckt sich mit N8s Kalibrierung (ECE 1,74 pp).
|
||
- ⚠️ **Ian: 4,2 Mio. Token für „13 centimes"** — bei $0,042/MTok sind das 17,6 Cent; 13 Cent ergeben nur 3,1 Mio. Token (~26 % Abweichung). Isenberg nennt 18 Cent bei denselben 4,2 Mio. Token — die Recaps widersprechen einander.
|
||
- ⚠️ **Alex: „1 Mio. Token in einer Sekunde"** — Lesen von 1 Mio. Token braucht bei 250.000 Token/s **mindestens ~4 s**; der Faktor ~4 ist physikalisch nicht unterschreitbar.
|
||
- ⚠️ **Michael: 153 Fragen parallel in ~1 s** = ~9.180 Requests/Minute gegen 1.200 — nur mit Bündelung möglich (gleiche offene Frage wie bei [[../../people/nate-herk.md|Nate Herk]]).
|
||
- ✅/⚠️ Übrige Zahlen limit-konform (Moritz ~159k tok/s, Matt ~54k, Ori ~150k, Jarrod 200 RPM), aber unverifiziert.
|
||
|
||
⚠️ **Der Tweet verlinkt keine der zitierten Original-Demos** — kein Handle, keine Post-URLs. Der Recap bleibt deshalb Verbreitungssignal und Demo-Inventar; die neuen Zahlen gelten als nicht verifiziert, bis die Original-Posts auftauchen. Identifizierung mit den oben dokumentierten Demos (Flug ≈ Isenberg 7,1 s; Voice ≈ Andy Gao) bleibt unklar.
|
||
|
||
## Verwandte Wiki-Seiten
|
||
|
||
- [[system-one-models-jev.md]] — Modell, RLCD, Anbieterangaben, unabhängiger Every-Test
|
||
- [[jev-vercel-ai-gateway.md]] — Verteilung über den Gateway, Isenberg-Post
|
||
- [[../../institutions/typesafe-ai.md]] — Anbieter
|
||
- [[../../people/matthew-berman.md]] — Kanal, der die Welle gebündelt hat
|
||
- [[../../people/diogo-almeida.md]] — Ankündigungspost 15.09.2026
|
||
- [[../agents/jev-sprachsteuerung-computer-use.md]] — Sprachsteuerung als Computer-Use (Andy Gao, lokal geprüft)
|
||
- [[../agents/harness-loop-graph-engineering.md]] — Schleifen-Ebene
|
||
- [[../agents/agent-budget-breaker.md]] — Kostendeckel und Freigrenzen
|
||
- [[harness-vs-standalone-chat-llm.md]] — Gate vs. Generierung
|
||
|
||
## Quellen
|
||
|
||
- [YouTube: „We need to talk about Jev..."](https://www.youtube.com/watch?v=2z-7pIj57f8) (Matthew Berman, 18.09.2026, 12:30; mit Werbekennzeichnung; kein Transcript abrufbar)
|
||
- [Diogo Almeida: Jev-Launch-Post](https://x.com/CompleteSkeptic/status/2099925682726002904) (15.09.2026, 34,9 Mio. Views)
|
||
- [AI/ML API: Jev vs. Fable 5.1 vs. GPT-6 Astra (Schach)](https://x.com/aimlapi/status/2100372930282573876) (16.09.2026)
|
||
- [kitze: Unclutter](https://x.com/thekitze/status/2100595129874817340) (17.09.2026) · [Riley Brown: Jev-Modellrouter](https://x.com/rileybrown/status/2100607709317861879) (17.09.2026) · [Justin Schroeder](https://x.com/jpschroeder/status/2100347770867458384) (16.09.2026) · [@The_Alex](https://x.com/The_Alex/status/2100431093862367696) (17.09.2026)
|
||
- Raw: `raw/youtube/2026-09-18_berman-jev.md`, `raw/xpost/2026-09-15_almeida-jev-launch-post.md`
|