From d649f2511f04f71bed16a4b69da7c3501245e98f Mon Sep 17 00:00:00 2001 From: Hector Date: Sat, 19 Sep 2026 00:40:27 +0200 Subject: [PATCH] ingest(other): herman-briefing zu jev per stt + token-aufschluesselung - raw: briefing-transcript (grok-stt de, 8.677 zeichen) inkl. zahlen-deckungstabelle - wiki: jev-vercel-ai-gateway (abschnitt episodeninhalt: 4,2m input/500k output/18 cent; 200ms als verdichtung; clipping 17 highlights/1,1m token/3s; flug zrh-lhr 7,1s) - index 223. update + log --- ...26-09-18_herman-briefing-jev-transcript.md | 93 +++++++++++++++++++ wiki/concepts/llm/jev-vercel-ai-gateway.md | 22 ++++- wiki/index.md | 4 +- wiki/log.md | 20 ++++ 4 files changed, 136 insertions(+), 3 deletions(-) create mode 100644 raw/other/2026-09-18_herman-briefing-jev-transcript.md diff --git a/raw/other/2026-09-18_herman-briefing-jev-transcript.md b/raw/other/2026-09-18_herman-briefing-jev-transcript.md new file mode 100644 index 0000000..c8aa635 --- /dev/null +++ b/raw/other/2026-09-18_herman-briefing-jev-transcript.md @@ -0,0 +1,93 @@ +--- +type: other +source_url: "telegram://-1003839640481/topic/14967#msg14977" +retrieved: 2026-09-18 +title: "HermanButlerBot — Audio-Briefing zu Jev (Greg Isenberg / Ryan Vogel, Video 'Jev is HERE. How to use it')" +author: "Herman (HermanButlerBot, Bot in OME-Gruppe)" +has_transcript: true +transcript_source: "Audio-Briefing (09:42, deutsch) aus der Briefing-Pipeline; STT: xAI Grok STT, Sprache de — NICHT das Originalvideo" +tags: [jev, typesafe-ai, greg-isenberg, ryan-vogel, briefing, stt, clipping, browser-agent, schema, decision-model] +--- + +# Herman-Briefing zu Jev — Transkript (STT, 18.09.2026) + +## Kontext + +Kai (@PWeber) postete am **18.09.2026 22:38 UTC** im OME-Topic „JEV" das fertige Briefing-Video (`.mp4`, 15,3 MB) mit dem Begleittext eines deutschen Audio-Briefings (09:42) und integrierter Infografik. Das Briefing bezieht sich auf die Episode **„Jev is HERE. How to use it"** von Greg Isenberg mit Ryan Vogel ([[../../raw/xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md|Raw zum begleitenden X-Post]]). + +⚠️ **Quellenart:** Das ist die **Zusammenfassung eines Dritten** (Bot-Briefing), nicht das Originalvideo. Die Zahlen des Briefings gehen teils über die im begleitenden X-Post genannten hinaus; ein eigenes Transcript des Originalvideos liegt weiter nicht vor. + +⚠️ **STT-Fehler im Rohtext beibehalten** (Grok STT, de): „JEF/Jeff/JDiff/Jed" = **Jev** · „Greg Eisenberg" = **Greg Isenberg** · „Ryan Fogel" = **Ryan Vogel** · „Vessel Gateway" = **Vercel AI Gateway** · „Luna"/„Terra"/„Sol"/„Opus 5" sind überwiegend korrekt, teils als „Lune" verschliffen · „1, 1 Millionen" = 1,1 Millionen. + +## Transkript (Wortlaut, STT) + +Stell dir vor, du sitzt an einem Schreibtisch, du hast eine massive, unfassbar komplexe Aufgabe vor dir, tausende von unsortierten Datenpunkten, du übergibst diese Aufgabe an eine KI, du drückst die Enter-Taste und dann wartet man. Genau, du lehnst dich zurück und wartest auf die Antwort, wir alle kennen diesen Moment, der Cursor blinkt, der Cursor blinkt und langsam Wort für Wort baut sich ein ewig langer Text auf dem Bildschirm auf, was ja durchaus Zeitfrist. Eben, aber dieses Mal passiert das nicht. Okay. In dem exakten Bruchteil einer Sekunde, in dem dein Finger die Enter-Taste loslässt, ist die Aufgabe erledigt. Krass. Keine absätzevolle Erklärungen, kein langes Nachdenken der Maschine, einfach nur die pure, mathematisch präzise Entscheidung, direkt da und sofort abrufbar. + +Genau, sofort. Und das stellt eigentlich die komplette Architektur auf den Kopf. Inwiefern? N Wir sind in den letzten Jahren regelrecht darauf konditioniert worden, KI als Konversationspartner zu betrachten. Ja, absolut, wir chatten mit der KI. Genau, wir diskutieren, aber Greg Eisenberg und Ryan Fogel demonstrieren ein völlig neues KI-Paradigma. Das System namens JEF. + +Richtig, JEF redet nicht mit dir. Gar nicht. Nein, JEF ist ein reines blitzschnelles Entscheidungsmodell. Okay. Es verarbeitet Datenpunkte als Klassifikator. Und das in unserer heutigen Analyse im Detail an, denn wenn man diese Chat-Komponente komplett weglässt, passieren gewaltige Dinge mit der Geschwindigkeit und vor allem mit den Kosten. Genau, aber bevor wir tief in diese harten Messwerte eintauchen, lass uns kurz klären, was JEF eigentlich genau ausgibt. + +Ja. Du sagst: "Klassifikator". Wenn ich ChatGPT eine Frage stelle, kriege ich einen kleinen Aufsatz. Richtig. Was kriege ich von JEF? Harte. Okay. + +Und zwar in einer absolut star vorgegebenen Datenbankstruktur. Wie nennt man das? Entwickler nennen das ein Schema. Ein Schema. Genau. Jev liefert direkte Wahrscheinlichkeitswerte zurück. Also keine Sätze. + +Keine Sätze, keine Füllwörter, nur Zahlen. Das System umgeht diese rechenintensive Textgenerierung vollständig. Das Ergebnis ist also eine absolute Präzision ohne ausufahrende Texte. Exakt. Greg Eisenberg bringt da im Material eine Analogie, die das enorm gut veranschaulicht. Die Sache mit der Kreuzung. Genau. + +vergleicht herkömmliche KI mit einem Philosophen an einer Kreuzung. Und Jef agiert als digitaler KI-Verkehrspolizist. Das Bild trifft es perfekt. Stell dir vor flut an Informationen, also Autos, die aus allen Richtungen auf diese Kreuzung zufahren. Ja. Der KI-Filosoph hält jedes Auto an. führt ein kurzes Gespräch mit dem Fahrer. + +Richtig. überlegt laut, warum es besser ist, links abzubiegen. Und schreibt dann einen Bericht darüber. Was massiv Zeit kostet. Jeff hingegen ist der Verkehrspolizist mit der Trillerpfeife. schaut aufs Auto, pfeift, zeigt nach links, nächstes Die sofortige Zuweisung. Genau. + +Die unstrukturierten Informationen fließen ein und Jeff entscheidet sofort über die exakte Weiterleitung und Priorität. Ryan Vogel macht die technischen Details dahinter sehr deutlich. Was passiert da im Hintergrund? Herkömmliche Modelle führen einen lauten internen Denkprozess durch. Dieses sogenannte Reasoning. Richtig. Sie generieren Token für Token ihre Denkschritte, bevor sie zur eigentlichen Antwort kommen. + +Und Jeff liefert keine Textantworten. Es übers Komplett. Die Eingabe eines Objekts liefert exakte Zahlenwerte. Hast du da ein Beispiel? Ja, zum Beispiel liefert es einen Wert von null Komma neunzig für eine neunzigprozentige Wahrscheinlichkeit. okay. Entwickler profitieren massiv davon, weil diese Ausgabe typesafe ist. + +Genau, typesafe. Was heißt das konkret für den Programmcode? Das bedeutet, dass der Datentyp absolut garantiert ist, also die nackte Zahl. Richtig, wenn dein Code eine Zahl erwartet Dann stürzt das Programm einfach ab. Verstehe. Es verlangt den Wert, bei Jeff wird die Ausgabe ohne Umwege direkt in den Programmcode integriert. Und das bringt uns thematisch von der Theorie direkt zur messbaren Praxis. + +Zur Ryans E-Mail-Demonstration. Genau. Wir fokussieren uns jetzt mal auf die harten Messwerte. Denk mal an deinen eigenen E-Mail-Posteingang. Nach dem Urlaub. Ja, hunderte Mails, alles durcheinander. Ein gigantisches Datenproblem präsentiert in seinem Experiment exakte Metriken dazu. + +zeigt, wie JDiff ein Postfach mit exakt 1700 E-Mails verarbeitet. 1700 E-Mails. Ja, die Daten zeigen dabei einen Verbrauch von 4, 2 Millionen Input-Token. Das ist die schiere Masse an Text, die in das System hineinfließt. Ja. Und die Ausgabe? 500.000 Output-Token. + +Okay. Das ist stark komprimiert. Absolut. Und die Gesamtkosten 18 US-Cent. 18 Cent? 18 US-Cent für 1700 komplexe Routingentscheidungen. Das ist unfassbar günstig. + +Und eine einzelne Anfrage benötigt konstant rund 200 Millisekunden. 200 Millisekunden. Ein Wimpernschlag. Und in dieser Zeit ordnet Jef jede E-Mail fehlerfrei. Richtig. Nach Kategorie, Priorität, Spam-Wahrscheinlichkeit und Antwortdringlichkeit. Die Daten zeigen da auch direkte Warnungen auf. + +Ja Zum Beispiel eine Warnung wie "neunzig Prozent Wahrscheinlichkeit für einen Accountverstoß", das feuert das System einfach in die Datenbank. Exakt, und das triggert dann direkt einen Alarm beim Security-Team. Ohne dass jemand eine Zusammenfassung lesen muss. Niemand liest einen Text. Das zeigt enorm deutlich, wie diese Verarbeitungsgeschwindigkeit bestehende Geschäftsprozesse transformiert. Wir sehen das auch bei der Lead-Klassifizierung. Richtig, wir analysieren jetzt den Lead-Anwendungsfall, den Ryan Vogel Eine Grafikdesignagentur. + +Und da kommen über das Kontaktformular unzählige Anfragen rein. Vom Großkonzern bis zu Leuten ohne Budget. Genau. Jeff bewertet jetzt eingehende Kontaktformulare sofort. Auf einer Skala von 0 bis 1. Ein Lead mit 98% Qualität erzwingt dann eine sofortige Reaktion des Teams. Das System erkennt sofort die Parameter. + +Während niedrigere Werte unentschlossene Kunden herausfiltern. Kunden, die mehr manuellen Aufwand bedeuten. Und Rein Vogel demonstriert ergänzend noch den Video-Anwendungsfall. Da geht es richtig große Datenmengen. Richtig, ein komplettes Video-Transkript wird in das System eingespeist. Wie viele Token sind das? In diesem Versuch analysiert Jeff 1, 1 Millionen Token. + +Wow. 1, 1 Millionen. Ja, und das in rund drei Sekunden. In drei Sekunden liest das System ein komplettes Transkript und extrahiert exakt siebzehn relevante Highlights für Kurzvideos. Das ist enorm präzise. Wobei irrelevante Füllwörter komplett ignoriert werden. Das System sucht ausschließlich nach dem Schema. + +Genauso ist es. Wir ziehen daraus jetzt mal die direkte Konsequenz für Live-Anwendungen im Browser. Wegen der extremen Geschwindigkeit. Ja. lässt Jed einen Flug auswählen und buchen. Von Zürich nach London. Richtig. + +Und das dauert exakt 7, 1 Sekunden. Von der leeren Seite bis zur Buchung. 7, 1 Sekunden. Herkömmliche KI-Agenten benötigen für denselben Prozess 1 bis 3 Minuten, weil sie den internen Monolog führen. Genau. Sie schreiben erst einen Plan, dann handeln sie. Jeff, handelt sofort. + +Wir definieren an dieser Stelle aber auch die klaren Systemgrenzen. Das ist ein wichtiger Punkt. Ryan Vogel macht sehr deutlich, wo Jeff if ungeeignet ist. Zum Beispiel? Jeff ist ungeeignet für Aufgaben wie Bitcoin-Trading oder komplexe Aktienanalysen, die echtes vorausschauendes Nachdenken erfordern. Solche Disziplinen erfordern Modelle wie GPT-6-Astra, Modelle, die Nachrichten querlesen und tiefgreifend analysieren. Jeff ist ein reiner Routing- und Klassifizierungsentdecker. + +Ein Verkehrspolizist. Der sofortige Zugang zu Jeff erfolgt aktuell übrigens über das Vessel Gateway. Da integriert man das System direkt. Richtig. Und das richtet unseren Blick auf einen finalen, tiefgehenden Denkanstoß für die Zukunft der Arbeitswelt. Genau. Die Kombination aus dieser 200 Millisekunden-Reaktionszeit, den minimalsten Kosten im Cent-Bereich und der direkten Programmierbarkeit elim Was schließt die Analyse sehr treffend ab, wenn jede alltägliche Routingentscheidung in Millisekunden gelöst ist. + +Was passiert dann mit unserer Arbeit? Dann verschiebt sich der menschliche Fokus zu 100% auf das Design der Aufgabenstruktur. Wir sichten keine Informationen mehr. Wissen und Kreativität fließen nicht mehr in die Bearbeitung der Daten, sondern in die Definition des perfekten Schemas. Das ist die wichtigste Arbeit ab sofort. Das Festlegen der Kategorien, nach denen Das bedeutet für dich, wenn du das nächste Mal vor unsortierten Aufgaben stehst, du stellst dir nicht mehr die Frage, wie die Daten fließen, du fragst dich nur noch, welche neuen Straßen du baust diesen Datenfluss an sein Ziel zu lenken. + +## Zahlen des Briefings — und ihre Deckung + +| Angabe im Briefing | Deckung | +|--------------------|---------| +| **1.700 E-Mails, 4,2 Mio. Input-Token, 500.000 Output-Token, 18 US-Cent** | ✅ deckt sich exakt mit der unabhängigen Messung aus dem Quellvideo (Every/Isenberg-Strang); die Token-Aufschlüsselung ist hier erstmals im Wortlaut des Briefings enthalten | +| **rund 200 ms pro Anfrage** | ⚠️ liegt *über* der TypeSafe-Anbieterangabe von 70–500 ms Spanne; als Briefing-Angabe geführt, nicht als Messwert | +| **17 relevante Highlights aus 1,1 Mio. Token in ~3 s** (Clipping-Test) | ⚠️ nur im Briefing; im begleitenden X-Post nicht genannt, nicht gegengeprüft | +| **Flug Zürich → London buchen in 7,1 s** (Browser-Steuerung), herkömmliche Agenten 1–3 min | ⚠️ nur im Briefing; Vergleichswerte ohne Messaufbau | +| **Lead-Bewertung auf Skala 0–1, Lead mit 98 % Qualität** | ⚠️ nur im Briefing; illustrativer Anwendungsfall | +| **Zugang: „Vessel Gateway"** | ✅ gemeint ist der **Vercel AI Gateway** (STT-Fehler); Zugang über den Gateway ist lokal verifiziert (siehe `raw/blog/2026-09-16_vercel-jev-ai-gateway.md`) | +| **Ungeeignet für Trading/Aktienanalysen** | ⚠️ Einordnung des Briefings; deckt sich in der Richtung mit „nicht für tiefes Reasoning" aus dem Quellvideo | +| Kostenangabe „etwa 1/1.000 Cent pro Test" | im Briefing-Wortlaut **nicht** gefunden; als Begleittext-Angabe nicht bestätigt | + +## Wichtigste Einordnung des Briefings selbst + +Der Schlussteil formuliert die eigentliche These: Wenn jede alltägliche Routingentscheidung in Millisekunden gelöst ist, verschiebt sich menschliche Arbeit „zu 100 % auf das Design der Aufgabenstruktur" — „wir sichten keine Informationen mehr", sondern definieren das **Schema**. Wissen und Kreativität fließen nicht mehr in die Bearbeitung der Daten, sondern in die Definition der Kategorien. Das ist die klarste Formulierung des eigentlichen Produktversprechens von Jev: nicht Antwort, sondern **Kategorien-Design**. + +## Offene Punkte + +- ⚠️ Briefing eines Dritten (Bot-Pipeline), nicht das Originalvideo; die Zahlen des Originalvideos (Skittles, Doom, Wikipedia-Races) erscheinen hier teils anders gewichtet als in der Sekundärzusammenfassung des Berman-Videos. +- ⚠️ Kein Transcript der Originalepisode; damit ist keine der Briefing-Zahlen am Original prüfbar. +- ⚠️ STT-Fehler wurden **nicht** korrigiert, sondern im Rohtext belassen und oben aufgelistet. diff --git a/wiki/concepts/llm/jev-vercel-ai-gateway.md b/wiki/concepts/llm/jev-vercel-ai-gateway.md index 675cd0f..e692fe5 100644 --- a/wiki/concepts/llm/jev-vercel-ai-gateway.md +++ b/wiki/concepts/llm/jev-vercel-ai-gateway.md @@ -1,7 +1,7 @@ --- created: 2026-09-18 updated: 2026-09-18 -sources: [xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, blog/2026-09-16_vercel-jev-ai-gateway.md] +sources: [xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, blog/2026-09-16_vercel-jev-ai-gateway.md, other/2026-09-18_herman-briefing-jev-transcript.md] tags: [concept, llm, jev, typesafe-ai, vercel, ai-gateway, ai-sdk, distribution, system-one-models, evaluation-models, structured-outputs] --- @@ -49,6 +49,22 @@ Isenberg listet Anwendungen, die sich alle als Frage an ein Entscheidungsmodell Die Formel des Posts — „find an expensive queue and put Jev at the front of it" — ist eine brauchbare Heuristik, aber sie beschreibt nur die halbe Arbeit. Vor jede Warteschlange gehört ein Gate, hinter jede Entscheidung eine Eskalation. Genau dafür liefert das Gateway die Confidence-Werte, und genau deshalb ist die Kalibrierung die entscheidende Eigenschaft (siehe [[system-one-models-jev.md|Merksatz: Type-Safety ist keine Wahrheitsgarantie]]). +## Episodeninhalt (Briefing-Transkript, 18.09.2026) + +Die Episode selbst wurde erst über ein **deutsches Audio-Briefing** (09:42) zugänglich, das Kai in OME Topic „JEV" postete; das Briefing liegt als STT-Transkript vor (`raw/other/2026-09-18_herman-briefing-jev-transcript.md`). Es ist die Zusammenfassung eines Dritten — nicht das Originalvideo —, liefert aber erstmals die **Token-Aufschlüsselung** zur bekannten Zahl: + +| Angabe im Briefing | Bewertung | +|--------------------|-----------| +| 1.700 E-Mails · **4,2 Mio. Input-Token · 500k Output-Token · 18 US-Cent** | ✅ deckt sich mit der Messung aus dem Quellvideo; die Aufschlüsselung fehlte bisher. Gegenrechnung: 4,2 Mio. × $0,042 = **$0,176** — die 18 Cent sind plausibel, die „~$0,16" aus einer automatisch erzeugten Videobeschreibung ist eine Rundungs-/Verschleifvariante | +| rund **200 ms** pro Anfrage | ⚠️ Briefing-Angabe; TypeSafe nennt eine Spanne von **70–500 ms** — die 200 ms sind eine Verdichtung, kein Messwert | +| **17 Highlights aus 1,1 Mio. Token in ~3 s** (Clipping-Test) | ⚠️ nur im Briefing; im X-Post nicht genannt | +| **Flug Zürich → London buchen in 7,1 s**; herkömmliche Agenten 1–3 min | ⚠️ nur im Briefing, ohne Messaufbau | +| Lead-Score 0–1, „Lead mit 98 % Qualität" | ⚠️ illustrativer Anwendungsfall | +| Zugang über „Vessel Gateway" | ✅ gemeint ist der **Vercel AI Gateway** (STT-Fehler), Zugang lokal verifiziert | +| „etwa 1/1.000 Cent pro Test" (Begleittext) | im Briefing-Wortlaut **nicht** gefunden, nicht bestätigt | + +**Die eigentliche These des Briefings** ist der Schluss: Wenn jede Alltagsentscheidung in Millisekunden fällt, verschiebt sich menschliche Arbeit „zu 100 % auf das Design der Aufgabenstruktur" — man sichtet keine Informationen mehr, sondern definiert das **Schema**. Das ist die klarste Formulierung des Produktversprechens: nicht Antworten, sondern **Kategorien-Design**. + ## Einordnung: Distribution als eigene Produktphase - **Gateway statt SDK-Wettbewerb.** TypeSafe verkauft kein Harness, sondern ein Modell — und verteilt es über die Schicht, die andere Harnesses ohnehin schon benutzen. Das ist der schnellste Weg in fremden Code, ohne eigene Developer-Relations-Maschine. @@ -58,7 +74,7 @@ Die Formel des Posts — „find an expensive queue and put Jev at the front of ## Quellenkritik -- ⚠️ **„1.700 E-Mails für 18 Cent"** steht im Post ohne Token-Aufschlüsselung, Datensatz oder Messung. Die Größenordnung passt zur TypeSafe-Preislogik ($0,042/MTok), die Zahl selbst ist aber zweit- bis dritthändig (externe Angabe: 4,2 Mio. Input- + 500k Output-Token). +- ⚠️ **„1.700 E-Mails für 18 Cent"** steht im Post ohne Token-Aufschlüsselung, Datensatz oder Messung. Die Größenordnung passt zur TypeSafe-Preislogik ($0,042/MTok), die Zahl selbst ist aber zweit- bis dritthändig (Briefing-Transkript nennt 4,2 Mio. Input- + 500k Output-Token; 4,2 Mio. × $0,042 = $0,176). - ⚠️ **„94 % sicher"** ist ein Illustrationswert für Kalibrierung, kein Messergebnis. - ⚠️ **193,6×/444,6×** übernimmt Vercel ausdrücklich als TypeSafe-Angabe („TypeSafe reports"), nicht als eigene Messung. - ⚠️ **Interessenlage des Posts:** Isenberg verdient an Startups und Aufmerksamkeit; der Post hat Funnel-Struktur („at the end I'll tell you how") und endet in einem Podcast-Verweis. Er ist Verteilung, nicht Prüfung — die einzige unabhängige Messung bleibt der Every-Einzeltest. @@ -78,6 +94,8 @@ Die Formel des Posts — „find an expensive queue and put Jev at the front of - [[../../institutions/vercel.md]] — Gateway-Betreiber - [[../../people/greg-isenberg.md]] — Autor des Posts - [[../../people/ryan-vogel.md]] — Gast der Episode +- [[../../people/matthew-berman.md]] — bündelte die Demo-Welle zum selben Thema +- [[jev-praxis-demos.md]] — Demo-Welle und Belastbarkeit - [[llm-model-catalog.md]] — Modellkatalog - [[harness-vs-standalone-chat-llm.md]] — Gate vs. Generierung - [[../agents/agent-budget-breaker.md]] — Kostendeckel für unbewachte Schleifen diff --git a/wiki/index.md b/wiki/index.md index 5e7bddf..f5b459b 100644 --- a/wiki/index.md +++ b/wiki/index.md @@ -2,7 +2,8 @@ *Auto-generated: 2026-07-07* -*Letzte Aktualisierung: 2026-09-18 (222. Update — Jev-Benchmarklage: Evals-Seite lokal ausgewertet + Vercel-`fx`-Guardrail-Tausch + Label-Kritik. Anlass: Zusammenfassung von DeltaKralle (@DeltaKrallenbot) in OME Topic „JEV", die Jev als „auf Augenhöhe mit Luna/Terra/Sonnet 5, **über Opus 5**" beschreibt — **invertiert**. **Lokal verifiziert:** [evals.typesafe.ai](https://evals.typesafe.ai/) HTTP 200/65.008 Byte, Text vollständig extrahierbar. Aggregat (Workflow-Modus, vier Workflows gleichgewichtet): **Jev 67,8 % · $0,0004 · 0,4 s** · luna 66,8 %/$0,0033/12,9 s · terra **67,9 %**/$0,0304/10,1 s · sonnet 5 **67,8 %**/$0,1174/78,1 s · **sol 74,1 %**/$0,0836/23,3 s · **opus 5 73,1 %**/$0,1761/37,8 s · haiku 4.5 53,6 % · DS v4 flash 64,4 % · DS v4 pro 65,5 %. Jev liegt also **auf Augenhöhe mit Terra/Sonnet 5, einen Punkt über Luna — und ~5 Punkte UNTER Opus 5 sowie ~6 unter Sol.** Je Workflow streut das Mittel stark: Customer Service 76,0 % (sol 78,3), Agent Trace 71,6 % (sol 76,6), Security Incidents 61,7 % (opus 5 66,2), **Invoice Processing 61,8 % (sol 79,1 — fast 18 Punkte zurück)**. Referenzlabels = Durchschnitt aus GPT-6 Astra + Fable 5.1 (kein Mensch, keine Ground Truth; wer gegen einen gemeinsamen Blindfleck richtig liegt, wird abgewertet); Seite legt Harness-Annahme offen („we assume that the code is correct"). **Zweiter Neubefund:** Vercel-CEO Guillermo Rauch ([@rauchg](https://x.com/rauchg), 871.158 Follower) tauscht den Sicherheits-Reviewer in `fx` (Modus „auto", prüft jeden Befehl) von GPT-5.6 Luna auf Jev — „up to 18x faster (p95) and more accurate", „likely new default"; Vercel-Bauer Pranit (@fazxes): „~5-18x faster and more accurate". ⚠️ **Benchmark nicht veröffentlicht.** Wiki: `people/gabriel-anhaia.md` (neu — Autor der Label-Kritik + Prüf-Maßstab für Guardrail-Tausche); Update `concepts/llm/system-one-models-jev.md` (neue Abschnitte „Benchmark-Lage" und „Guardrail-Tausch bei Vercel fx", Genauigkeits-Fehllektüre markiert, offene Punkte korrigiert). Raw: `raw/other/2026-09-17_typesafe-workflow-evals.md` (neu), `raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md` (neu).)* +*Letzte Aktualisierung: 2026-09-18 (223. Update — Jev-Episode per Briefing-Transcript: Token-Aufschlüsselung und Episodenzahlen. Anlass: Pit postete in OME Topic „JEV" das fertige deutsche Audio-Briefing (09:42) zur Episode „Jev is HERE. How to use it" (Isenberg/Vogel) als mp4. **Transkribiert** mit `~/workspace/scripts/grok-stt.sh --language de` (xAI Grok STT, 8.677 Zeichen, exit 0; STT-Fehler im Rohtext belassen: JEF/Jeff/Jed=Jev, Eisenberg=Isenberg, Ryan Fogel=Vogel, Vessel Gateway=Vercel AI Gateway). **Neue Zahlen:** 1.700 E-Mails · **4,2 Mio. Input-Token · 500k Output-Token · 18 US-Cent** (gegen `4,2 Mio. × $0,042 = $0,176` gerechnet → plausibel; die „~$0,16" einer Auto-Videobeschreibung ist Rundungsvariante), **~200 ms pro Anfrage** (⚠️ Briefing-Verdichtung der 70–500-ms-Spanne), **17 Highlights aus 1,1 Mio. Token in ~3 s** (Clipping), **Flug Zürich→London in 7,1 s** vs. 1–3 min bei herkömmlichen Agenten, Lead-Score 0–1 mit „98 % Qualität". ⚠️ Nur im Briefing, kein Originaltranscript — alle Episodenzahlen nicht am Original prüfbar. **These des Briefings:** Arbeit verschiebt sich „zu 100 % auf das Design der Aufgabenstruktur" — nicht Antworten sind das Produkt, sondern **Kategorien-Design**. Wiki: `concepts/llm/jev-vercel-ai-gateway.md` (neuer Abschnitt „Episodeninhalt (Briefing-Transkript)", Kennzahlen-Tabelle, 18-Cent-Herkunft präzisiert). Raw: `raw/other/2026-09-18_herman-briefing-jev-transcript.md` (neu — Volltext + Zahlen-Deckungstabelle).)* +*Vorherige Aktualisierung: 2026-09-18 (222. Update — Jev-Benchmarklage: Evals-Seite lokal ausgewertet + Vercel-`fx`-Guardrail-Tausch + Label-Kritik. Anlass: Zusammenfassung von DeltaKralle (@DeltaKrallenbot) in OME Topic „JEV", die Jev als „auf Augenhöhe mit Luna/Terra/Sonnet 5, **über Opus 5**" beschreibt — **invertiert**. **Lokal verifiziert:** [evals.typesafe.ai](https://evals.typesafe.ai/) HTTP 200/65.008 Byte, Text vollständig extrahierbar. Aggregat (Workflow-Modus, vier Workflows gleichgewichtet): **Jev 67,8 % · $0,0004 · 0,4 s** · luna 66,8 %/$0,0033/12,9 s · terra **67,9 %**/$0,0304/10,1 s · sonnet 5 **67,8 %**/$0,1174/78,1 s · **sol 74,1 %**/$0,0836/23,3 s · **opus 5 73,1 %**/$0,1761/37,8 s · haiku 4.5 53,6 % · DS v4 flash 64,4 % · DS v4 pro 65,5 %. Jev liegt also **auf Augenhöhe mit Terra/Sonnet 5, einen Punkt über Luna — und ~5 Punkte UNTER Opus 5 sowie ~6 unter Sol.** Je Workflow streut das Mittel stark: Customer Service 76,0 % (sol 78,3), Agent Trace 71,6 % (sol 76,6), Security Incidents 61,7 % (opus 5 66,2), **Invoice Processing 61,8 % (sol 79,1 — fast 18 Punkte zurück)**. Referenzlabels = Durchschnitt aus GPT-6 Astra + Fable 5.1 (kein Mensch, keine Ground Truth; wer gegen einen gemeinsamen Blindfleck richtig liegt, wird abgewertet); Seite legt Harness-Annahme offen („we assume that the code is correct"). **Zweiter Neubefund:** Vercel-CEO Guillermo Rauch ([@rauchg](https://x.com/rauchg), 871.158 Follower) tauscht den Sicherheits-Reviewer in `fx` (Modus „auto", prüft jeden Befehl) von GPT-5.6 Luna auf Jev — „up to 18x faster (p95) and more accurate", „likely new default"; Vercel-Bauer Pranit (@fazxes): „~5-18x faster and more accurate". ⚠️ **Benchmark nicht veröffentlicht.** Wiki: `people/gabriel-anhaia.md` (neu — Autor der Label-Kritik + Prüf-Maßstab für Guardrail-Tausche); Update `concepts/llm/system-one-models-jev.md` (neue Abschnitte „Benchmark-Lage" und „Guardrail-Tausch bei Vercel fx", Genauigkeits-Fehllektüre markiert, offene Punkte korrigiert). Raw: `raw/other/2026-09-17_typesafe-workflow-evals.md` (neu), `raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md` (neu).)* *Vorherige Aktualisierung: 2026-09-18 (221. Update — Jev praktisch: Berman-Video + Demo-Welle + Ankündigungspost. Anlass: YouTube-Link „We need to talk about Jev..." (Matthew Berman, 18.09.2026, 12:30, 82.291 Views, **mit Werbekennzeichnung**/Sponsor Zapier) von Pit Weber in OME Topic „JEV". ⚠️ **Kein Transcript** — yt-dlp „Sign in to confirm you're not a bot" (auch mit `--js-runtimes node`), kein `captionTracks`, Firecrawl lieferte nur Consent-/401-Seite, Crawl4AI startet nicht (Playwright-Binary fehlt), Transkriptdienste 403/522; auswertbar waren Beschreibung, Quellenliste und Aufrufzahl. **Aufgelöste Quellenliste des Videos** (fxtwitter): Diogo Almeida Launch-Post (15.09.2026, **34,9 Mio. Views/69.647 Likes** — nennt **Spannen** „20-200x faster"/„40-400x cheaper", nicht 200×/400× als Erwartungswert), AI/ML API Schach-Test (Jev vs. Fable 5.1: materiell unterlegen, **Sieg auf Zeit**, ~2,6 s/Zug vs. 6–15 s; vs. GPT-6 Astra: **Matt in 18 Zügen**), kitze „Unclutter" (Ad-/Slop-Blocker, BYOK/Open Source), Riley Brown („agent with model router powered by Jev"), Justin Schroeder („rebuilt Tesla FSD in <1 h" — viralster und inhaltsleerster Post der Reihe), @The_Alex (Melee). Wiki: `concepts/llm/jev-praxis-demos.md` (neu — Demos als Tabelle mit Belastbarkeits-Abstufung, Zeitökonomie als Kernbefund), `people/matthew-berman.md`, `people/kitze.md`, `people/riley-brown.md`, `people/justin-schroeder.md`, `people/alex-the-alex.md` (alle neu), `institutions/ai-ml-api.md` (neu); Updates `concepts/llm/system-one-models-jev.md` (Ankündigungspost + Demo-Welle), `people/diogo-almeida.md` (Launch-Post + Views). Raw: `raw/youtube/2026-09-18_berman-jev.md` (neu), `raw/xpost/2026-09-15_almeida-jev-launch-post.md` (neu).)* *Vorherige Aktualisierung: 2026-09-18 (220. Update — Jev-Verteilung: Greg Isenbergs „Jev is HERE"-Post (18.09.2026, 18:41 UTC; 29.661 Views / 415 Likes bei Abruf) und die Gateway-Listung. Anlass: X-Link von Pit Weber in OME Topic „JEV". **Lokal verifiziert (18.09.2026, HTTP 200 mit auswertbarem Text):** Der Vercel AI Gateway führt `typesafe-ai/jev` seit 16.09.2026 — AI SDK 7.0.105+ mit `experimental evaluate`, Frage-Typen Choice/Score/Boolean, ein gemeinsames `state` + Map benannter `questions`, Choice-/Score-Confidence unter `result.providerMetadata.typesafe.confidence`, Zero Data Retention und No Training per Request, Abrechnung gegen Gateway-Budgets; Gateway-Preis **$0.04/1M Input** (gerundet) gegen $0,042 in der TypeSafe-Primärquelle; Leistungszahlen 193,6×/444,6× von Vercel ausdrücklich als TypeSafe-Angabe weitergegeben („TypeSafe reports"). **Post-Inhalt:** sieben Geschäftsideen (Instant Quotes, Lead Scoring, Support-Triage, Clipping, Antragsstapel, Marketplace-Matching, Browser-Agenten), Formel „find an expensive queue and put Jev at the front of it", Zugang über den Gateway statt Waitlist; ⚠️ „1.700 E-Mails für 18 Cent" ohne Token-Aufschlüsselung, Datensatz oder Messung, „94 %" als Illustrationswert, Episode-Gast [@ryanvogel](https://x.com/ryanvogel) („ceo of @rebasetv / founding developer @opencode") nur aus dem Post zugeordnet. Wiki: `concepts/llm/jev-vercel-ai-gateway.md` (neu), `institutions/vercel.md` (neu), `people/greg-isenberg.md` (neu), `people/ryan-vogel.md` (neu); Updates `concepts/llm/system-one-models-jev.md` (Verteilungs-Abschnitt + offene Gateway-Punkte), `institutions/typesafe-ai.md` (Distribution), `concepts/llm/llm-model-catalog.md`. Raw: `raw/xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md` (neu), `raw/blog/2026-09-16_vercel-jev-ai-gateway.md` (neu).)* *Vorherige Aktualisierung: 2026-09-18 (219. Update — PLUR1BUS Memory 7.12.61 (Mr. Cy / @Cyb3rblade, Ankündigung via Yvonne, 18.09.2026). Raw: `raw/other/2026-09-18_plur1bus-memory-release-71261.md` (neu). Wiki-Update: `tools/plur1bus-memory.md` (Release 7.12.61 OpenClaw + Hermes 7.12.61-hermes.0-Prerelease: Skill begleitet Installation, ersetzt natives Paket nicht; Hermans Analyse — Afterthought-Auswahl, Fallback respektiert Hermes-Modell, Compaction koordiniert sofort, Journal-Tail-Integrität). Deployment: Bernhardine/Bernd live, Hector auf 7.12.56, Herman auf 7.12.7.post3 (keine Installation ohne Freigabe).)* @@ -718,4 +719,5 @@ | `raw/youtube/2026-09-18_berman-jev.md` | youtube | Matthew Berman: „We need to talk about Jev..." (https://www.youtube.com/watch?v=2z-7pIj57f8, 18.09.2026, 12:30, 82.291 Views bei Abruf, **„Includes paid promotion"/Sponsor Zapier**; geteilt von Pit in OME Topic „JEV"). **Kein Transcript abrufbar** (yt-dlp Bot-Check, kein `captionTracks`, Firecrawl nur Consent-Seite, Crawl4AI ohne Playwright-Binary, Transkriptdienste 403/522) — auswertbar: Beschreibung, Quellenliste (6 X-Posts, aufgelöst), Titel/Kanal/Aufrufe. Kapitelmarken fehlen. ⚠️ Videoinhalt nur über Sekundärzusammenfassung, nicht verifiziert. Wiki: `concepts/llm/jev-praxis-demos.md` (neu), `people/matthew-berman.md` (neu) | | `raw/other/2026-09-17_typesafe-workflow-evals.md` | other | TypeSafe **Workflow-Evals** (https://evals.typesafe.ai/, lokal gelesen: 65.008 Byte, Text extrahierbar). Vier Workflows (Security Incidents, Agent Trace, Invoice Processing, Customer Service) × zwei Modi (workflow/prompt), Fragetypen Noul/Choice/Score. Aggregat Jev 67,8 %/$0,0004/0,4 s vs. luna 66,8/terra 67,9/sonnet 5 67,8/**sol 74,1/opus 5 73,1**. Je Workflow 61,7–76,0 %. Referenzlabels = Mittel aus GPT-6 Astra + Fable 5.1; keine Fallzahlen/Rohdaten. Wiki: `concepts/llm/system-one-models-jev.md` | | `raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md` | blog | Gabriel Anhaia (17.09.2026): „Jev Beat GPT Luna by 1 Point. GPT-6 and Claude Wrote the Answer Key." — Vercel-`fx`-Reviewer-Wechsel (Rauchg/@fazxes, „~5-18x faster and more accurate", **Benchmark unveröffentlicht**), TypeSafe-Aggregat-Tabelle (gegengeprüft, korrekt), **Label-Kritik** (Reference-Labels aus zwei Frontier-Modellen → gemeinsame Blindflecken werten richtige Abweichler ab; TypeSafe legt Bias selbst offen und nennt die Homepage-Zahl „higher end of real world gains"). Fünf Prüfschritte vor dem Tausch. Wiki: `people/gabriel-anhaia.md` (neu) | +| `raw/other/2026-09-18_herman-briefing-jev-transcript.md` | other | **Herman-Briefing zu Jev** (deutsches Audio-Briefing 09:42 zur Episode „Jev is HERE. How to use it", Isenberg/Vogel), gepostet von Pit in OME Topic „JEV" (18.09.2026 22:38 UTC, mp4 15,3 MB). **STT-Transkript** (Grok STT, de, 8.677 Zeichen) — Volltext + Zahlen-Deckungstabelle. Kernzahlen: 1.700 Mails/4,2 Mio Input-/500k Output-Token/18 US-Cent; ~200 ms/Anfrage; 17 Highlights aus 1,1 Mio Token in ~3 s; Flug Zürich→London in 7,1 s. ⚠️ Dritt-Zusammenfassung, kein Originaltranscript; STT-Fehler dokumentiert. Wiki: `concepts/llm/jev-vercel-ai-gateway.md` | | `raw/xpost/2026-09-15_almeida-jev-launch-post.md` | xpost | Diogo Almeida ([@CompleteSkeptic](https://x.com/CompleteSkeptic), 113.333 Follower; Bio „co-created RLHF/ChatGPT @ @openai … (ceo @typesafeai)"): **Jev-Launch-Post** (15.09.2026 18:17 UTC, 34.903.594 Views / 69.647 Likes bei Abruf). Wortlaut: „After co-inventing ChatGPT…"; Zahlen als **Spannen** „20-200x faster / 40-400x cheaper (w/ output tokens free)" — die kursierenden 200×/400× sind die Obergrenzen. Wiki: `people/diogo-almeida.md` (Launch-Post-Abschnitt), `concepts/llm/system-one-models-jev.md` | diff --git a/wiki/log.md b/wiki/log.md index 9c4d469..d3b4673 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -2,6 +2,26 @@ *Append-only changelog. Start: 2026-06-05* +## 2026-09-18 — Jev-Episode per Briefing-Transkript (Zahlen-Aufschlüsselung) + +**Type:** ingest + wiki-update | **Scope:** raw/other, wiki/concepts/llm, wiki/index, wiki/log +**Anlass:** Pit postete in OME Topic „JEV" (22:38 UTC) das fertige **deutsche Audio-Briefing (09:42)** zur Episode „Jev is HERE. How to use it" (Greg Isenberg / Ryan Vogel) als `briefing-video.mp4` (15,3 MB), inkl. integrierter Infografik und Begleittext. Um 21:34 UTC hatte er bereits das Berman-Video verlinkt. +**Vorgehen:** Das Briefing wurde **lokal transkribiert** — `~/workspace/scripts/grok-stt.sh --language de --format text` (xAI Grok STT; das Skript akzeptiert mp4 direkt, kein ffmpeg nötig; Antwort ist JSON trotz `--format text`, per `json.loads` geparst). Ergebnis: 8.677 Zeichen, 1.242 Wörter, exit 0. +**STT-Fehler im Rohtext belassen und dokumentiert:** „JEF/Jeff/JDiff/Jed" = Jev · „Greg Eisenberg" = Greg Isenberg · „Ryan Fogel" = Ryan Vogel · „Vessel Gateway" = Vercel AI Gateway · „1, 1 Millionen" = 1,1 Millionen. +**Neue Befunde:** +1. **Token-Aufschlüsselung erstmals im Wortlaut:** 1.700 E-Mails = **4,2 Mio. Input-Token + 500.000 Output-Token für 18 US-Cent** (die zuvor nur als „1,700 emails for 18 cents" bekannte Zahl). Gegenrechnung: 4,2 Mio. × $0,042/MTok = **$0,176** — konsistent. Die in einer automatisch erzeugten Videobeschreibung genannte Zahl „$0.16 for 1700 emails" ist eine Rundungs-/Verschleifvariante derselben Größe, kein Widerspruch. +2. **Latenz als Verdichtung:** Das Briefing sagt „konstant rund 200 Millisekunden"; TypeSafe nennt eine **Spanne von 70–500 ms**. 200 ms ist ein griffiger Mittelwert, kein Messwert. +3. **Neue Episodenzahlen:** Clipping-Test „1,1 Mio. Token → 17 relevante Highlights in ~3 s"; Browser-Steuerung „Flug Zürich → London buchen in 7,1 s" (von leerer Seite bis Buchung), herkömmliche Agenten 1–3 min; Lead-Klassifizierung auf Skala 0–1 mit „Lead mit 98 % Qualität". ⚠️ **Nur im Briefing**, kein Originaltranscript — nicht am Original prüfbar. Die im Begleittext genannte Angabe „etwa 1/1.000 Cent pro Test" wurde im Briefing-Wortlaut **nicht** gefunden. +4. **Die These des Briefings** ist der Schluss: Wenn jede Alltagsentscheidung in Millisekunden fällt, verschiebt sich Arbeit „zu 100 % auf das Design der Aufgabenstruktur" — man sichtet keine Informationen mehr, sondern definiert das **Schema**. Das ist die klarste Formulierung des Produktversprechens: nicht Antworten, sondern Kategorien-Design. +5. **Zugang:** Das Briefing nennt den „Vessel Gateway" (STT) — gemeint ist der Vercel AI Gateway, dessen Listung bereits lokal verifiziert ist. +**Dateien:** +- raw (NEW): `raw/other/2026-09-18_herman-briefing-jev-transcript.md` (Volltext + Tabelle „Zahlen des Briefings — und ihre Deckung") +- wiki (UPDATED): `wiki/concepts/llm/jev-vercel-ai-gateway.md` (Abschnitt „Episodeninhalt (Briefing-Transkript)" mit Kennzahlen-Tabelle; 18-Cent-Herkunft und Gegenrechnung präzisiert; Cross-Ref zur Demo-Welle) +- `wiki/index.md` (223. Update-Zeile, Raw-Row) +**⚠️:** Briefing ist eine Zusammenfassung eines Dritten, nicht das Originalvideo; alle Episodenzahlen bleiben ohne Originaltranscript unbelegt. Die im Beschreibungstext des Kanals genannten „200ms latency / $0.16" sind Kanalangaben, nicht Messwerte. + +--- + ## 2026-09-18 — Jev praktisch: Berman-Video, Demo-Welle, Ankündigungspost **Type:** ingest + wiki-update | **Scope:** raw/youtube, raw/xpost, wiki/concepts/llm, wiki/people, wiki/institutions, wiki/index, wiki/log