diff --git a/raw/other/2026-09-18_typesafe-docs-jev-spezifikation.md b/raw/other/2026-09-18_typesafe-docs-jev-spezifikation.md new file mode 100644 index 0000000..1b5fdb2 --- /dev/null +++ b/raw/other/2026-09-18_typesafe-docs-jev-spezifikation.md @@ -0,0 +1,38 @@ +--- +type: other +source_url: https://docs.typesafe.ai/models +retrieved: 2026-09-18 +title: "TypeSafe Docs — Jev-Modellspezifikation (Modell-ID, Rate Limits, Kontext, Eingabetypen)" +tags: [jev, typesafe-ai, docs, spezifikation, rate-limits, kontextfenster, modalitaet] +--- + +# TypeSafe Docs — Jev-Spezifikation (lokal gelesen 18.09.2026) + +Primärquelle der harten Modellangaben: https://docs.typesafe.ai/models — HTTP 200, 338.781 Byte, Text extrahierbar. Ergänzend https://docs.typesafe.ai/primitives (HTTP 200, 449.968 Byte). + +## Spezifikation (Wortlaut der Seite) + +| Feld | Wert | +|------|------| +| **Aktuelles Modell** | **Jev 1.13** · Modell-ID **`jev-1.13.0`** | +| Preis | **$42 / Btok** bzw. **$0.042 / Mtok** — „Charged per input token. Output tokens are free." | +| **Rate Limits** | **250.000 Token pro Sekunde** · **1.200 Requests pro Minute** | +| **Kontextlänge** | **64k Token pro Request**; **32k Token für State + die längste Frage** | +| Eingabe | **Nur Text.** String, JSON-Objekt oder Array von Textwerten. **Keine Bild-, Audio- oder Video-Eingabe.** | +| Abrechnung bei Limits | „Too Many Requests" (429); Client-SDKs wiederholen mit Backoff und respektieren den `retry-after`-Header | + +Erläuterung der Kontextangabe aus derselben Seite: „Jev ingests the state once and evaluates every question against it in parallel. **The 64k budget covers the state plus all questions combined; the 32k budget applies to the state plus the single longest question.**" + +## Aus der Primitives-Seite + +- Frage-Typen: **Noul** (ja/nein mit Wahrscheinlichkeit), **Choice** (Option aus definierter Menge, mit Verteilung und Confidence), **Score** (Stufe auf Skala, mit Verteilung und Confidence). Dieselben drei Typen, die auch die Eval-Seite verwendet. +- „Each question is evaluated independently, so adding more questions does not create context-rot." +- Hinweis auf das Muster **Speculative fan-out** (mehrere Fragen gegen denselben State). +- Formulierungshilfe der Doku: Fragen sollen so eng sein, „a knowledgeable person makes in a second given the right context" — gutes Beispiel: „Does this message convey urgency?"; schlechtes Beispiel: „Analyze this message and determine the best course of action". + +## Bedeutung für andere Ingestions + +1. **Die im Umlauf befindliche „32k-Kontext"-Angabe ist die engere der beiden Grenzen.** Wer nur 32k nennt, unterschlägt die 64k-Request-Grenze. +2. **Die 1M-Kontext-Erwartung (siehe `raw/xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md`) hat in der Dokumentation keine Grundlage.** +3. **Text-Only ist eine harte Grenze für Computer-Use.** Ein Desktop-Agent kann Bildschirminhalte nicht an Jev geben; er muss den Zustand in Text übersetzen. Das relativiert Desktop-/Browser-Demos, die den Eindruck erwecken, Jev verarbeite Bildschirme. +4. **Rate-Limit-Abgleich mit der Briefing-Zahl:** 250.000 Token/Sekunde ergeben für 1,1 Mio. Token eine theoretische Mindestdauer von **~4,4 Sekunden** — das deutsche Briefing nannte für denselben Clipping-Test „rund drei Sekunden". Entweder ist die Briefing-Angabe großzügig gerundet, oder der Durchlauf lief gegen andere Grenzen. ⚠️ Die Abweichung ist nicht auflösbar und wird nicht als Widerspruch behauptet. diff --git a/raw/xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md b/raw/xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md new file mode 100644 index 0000000..21b9db0 --- /dev/null +++ b/raw/xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md @@ -0,0 +1,83 @@ +--- +type: xpost +source_url: https://x.com/cjzafir/status/2100991512020725788 +retrieved: 2026-09-18 +author: "@cjzafir" +is_thread: false +tags: [jev, typesafe-ai, erfahrungsbericht, kosten, kontextfenster, rag, system-1-controller] +--- + +# CJ Zafir: „I burned $3.40 on Jev in 24 hours" (18.09.2026) + +## Post (Wortlaut) + +> I burned $3.40 on Jev in 24 hours. +> +> It's not Jev vs current LLMs. It'll be Jev + LLMs. +> +> Here are all the goods and bads of Jev. +> +> 1. Jev or a Jev-like system will be integrated into all LLMs for automatic model routing, small decisions, if/else queries, retrieval, tool selection, scoring, etc. For all these things, LLMs lose a lot of tokens on thinking and planning and use smarter instead of faster models. That can be fixed with Jev. +> +> 2. Jev can do things that require fine-tuning with LLMs. It can learn what to do from just 1 prompt. +> +> 3. It's crazy fast. It scans, analyzes, and gives its decisions instantly without a thinking blocker. +> +> 4. It doesn't waste tokens on thinking in plain English and planning. It scores probabilities and picks the best one. +> +> 5. Output cost of $0. Which makes sense because it's not built for free-form text generation like LLMs. It just outputs decisions. +> +> 6. It can fix RAG. The current 32k context is too low, but in the near future, we'll see systems like Jev with a 1M context window, and that'll fix the retrieval problem. +> +> 7. Jev has 3 decision types: multiple-choice questions, scoring the probability, and Noul. +> Choice → Which one? +> Score → How much? +> Noul → Yes or no? +> That's how it doesn't need reasoning. +> +> 8. Jev works on parallel sampling. LLMs generate sequentially: Token 1 ↓ Token 2 ↓ Token 3 ↓ Token 4. Jev can evaluate multiple questions against the same state in parallel. That's one of the reasons it has great latency. +> +> 9. Instead of RLHF (Reinforcement Learning from Human Feedback), it works on RLCD (Reinforcement Learning for Calibrated Decisions). With RLCD, the model's goal is not just to predict the answer; it also shows how much confidence it has. A model saying: true is different from: true, 99% confidence. +> +> 10. Jev response times are roughly: 70–500 ms, which is 193.6× faster and 444.6× cheaper than frontier LLM workflows. The biggest issue with LLMs today is that they take too much time to execute tasks. With a Jev-like system, that'll be at least 50% faster. + +## Metadaten + +- **URL:** https://x.com/cjzafir/status/2100991512020725788 (von Pit Weber in OME Topic „JEV" geteilt, 18.09.2026 22:48 UTC) +- **Autor:** CJ Zafir ([@cjzafir](https://x.com/cjzafir), **64.375 Follower**, verifiziert; Bio: „I fine-tune small language models (SLMs) and beat large language models (LLMs)") +- **Erstellt:** 18.09.2026 16:53:05 UTC (also ~5,9 h vor dem Teilen) +- **Engagement (Abruf 18.09.2026 ~22:48 UTC):** 33.238 Views · 517 Likes · 38 Retweets · 32 Replies +- **Typ:** Einzelpost, Liste in 10 Punkten + +## Neuheitswert + +Der erste Beitrag der Jev-Akte mit einer **Ausgabenangabe aus eigener Nutzung**: 3,40 US-Dollar in 24 Stunden. Alle bisherigen Kostenaussagen waren Anbieterpreise oder Demo-Rechnungen Dritter. + +## Gegenrechnung zur Ausgabe + +Bei $0,042 pro Million Input-Token entsprechen $3,40 rund **81 Millionen Input-Token**. Zum Vergleich: der bekannte Demo-Durchlauf „1.700 E-Mails" verbrauchte 4,2 Mio. Input-Token — $3,40 sind also etwa **19 solcher Postfach-Durchläufe**. Die Zahl ist plausibel für einen Entwickler, der 24 Stunden lang systematisch experimentiert. + +## Prüfung der Einzelaussagen + +| # | Aussage | Prüfung | +|---|---------|---------| +| 1 | Jev als System-1-Controller neben LLMs (Routing, Tool-Wahl, Scoring) | ✅ deckt sich mit der Anbieter-Dokumentation und den genannten Anwendungsfällen | +| 2 | „Can learn what to do from just 1 prompt" | ⚠️ **Überzeichnet.** Belegt ist nicht Lernen, sondern **Konfiguration**: Beispiel + Schema definieren die Entscheidung. TypeSafe dokumentiert keine Gewichtsanpassung zur Laufzeit | +| 3 | „crazy fast … without a thinking blocker" | ✅ plausibel, deckt sich mit dem dokumentierten parallelen Sampling | +| 4 | Keine Planungs-Token, nur Wahrscheinlichkeiten | ✅ korrekt für Choice/Score/Noul | +| 5 | Output $0 | ✅ dokumentiert ($42/Btok bzw. $0,042/Mtok Input; Output kostenlos) | +| 6 | „current 32k context is too low; 1M will fix RAG" | ⚠️ **teilweise falsch.** Dokumentiert sind **64k pro Request** und **32k für State + längste Frage** — die genannte 32k sind die engere der beiden Grenzen, nicht die einzige. Das angekündigte 1M-Fenster existiert **nicht** in der Dokumentation und würde Retrieval-Probleme (Qualität, Aktualität, Berechtigungen, „lost in the middle") ohnehin nicht lösen | +| 7 | Drei Entscheidungstypen Choice/Score/Noul | ✅ korrekt (Anbieter-Primitive) | +| 8 | Paralleles Sampling statt sequenzieller Token | ✅ korrekt, Kern der Architektur | +| 9 | RLCD statt RLHF, Ziel ist Kalibrierung | ✅ korrekt (Anbieterangabe) | +| 10 | 70–500 ms, 193,6× / 444,6× | ✅ Anbieterwerte, korrekt wiedergegeben — es sind **Spannen-Obergrenzen** aus Workflow-Evals, keine Agenten-End-to-End-Werte | + +## Wichtige nicht genannte Einschränkung + +Die Dokumentation nennt als Eingabe **ausschließlich Text** (String, JSON-Objekt oder Array) — „No image, audio, or video input". Für Computer-Use-Anwendungen heißt das: Bildschirminhalte können **nicht** direkt an Jev gehen; ein Agent müsste den Zustand erst in Text übersetzen. Das relativiert die Desktop-Demos, die den Eindruck erwecken, Jev „sehe" den Bildschirm. + +## Offene Punkte + +- ⚠️ Erfahrungsbericht eines einzelnen Entwicklers; keine Angabe, wofür die $3,40 ausgegeben wurden (Verteilung über Aufgabentypen fehlt). +- ⚠️ Der Autor hat ein Eigeninteresse an kleinen Modellen (Bio) — seine These „Jev + LLMs" passt zu dieser Position. +- ⚠️ Keine Messung der eigenen Latenz oder Genauigkeit. diff --git a/wiki/concepts/llm/system-one-models-jev.md b/wiki/concepts/llm/system-one-models-jev.md index 8979ce6..304268e 100644 --- a/wiki/concepts/llm/system-one-models-jev.md +++ b/wiki/concepts/llm/system-one-models-jev.md @@ -1,7 +1,7 @@ --- created: 2026-09-17 updated: 2026-09-18 -sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md, blog/2026-09-16_theregister-typesafe-jev-doom.md, blog/2026-09-16_vercel-jev-ai-gateway.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, xpost/2026-09-15_almeida-jev-launch-post.md, youtube/2026-09-18_berman-jev.md, other/2026-09-17_typesafe-workflow-evals.md, blog/2026-09-17_devto-jev-vs-luna-bake-off.md] +sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md, blog/2026-09-16_theregister-typesafe-jev-doom.md, blog/2026-09-16_vercel-jev-ai-gateway.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, xpost/2026-09-15_almeida-jev-launch-post.md, youtube/2026-09-18_berman-jev.md, other/2026-09-17_typesafe-workflow-evals.md, blog/2026-09-17_devto-jev-vs-luna-bake-off.md, other/2026-09-18_typesafe-docs-jev-spezifikation.md, xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md] tags: [concept, llm, typesafe, jev, system-one-models, rlcd, structured-outputs, calibrated-decisions, parallel-sampling, inference-cost, automation, harness] --- @@ -107,6 +107,25 @@ Der Mittelwert verbirgt eine Spanne von 61,7 % bis 76,0 %; bei Rechnungsverarbei Der bislang gewichtigste **Fremdnutzen** liegt nicht in den Evals, sondern in einem Werkzeugwechsel: Vercel-CEO **Guillermo Rauch** ([@rauchg](https://x.com/rauchg), 871.158 Follower) schreibt laut Dev.to-Bericht, der Sicherheits-Reviewer in `fx` (Vercel-Labs-CLI, Modus „auto", prüft jeden Befehl) laufe heute auf **GPT-5.6 Luna** und **Jev sei „up to 18x faster (p95) and more accurate"** — „likely new default". Vercel-Bauer **Pranit** ([@fazxes](https://x.com/fazxes)) berichtet „~5-18x faster and more accurate than gpt-5.6-luna, our current top choice". ⚠️ **Vercel hat den Benchmark nicht veröffentlicht** (Stand 17.09.): keine Fallzahlen, kein Datensatz. Die Zahlen sind als Werkzeugangabe zu lesen, nicht als Messung. +## Spezifikation (Anbieter-Docs, lokal gelesen 18.09.2026) + +Harte Angaben aus **https://docs.typesafe.ai/models** (HTTP 200, 338.781 Byte; Raw: `raw/other/2026-09-18_typesafe-docs-jev-spezifikation.md`): + +| Feld | Wert | +|------|------| +| Aktuelles Modell | **Jev 1.13** · Modell-ID **`jev-1.13.0`** | +| Preis | **$42/Btok** bzw. $0,042/Mtok Input; „Output tokens are free" | +| Rate Limits | **250.000 Token/Sekunde** · **1.200 Requests/Minute** | +| Kontext | **64k Token pro Request**; **32k für State + längste Frage** | +| Eingabe | **Nur Text** — String, JSON-Objekt oder Array. **Keine Bild-, Audio- oder Video-Eingabe** | + +Zwei Punkte, die in der öffentlichen Diskussion regelmäßig falsch wiedergegeben werden: + +- **„32k Kontext" ist die engere der zwei Grenzen.** Die Doku nennt 64k pro Request; die 32k beziehen sich auf State plus die *längste Einzelfrage*. Wer nur 32k nennt, unterschlägt die Hälfte (so im [[../../people/cj-zafir.md|CJ-Zafir]]-Post). +- **Text-Only ist eine harte Grenze für Computer-Use.** Ein Desktop- oder Browser-Agent kann Bildschirminhalte **nicht** an Jev geben; er muss den Zustand erst in Text übersetzen. Das relativiert jede Demo, die den Eindruck erweckt, Jev „sehe" den Bildschirm (etwa [[../agents/jev-sprachsteuerung-computer-use.md]]). + +**Erster Nutzungs-Kostenwert:** [[../../people/cj-zafir.md|CJ Zafir]] berichtet **$3,40 Ausgaben in 24 Stunden** — bei $0,042/MTok rund **81 Mio. Input-Token**, also etwa 19 Durchläufe des bekannten 4,2-Mio.-Postfachs. Bisher waren alle Kostenangaben Anbieterpreise oder Demo-Rechnungen Dritter. + ## Quellenkritik der Benchmarks Die eigenen Workflow-Evals messen **Übereinstimmung mit Referenzantworten** (Durchschnitt aus GPT-6 Astra und Fable 5.1), nicht unabhängig verifizierte Korrektheit. TypeSafe legt die Bias-Richtungen selbst offen: @@ -169,6 +188,8 @@ Neben Benchmarks und Verteilung entstand eine Welle öffentlicher Bauprojekte - [[llm-sycophancy-confabulation.md]] — Fehlerklassen jenseits von Halluzination - [[jev-vercel-ai-gateway.md]] — Verteilung über den Vercel AI Gateway, Isenberg-Post, sieben Geschäftsideen - [[jev-praxis-demos.md]] — Demo-Welle (Doom, Wikipedia-Races, Schach, Modellrouter) und ihre Belastbarkeit +- [[../agents/jev-sprachsteuerung-computer-use.md]] — Sprachsteuerung als Desktop-Agent (Text-Only-Grenze beachten) +- [[../../people/cj-zafir.md]] — Erfahrungsbericht mit Ausgabenwert und Fehllektüren - [[../../institutions/vercel.md]] — Gateway-Betreiber - [[../../people/greg-isenberg.md]] — Startup-Ideen-Kanal, der die „18 Cent"-Zahl verbreitet diff --git a/wiki/index.md b/wiki/index.md index 728e5ef..aa8e62d 100644 --- a/wiki/index.md +++ b/wiki/index.md @@ -2,7 +2,8 @@ *Auto-generated: 2026-07-07* -*Letzte Aktualisierung: 2026-09-18 (224. Update — Jev als Desktop-Agent: sprachgesteuerter Mac-Computer-Use (Andy Gao) — **lokal geprüft**. Anlass: X-Link von Pit in OME Topic „JEV" (22:45 UTC). Post: 563-Follower-Account, aber **139.442 Views / 2.038 Likes** in ~17,6 h. **Video lokal ausgewertet** (6,58 MB, 48 s): STT-Transkript (Grok STT, `en`, 428 Zeichen) + **9 Standbilder** (imageio-ffmpeg nachinstalliert, da das `ffmpeg-static`-Symlink-Ziel fehlt). **Kernaussage am Material bestätigt:** Standbild Sekunde 6 zeigt das Overlay „…en up the Notes app for me? And, um," bei **bereits offenem Notes-Fenster**; Sekunde 12 zeigt „…ew node, let's make the title say hello." bei **bereits angelegter Notiz mit Titel „hello"** — Zielzustände sichtbar, während der Satz noch läuft. Damit ist die Post-Behauptung „opens before I even finish my sentence" für diesen Ablauf belegt (belastbarste Einzelaussage der ganzen Demo-Welle). Kette: Notes → neue Notiz → Arc → Google „Norbert Wiener" → x.com → Photo Booth (Countdown, Auslösung). Screenshot-Analyse fand **kein Terminal, kein Schema, keine Latenz-/Modellangabe** — nur Desktop-Ablauf mit Live-Transkript-Overlay. ⚠️ Keine Messung, kein Code/Repo, kein Nachweis des Jev-Anteils (ein lokales STT + Schlüsselwort-Matching würde dieselben Bilder erzeugen), nur lokal skriptbare Standard-Apps. Wiki: `concepts/agents/jev-sprachsteuerung-computer-use.md` (neu — Demo-Auswertung, Prüfung der Kernaussage, Gegenstück zur Schach-Lehre), `people/andy-gao.md` (neu); Update `concepts/llm/jev-praxis-demos.md` (Zeile + Cross-Ref). Raw: `raw/xpost/2026-09-18_andy-gao-jev-voice-computer-use.md` (neu).)* +*Letzte Aktualisierung: 2026-09-18 (225. Update — Jev-Spezifikation aus den Anbieter-Docs + erster Nutzungs-Kostenwert. Anlass: X-Post von CJ Zafir („I burned **$3.40 on Jev in 24 hours**. It's not Jev vs current LLMs. It'll be Jev + LLMs") von Pit in OME Topic „JEV" (22:48 UTC). **Lokal gelesen:** [docs.typesafe.ai/models](https://docs.typesafe.ai/models) (HTTP 200, 338.781 Byte) — Modell **Jev 1.13 / `jev-1.13.0`**, $42/Btok bzw. $0,042/Mtok Input, Output kostenlos, **Rate Limits 250.000 Token/Sekunde · 1.200 Requests/Minute**, **Kontext 64k pro Request / 32k für State + längste Frage**, **Eingabe nur Text — keine Bild-, Audio- oder Video-Eingabe**. Zwei Korrekturen damit belegt: (a) die kursierende „32k-Kontext"-Angabe ist die **engere** der beiden Grenzen (CJ Zafir nennt nur sie), das versprochene **1M-Fenster hat in der Doku keine Grundlage**; (b) **Text-Only relativiert die Desktop-/Browser-Demos** — ein Agent muss den Bildschirmzustand erst in Text übersetzen, Jev „sieht" nichts (betrifft direkt die Andy-Gao-Demo). **Kosten-Gegenrechnung:** $3,40 / $0,042 pro MTok ≈ **81 Mio. Input-Token** — rund **19 Durchläufe** des bekannten 4,2-Mio.-Postfachs (1.700 Mails). Erster Ausgabenwert aus echter Nutzung (bisher nur Anbieterpreise). Weitere Befunde zum Post: Kernthese „Jev + LLMs" (System-1-Controller für Routing/Tool-Wahl/Scoring) trägt; ⚠️ „lernt aus einem Prompt" überzeichnet (Konfiguration, nicht Lernen); Punkte 3/4/5/7/8/9/10 decken sich mit Doku-Anbieterangaben (Choice/Score/Noul, paralleles Sampling, RLCD, 70–500 ms, 193,6×/444,6× als Spannen-Obergrenzen). Wiki: `people/cj-zafir.md` (neu); Update `concepts/llm/system-one-models-jev.md` (neuer Abschnitt „Spezifikation (Anbieter-Docs)" mit Doku-Tabelle und den zwei Korrekturen). Raw: `raw/other/2026-09-18_typesafe-docs-jev-spezifikation.md` (neu), `raw/xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md` (neu).)* +*Vorherige Aktualisierung: 2026-09-18 (224. Update — Jev als Desktop-Agent: sprachgesteuerter Mac-Computer-Use (Andy Gao) — **lokal geprüft**. Anlass: X-Link von Pit in OME Topic „JEV" (22:45 UTC). Post: 563-Follower-Account, aber **139.442 Views / 2.038 Likes** in ~17,6 h. **Video lokal ausgewertet** (6,58 MB, 48 s): STT-Transkript (Grok STT, `en`, 428 Zeichen) + **9 Standbilder** (imageio-ffmpeg nachinstalliert, da das `ffmpeg-static`-Symlink-Ziel fehlt). **Kernaussage am Material bestätigt:** Standbild Sekunde 6 zeigt das Overlay „…en up the Notes app for me? And, um," bei **bereits offenem Notes-Fenster**; Sekunde 12 zeigt „…ew node, let's make the title say hello." bei **bereits angelegter Notiz mit Titel „hello"** — Zielzustände sichtbar, während der Satz noch läuft. Damit ist die Post-Behauptung „opens before I even finish my sentence" für diesen Ablauf belegt (belastbarste Einzelaussage der ganzen Demo-Welle). Kette: Notes → neue Notiz → Arc → Google „Norbert Wiener" → x.com → Photo Booth (Countdown, Auslösung). Screenshot-Analyse fand **kein Terminal, kein Schema, keine Latenz-/Modellangabe** — nur Desktop-Ablauf mit Live-Transkript-Overlay. ⚠️ Keine Messung, kein Code/Repo, kein Nachweis des Jev-Anteils (ein lokales STT + Schlüsselwort-Matching würde dieselben Bilder erzeugen), nur lokal skriptbare Standard-Apps. Wiki: `concepts/agents/jev-sprachsteuerung-computer-use.md` (neu — Demo-Auswertung, Prüfung der Kernaussage, Gegenstück zur Schach-Lehre), `people/andy-gao.md` (neu); Update `concepts/llm/jev-praxis-demos.md` (Zeile + Cross-Ref). Raw: `raw/xpost/2026-09-18_andy-gao-jev-voice-computer-use.md` (neu).)* *Vorherige Aktualisierung: 2026-09-18 (223. Update — Jev-Episode per Briefing-Transcript: Token-Aufschlüsselung und Episodenzahlen. Anlass: Pit postete in OME Topic „JEV" das fertige deutsche Audio-Briefing (09:42) zur Episode „Jev is HERE. How to use it" (Isenberg/Vogel) als mp4. **Transkribiert** mit `~/workspace/scripts/grok-stt.sh --language de` (xAI Grok STT, 8.677 Zeichen, exit 0; STT-Fehler im Rohtext belassen: JEF/Jeff/Jed=Jev, Eisenberg=Isenberg, Ryan Fogel=Vogel, Vessel Gateway=Vercel AI Gateway). **Neue Zahlen:** 1.700 E-Mails · **4,2 Mio. Input-Token · 500k Output-Token · 18 US-Cent** (gegen `4,2 Mio. × $0,042 = $0,176` gerechnet → plausibel; die „~$0,16" einer Auto-Videobeschreibung ist Rundungsvariante), **~200 ms pro Anfrage** (⚠️ Briefing-Verdichtung der 70–500-ms-Spanne), **17 Highlights aus 1,1 Mio. Token in ~3 s** (Clipping), **Flug Zürich→London in 7,1 s** vs. 1–3 min bei herkömmlichen Agenten, Lead-Score 0–1 mit „98 % Qualität". ⚠️ Nur im Briefing, kein Originaltranscript — alle Episodenzahlen nicht am Original prüfbar. **These des Briefings:** Arbeit verschiebt sich „zu 100 % auf das Design der Aufgabenstruktur" — nicht Antworten sind das Produkt, sondern **Kategorien-Design**. Wiki: `concepts/llm/jev-vercel-ai-gateway.md` (neuer Abschnitt „Episodeninhalt (Briefing-Transkript)", Kennzahlen-Tabelle, 18-Cent-Herkunft präzisiert). Raw: `raw/other/2026-09-18_herman-briefing-jev-transcript.md` (neu — Volltext + Zahlen-Deckungstabelle).)* *Vorherige Aktualisierung: 2026-09-18 (222. Update — Jev-Benchmarklage: Evals-Seite lokal ausgewertet + Vercel-`fx`-Guardrail-Tausch + Label-Kritik. Anlass: Zusammenfassung von DeltaKralle (@DeltaKrallenbot) in OME Topic „JEV", die Jev als „auf Augenhöhe mit Luna/Terra/Sonnet 5, **über Opus 5**" beschreibt — **invertiert**. **Lokal verifiziert:** [evals.typesafe.ai](https://evals.typesafe.ai/) HTTP 200/65.008 Byte, Text vollständig extrahierbar. Aggregat (Workflow-Modus, vier Workflows gleichgewichtet): **Jev 67,8 % · $0,0004 · 0,4 s** · luna 66,8 %/$0,0033/12,9 s · terra **67,9 %**/$0,0304/10,1 s · sonnet 5 **67,8 %**/$0,1174/78,1 s · **sol 74,1 %**/$0,0836/23,3 s · **opus 5 73,1 %**/$0,1761/37,8 s · haiku 4.5 53,6 % · DS v4 flash 64,4 % · DS v4 pro 65,5 %. Jev liegt also **auf Augenhöhe mit Terra/Sonnet 5, einen Punkt über Luna — und ~5 Punkte UNTER Opus 5 sowie ~6 unter Sol.** Je Workflow streut das Mittel stark: Customer Service 76,0 % (sol 78,3), Agent Trace 71,6 % (sol 76,6), Security Incidents 61,7 % (opus 5 66,2), **Invoice Processing 61,8 % (sol 79,1 — fast 18 Punkte zurück)**. Referenzlabels = Durchschnitt aus GPT-6 Astra + Fable 5.1 (kein Mensch, keine Ground Truth; wer gegen einen gemeinsamen Blindfleck richtig liegt, wird abgewertet); Seite legt Harness-Annahme offen („we assume that the code is correct"). **Zweiter Neubefund:** Vercel-CEO Guillermo Rauch ([@rauchg](https://x.com/rauchg), 871.158 Follower) tauscht den Sicherheits-Reviewer in `fx` (Modus „auto", prüft jeden Befehl) von GPT-5.6 Luna auf Jev — „up to 18x faster (p95) and more accurate", „likely new default"; Vercel-Bauer Pranit (@fazxes): „~5-18x faster and more accurate". ⚠️ **Benchmark nicht veröffentlicht.** Wiki: `people/gabriel-anhaia.md` (neu — Autor der Label-Kritik + Prüf-Maßstab für Guardrail-Tausche); Update `concepts/llm/system-one-models-jev.md` (neue Abschnitte „Benchmark-Lage" und „Guardrail-Tausch bei Vercel fx", Genauigkeits-Fehllektüre markiert, offene Punkte korrigiert). Raw: `raw/other/2026-09-17_typesafe-workflow-evals.md` (neu), `raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md` (neu).)* *Vorherige Aktualisierung: 2026-09-18 (221. Update — Jev praktisch: Berman-Video + Demo-Welle + Ankündigungspost. Anlass: YouTube-Link „We need to talk about Jev..." (Matthew Berman, 18.09.2026, 12:30, 82.291 Views, **mit Werbekennzeichnung**/Sponsor Zapier) von Pit Weber in OME Topic „JEV". ⚠️ **Kein Transcript** — yt-dlp „Sign in to confirm you're not a bot" (auch mit `--js-runtimes node`), kein `captionTracks`, Firecrawl lieferte nur Consent-/401-Seite, Crawl4AI startet nicht (Playwright-Binary fehlt), Transkriptdienste 403/522; auswertbar waren Beschreibung, Quellenliste und Aufrufzahl. **Aufgelöste Quellenliste des Videos** (fxtwitter): Diogo Almeida Launch-Post (15.09.2026, **34,9 Mio. Views/69.647 Likes** — nennt **Spannen** „20-200x faster"/„40-400x cheaper", nicht 200×/400× als Erwartungswert), AI/ML API Schach-Test (Jev vs. Fable 5.1: materiell unterlegen, **Sieg auf Zeit**, ~2,6 s/Zug vs. 6–15 s; vs. GPT-6 Astra: **Matt in 18 Zügen**), kitze „Unclutter" (Ad-/Slop-Blocker, BYOK/Open Source), Riley Brown („agent with model router powered by Jev"), Justin Schroeder („rebuilt Tesla FSD in <1 h" — viralster und inhaltsleerster Post der Reihe), @The_Alex (Melee). Wiki: `concepts/llm/jev-praxis-demos.md` (neu — Demos als Tabelle mit Belastbarkeits-Abstufung, Zeitökonomie als Kernbefund), `people/matthew-berman.md`, `people/kitze.md`, `people/riley-brown.md`, `people/justin-schroeder.md`, `people/alex-the-alex.md` (alle neu), `institutions/ai-ml-api.md` (neu); Updates `concepts/llm/system-one-models-jev.md` (Ankündigungspost + Demo-Welle), `people/diogo-almeida.md` (Launch-Post + Views). Raw: `raw/youtube/2026-09-18_berman-jev.md` (neu), `raw/xpost/2026-09-15_almeida-jev-launch-post.md` (neu).)* @@ -439,6 +440,7 @@ | [Justin Schroeder](people/justin-schroeder.md) | Entwickler (@jpschroeder): „I rebuilt Tesla Full Self Driving with Jev in less than an hour" (16.09.2026, **568.108 Views / 4.580 Likes** — viralster Post der Welle). **Lehrstück über Viralität:** stärkstes Engagement auf schwächster Evidenz, kein Repo/keine Metrik/kein Aufbau | youtube/2026-09-18_berman-jev.md | | [Alex (@The_Alex)](people/alex-the-alex.md) | Kleiner X-Account, „Jev can play Melee" (17.09.2026, 2.478 Views). Reine Behauptung; Gegenpol zur Viralitäts-These (Reichweite und Substanz hier gleich gering) | youtube/2026-09-18_berman-jev.md | | [Andy Gao](people/andy-gao.md) | Entwickler (@instantricecook, **563 Follower**, verifiziert, gao.haus): „I built a voice controlled computer-use for my mac using @typesafeai's Jev" (18.09.2026, **139.442 Views** — Reichweite aus dem Thema, nicht aus dem Account). Erster Demo-Erbauer, dessen Material eine **visuelle Prüfung der Kernaussage** zulässt (STT + 9 Standbilder). ⚠️ Keine Beziehung zu TypeSafe bekannt, kein Code | xpost/2026-09-18_andy-gao-jev-voice-computer-use.md | +| [CJ Zafir](people/cj-zafir.md) | Entwickler (@cjzafir, **64.375 Follower**, verifiziert), Bio „I fine-tune small language models (SLMs) and beat large language models". **Erfahrungsbericht zu Jev** (18.09.2026, 33.238 Views): „I burned **$3.40 on Jev in 24 hours**" — erster Ausgabenwert aus echter Nutzung (≈81 Mio. Input-Token, ~19 Postfach-Durchläufe). Kern „**Jev + LLMs**" (System-1-Controller für Routing, Tool-Wahl, Scoring) trägt; ⚠️ zwei Punkte überzeichnet („lernt aus einem Prompt" = Konfiguration; „32k → 1M wird RAG reparieren" — Doku kennt 64k/32k, kein 1M). Eigeninteresse: kleine Modelle | xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md | | [Ryan Vogel](people/ryan-vogel.md) | Entwickler/Unternehmer (@ryanvogel, 18.201 Follower): „ceo of @rebasetv / founding developer @opencode @anomalyco", Standort Florida. Gast der Episode „Jev is HERE. How to use it" bei Greg Isenberg (18.09.2026). Relevanz fürs Wiki v. a. über **OpenCode** (Open-Source-Coding-Agent, Partnermodus von DeepSeek V4.1 Flash). ⚠️ Episode-Inhalt nicht ausgewertet; Rebase-TV-Selbstbeschreibung ungeprüft | xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md | *(Weitere Kandidaten: Graeme (gkisokay), Mr. Cy (Cyb3rblade), Pit Weber (Kai) — bei Bedarf nachziehen)* @@ -724,4 +726,6 @@ | `raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md` | blog | Gabriel Anhaia (17.09.2026): „Jev Beat GPT Luna by 1 Point. GPT-6 and Claude Wrote the Answer Key." — Vercel-`fx`-Reviewer-Wechsel (Rauchg/@fazxes, „~5-18x faster and more accurate", **Benchmark unveröffentlicht**), TypeSafe-Aggregat-Tabelle (gegengeprüft, korrekt), **Label-Kritik** (Reference-Labels aus zwei Frontier-Modellen → gemeinsame Blindflecken werten richtige Abweichler ab; TypeSafe legt Bias selbst offen und nennt die Homepage-Zahl „higher end of real world gains"). Fünf Prüfschritte vor dem Tausch. Wiki: `people/gabriel-anhaia.md` (neu) | | `raw/other/2026-09-18_herman-briefing-jev-transcript.md` | other | **Herman-Briefing zu Jev** (deutsches Audio-Briefing 09:42 zur Episode „Jev is HERE. How to use it", Isenberg/Vogel), gepostet von Pit in OME Topic „JEV" (18.09.2026 22:38 UTC, mp4 15,3 MB). **STT-Transkript** (Grok STT, de, 8.677 Zeichen) — Volltext + Zahlen-Deckungstabelle. Kernzahlen: 1.700 Mails/4,2 Mio Input-/500k Output-Token/18 US-Cent; ~200 ms/Anfrage; 17 Highlights aus 1,1 Mio Token in ~3 s; Flug Zürich→London in 7,1 s. ⚠️ Dritt-Zusammenfassung, kein Originaltranscript; STT-Fehler dokumentiert. Wiki: `concepts/llm/jev-vercel-ai-gateway.md` | | `raw/xpost/2026-09-18_andy-gao-jev-voice-computer-use.md` | xpost | Andy Gao (@instantricecook, 563 Follower): „voice controlled computer-use for my mac using @typesafeai's Jev" (https://x.com/instantricecook/status/2100814590300889426, 18.09.2026 05:10 UTC; 139.442 Views / 2.038 Likes; geteilt von Pit in OME Topic „JEV"). **Video lokal ausgewertet:** STT-Transkript (428 Zeichen) + 9 Standbilder; Kette Notes/Notiz/Arc/Google/x.com/Photo Booth; keine Messwerte, kein Terminal im Bild; Kernaussage (App offen vor Satzende) am Overlay belegt. Wiki: `concepts/agents/jev-sprachsteuerung-computer-use.md` (neu), `people/andy-gao.md` (neu) | +| `raw/other/2026-09-18_typesafe-docs-jev-spezifikation.md` | other | TypeSafe **Docs-Spezifikation** (https://docs.typesafe.ai/models + /primitives, lokal gelesen, HTTP 200): Jev **1.13 / `jev-1.13.0`**, $42/Btok bzw. $0,042/Mtok, Output frei, **250.000 Token/s · 1.200 Requests/min**, **64k pro Request / 32k für State + längste Frage**, **Eingabe nur Text** (keine Bild-/Audio-/Video-Eingabe). Primitive: Noul/Choice/Score, eine Frage ist eine Frage („no context-rot" beim Hinzufügen). Rate-Limit-Abgleich: 1,1 Mio. Token ≈ 4,4 s theoretische Mindestdauer gegen die 3 s des Briefings. Wiki: `concepts/llm/system-one-models-jev.md` | +| `raw/xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md` | xpost | CJ Zafir (@cjzafir, 64.375 Follower): „I burned $3.40 on Jev in 24 hours. It's not Jev vs current LLMs. It'll be Jev + LLMs" (https://x.com/cjzafir/status/2100991512020725788, 18.09.2026 16:53 UTC; 33.238 Views / 517 Likes; geteilt von Pit in OME Topic „JEV"). Zehn Punkte mit Volltext-Prüfung: ✅ Punkte 3/4/5/7/8/9/10 dokukonform; ⚠️ Punkt 2 („learn from 1 prompt" = Konfiguration) und Punkt 6 (32k→1M-RAG) überzeichnet; Text-Only-Grenze nicht erwähnt. Kosten-Gegenrechnung ≈81 Mio. Input-Token. Wiki: `people/cj-zafir.md` (neu) | | `raw/xpost/2026-09-15_almeida-jev-launch-post.md` | xpost | Diogo Almeida ([@CompleteSkeptic](https://x.com/CompleteSkeptic), 113.333 Follower; Bio „co-created RLHF/ChatGPT @ @openai … (ceo @typesafeai)"): **Jev-Launch-Post** (15.09.2026 18:17 UTC, 34.903.594 Views / 69.647 Likes bei Abruf). Wortlaut: „After co-inventing ChatGPT…"; Zahlen als **Spannen** „20-200x faster / 40-400x cheaper (w/ output tokens free)" — die kursierenden 200×/400× sind die Obergrenzen. Wiki: `people/diogo-almeida.md` (Launch-Post-Abschnitt), `concepts/llm/system-one-models-jev.md` | diff --git a/wiki/log.md b/wiki/log.md index 8d0a0e7..ea28b0e 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -2,6 +2,31 @@ *Append-only changelog. Start: 2026-06-05* +## 2026-09-18 — Jev: Anbieter-Spezifikation aus den Docs + erster Nutzungs-Kostenwert + +**Type:** ingest + wiki-update | **Scope:** raw/other, raw/xpost, wiki/concepts/llm, wiki/people, wiki/index, wiki/log +**Anlass:** X-Post https://x.com/cjzafir/status/2100991512020725788 von Pit Weber in OME Topic „JEV" (22:48 UTC) — zehn Punkte Vor-/Nachteile, eingangs „I burned **$3.40 on Jev in 24 hours**". +**Vorgehen:** Statt den Post nur zu referieren, die **Anbieter-Dokumentation** lokal gelesen: https://docs.typesafe.ai/models (HTTP 200, 338.781 Byte) und /primitives (HTTP 200, 449.968 Byte), Text extrahierbar. +**Harte Spezifikation (erstmals im Wiki):** +- Modell **Jev 1.13**, ID **`jev-1.13.0`** · **$42/Btok** bzw. **$0,042/Mtok** Input, „Output tokens are free". +- **Rate Limits: 250.000 Token/Sekunde · 1.200 Requests/Minute.** +- **Kontext: 64k Token pro Request; 32k Token für State + die längste Frage.** +- **Eingabe nur Text** (String, JSON-Objekt, Array) — „No image, audio, or video input". +**Zwei belegte Korrekturen:** +1. **Die kursierende „32k-Kontext"-Angabe ist die engere der beiden Grenzen.** CJ Zafir nennt nur sie. Das in seinem Post versprochene **1M-Fenster hat in der Dokumentation keine Grundlage** — und würde Retrieval-Qualität, Aktualität, Berechtigungen und „lost in the middle" ohnehin nicht lösen. +2. **Text-Only relativiert die Desktop-/Browser-Demos.** Ein Computer-Use-Agent kann Bildschirminhalte nicht an Jev geben; er muss den Zustand erst in Text übersetzen. Das betrifft direkt die am selben Abend ingestierte Andy-Gao-Sprachsteuerungs-Demo. +**Kosten-Gegenrechnung:** $3,40 bei $0,042/MTok ≈ **81 Mio. Input-Token** — rund **19 Durchläufe** des bekannten Postfachs (1.700 Mails / 4,2 Mio. Token). Erster Ausgabenwert aus echter Nutzung; alle früheren Kostenangaben waren Anbieterpreise oder Demo-Rechnungen. +**Post-Prüfung (zehn Punkte):** Punkte 3/4/5/7/8/9/10 sind dokukonform (Schnelligkeit ohne Planungs-Token, Output $0, Choice/Score/Noul, paralleles Sampling, RLCD, 70–500 ms, 193,6×/444,6× als Spannen-Obergrenzen). ⚠️ Punkt 2 („learn what to do from just 1 prompt") beschreibt **Konfiguration** durch Schema und Beispiel, nicht Lernen. ⚠️ Punkt 6 überzeichnet (siehe oben). Die **Text-Only-Grenze** fehlt im Post ganz. +**Rate-Limit-Nebenabgleich:** 1,1 Mio. Token gegen 250.000 Token/s ergeben ~4,4 s theoretische Mindestdauer — das deutsche Briefing nannte für denselben Test „rund drei Sekunden". ⚠️ Abweichung nicht auflösbar, nicht als Widerspruch behauptet. +**Dateien:** +- raw (NEW): `raw/other/2026-09-18_typesafe-docs-jev-spezifikation.md`, `raw/xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md` +- wiki (NEW): `wiki/people/cj-zafir.md` +- wiki (UPDATED): `wiki/concepts/llm/system-one-models-jev.md` (Abschnitt „Spezifikation (Anbieter-Docs)" mit Tabelle, zwei Korrekturen, Kostenwert) +- `wiki/index.md` (225. Update-Zeile, People-Row, 2 Raw-Rows) +**⚠️:** Erfahrungsbericht eines Einzelnen ohne Verteilung der Ausgaben über Aufgabentypen; Autor hat Eigeninteresse an kleinen Modellen. + +--- + ## 2026-09-18 — Jev als Desktop-Agent: sprachgesteuerter Mac-Computer-Use (lokal geprüft) **Type:** ingest + wiki-update | **Scope:** raw/xpost, wiki/concepts/agents, wiki/concepts/llm, wiki/people, wiki/index, wiki/log diff --git a/wiki/people/cj-zafir.md b/wiki/people/cj-zafir.md new file mode 100644 index 0000000..bdbc25b --- /dev/null +++ b/wiki/people/cj-zafir.md @@ -0,0 +1,31 @@ +--- +created: 2026-09-18 +updated: 2026-09-18 +sources: [xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md] +tags: [person, cj-zafir, small-language-models, jev, erfahrungsbericht] +--- + +# CJ Zafir + +Entwickler ([@cjzafir](https://x.com/cjzafir) auf X, **64.375 Follower**, verifiziert; Bio: „I fine-tune small language models (SLMs) and beat large language models (LLMs)"). Arbeitet an kleinen, selbst trainierten Modellen. + +## Auftritt im Wiki + +**Erfahrungsbericht zu Jev** ([Post 18.09.2026, 16:53 UTC](https://x.com/cjzafir/status/2100991512020725788), 33.238 Views / 517 Likes / 32 Replies bei Abruf am Abend): „I burned **$3.40 on Jev in 24 hours**. It's not Jev vs current LLMs. It'll be **Jev + LLMs**." Zehn Punkte Vor- und Nachteile. + +Bedeutung für das Wiki: + +- **Erster Ausgabenwert aus echter Nutzung** — bei $0,042/MTok sind $3,40 rund 81 Mio. Input-Token, etwa 19 Durchläufe des bekannten 4,2-Mio.-Postfachs. Alle früheren Kostenangaben waren Anbieterpreise oder Demo-Rechnungen. +- **Kernthese brauchbar:** Jev als **System-1-Controller neben** dem LLM (Routing, Tool-Wahl, Guardrails, Retrieval-Filter), nicht als Ersatz. Das deckt sich mit der Einordnung im Wiki. +- **Zwei Punkte überzeichnet:** „kann aus einem Prompt lernen\" beschreibt **Konfiguration** per Schema und Beispiel, nicht Lernen. Und „32k Kontext ist zu knapp, 1M wird RAG reparieren\" verwechselt die zwei dokumentierten Grenzen (64k pro Request / 32k für State + längste Frage) und verspricht eine Kontextgröße, die in der Dokumentation **nicht** existiert. +- **Keine Erwähnung der Text-Only-Grenze:** Die Docs nennen als Eingabe ausschließlich Text — Bild, Audio und Video sind ausgeschlossen. + +⚠️ Eigeninteresse beachten: Die These „Jev + LLMs" passt zur Positionierung kleiner Modelle, die der Autor vertritt. Keine eigenen Messungen im Post; die Verteilung der $3,40 über Aufgabentypen fehlt. + +Vollständige Prüfung der zehn Punkte: `raw/xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md`. + +## Verwandte Wiki-Seiten + +- [[../concepts/llm/system-one-models-jev.md]] — Spezifikation, Benchmarks, Einordnung +- [[../concepts/llm/jev-praxis-demos.md]] — Demo-Welle und Belastbarkeit +- [[../concepts/agents/ai-agents-2026.md]] — Agent-Architekturen