ingest(other): jev-doku-spezifikation (64k/32k, text-only, rate limits) + cj-zafir-kostenwert
- raw: docs.typesafe.ai/models + /primitives; cjzafir-post mit punkt-fuer-punkt-pruefung - wiki: system-one-models-jev (spezifikations-abschnitt), people/cj-zafir (neu) - korrektur: 32k ist die engere grenze, kein 1M; text-only grenze fuer computer-use - index 225. update + log
This commit is contained in:
parent
0953e8d44a
commit
b5fd7cd999
6 changed files with 204 additions and 2 deletions
38
raw/other/2026-09-18_typesafe-docs-jev-spezifikation.md
Normal file
38
raw/other/2026-09-18_typesafe-docs-jev-spezifikation.md
Normal file
|
|
@ -0,0 +1,38 @@
|
||||||
|
---
|
||||||
|
type: other
|
||||||
|
source_url: https://docs.typesafe.ai/models
|
||||||
|
retrieved: 2026-09-18
|
||||||
|
title: "TypeSafe Docs — Jev-Modellspezifikation (Modell-ID, Rate Limits, Kontext, Eingabetypen)"
|
||||||
|
tags: [jev, typesafe-ai, docs, spezifikation, rate-limits, kontextfenster, modalitaet]
|
||||||
|
---
|
||||||
|
|
||||||
|
# TypeSafe Docs — Jev-Spezifikation (lokal gelesen 18.09.2026)
|
||||||
|
|
||||||
|
Primärquelle der harten Modellangaben: https://docs.typesafe.ai/models — HTTP 200, 338.781 Byte, Text extrahierbar. Ergänzend https://docs.typesafe.ai/primitives (HTTP 200, 449.968 Byte).
|
||||||
|
|
||||||
|
## Spezifikation (Wortlaut der Seite)
|
||||||
|
|
||||||
|
| Feld | Wert |
|
||||||
|
|------|------|
|
||||||
|
| **Aktuelles Modell** | **Jev 1.13** · Modell-ID **`jev-1.13.0`** |
|
||||||
|
| Preis | **$42 / Btok** bzw. **$0.042 / Mtok** — „Charged per input token. Output tokens are free." |
|
||||||
|
| **Rate Limits** | **250.000 Token pro Sekunde** · **1.200 Requests pro Minute** |
|
||||||
|
| **Kontextlänge** | **64k Token pro Request**; **32k Token für State + die längste Frage** |
|
||||||
|
| Eingabe | **Nur Text.** String, JSON-Objekt oder Array von Textwerten. **Keine Bild-, Audio- oder Video-Eingabe.** |
|
||||||
|
| Abrechnung bei Limits | „Too Many Requests" (429); Client-SDKs wiederholen mit Backoff und respektieren den `retry-after`-Header |
|
||||||
|
|
||||||
|
Erläuterung der Kontextangabe aus derselben Seite: „Jev ingests the state once and evaluates every question against it in parallel. **The 64k budget covers the state plus all questions combined; the 32k budget applies to the state plus the single longest question.**"
|
||||||
|
|
||||||
|
## Aus der Primitives-Seite
|
||||||
|
|
||||||
|
- Frage-Typen: **Noul** (ja/nein mit Wahrscheinlichkeit), **Choice** (Option aus definierter Menge, mit Verteilung und Confidence), **Score** (Stufe auf Skala, mit Verteilung und Confidence). Dieselben drei Typen, die auch die Eval-Seite verwendet.
|
||||||
|
- „Each question is evaluated independently, so adding more questions does not create context-rot."
|
||||||
|
- Hinweis auf das Muster **Speculative fan-out** (mehrere Fragen gegen denselben State).
|
||||||
|
- Formulierungshilfe der Doku: Fragen sollen so eng sein, „a knowledgeable person makes in a second given the right context" — gutes Beispiel: „Does this message convey urgency?"; schlechtes Beispiel: „Analyze this message and determine the best course of action".
|
||||||
|
|
||||||
|
## Bedeutung für andere Ingestions
|
||||||
|
|
||||||
|
1. **Die im Umlauf befindliche „32k-Kontext"-Angabe ist die engere der beiden Grenzen.** Wer nur 32k nennt, unterschlägt die 64k-Request-Grenze.
|
||||||
|
2. **Die 1M-Kontext-Erwartung (siehe `raw/xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md`) hat in der Dokumentation keine Grundlage.**
|
||||||
|
3. **Text-Only ist eine harte Grenze für Computer-Use.** Ein Desktop-Agent kann Bildschirminhalte nicht an Jev geben; er muss den Zustand in Text übersetzen. Das relativiert Desktop-/Browser-Demos, die den Eindruck erwecken, Jev verarbeite Bildschirme.
|
||||||
|
4. **Rate-Limit-Abgleich mit der Briefing-Zahl:** 250.000 Token/Sekunde ergeben für 1,1 Mio. Token eine theoretische Mindestdauer von **~4,4 Sekunden** — das deutsche Briefing nannte für denselben Clipping-Test „rund drei Sekunden". Entweder ist die Briefing-Angabe großzügig gerundet, oder der Durchlauf lief gegen andere Grenzen. ⚠️ Die Abweichung ist nicht auflösbar und wird nicht als Widerspruch behauptet.
|
||||||
83
raw/xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md
Normal file
83
raw/xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md
Normal file
|
|
@ -0,0 +1,83 @@
|
||||||
|
---
|
||||||
|
type: xpost
|
||||||
|
source_url: https://x.com/cjzafir/status/2100991512020725788
|
||||||
|
retrieved: 2026-09-18
|
||||||
|
author: "@cjzafir"
|
||||||
|
is_thread: false
|
||||||
|
tags: [jev, typesafe-ai, erfahrungsbericht, kosten, kontextfenster, rag, system-1-controller]
|
||||||
|
---
|
||||||
|
|
||||||
|
# CJ Zafir: „I burned $3.40 on Jev in 24 hours" (18.09.2026)
|
||||||
|
|
||||||
|
## Post (Wortlaut)
|
||||||
|
|
||||||
|
> I burned $3.40 on Jev in 24 hours.
|
||||||
|
>
|
||||||
|
> It's not Jev vs current LLMs. It'll be Jev + LLMs.
|
||||||
|
>
|
||||||
|
> Here are all the goods and bads of Jev.
|
||||||
|
>
|
||||||
|
> 1. Jev or a Jev-like system will be integrated into all LLMs for automatic model routing, small decisions, if/else queries, retrieval, tool selection, scoring, etc. For all these things, LLMs lose a lot of tokens on thinking and planning and use smarter instead of faster models. That can be fixed with Jev.
|
||||||
|
>
|
||||||
|
> 2. Jev can do things that require fine-tuning with LLMs. It can learn what to do from just 1 prompt.
|
||||||
|
>
|
||||||
|
> 3. It's crazy fast. It scans, analyzes, and gives its decisions instantly without a thinking blocker.
|
||||||
|
>
|
||||||
|
> 4. It doesn't waste tokens on thinking in plain English and planning. It scores probabilities and picks the best one.
|
||||||
|
>
|
||||||
|
> 5. Output cost of $0. Which makes sense because it's not built for free-form text generation like LLMs. It just outputs decisions.
|
||||||
|
>
|
||||||
|
> 6. It can fix RAG. The current 32k context is too low, but in the near future, we'll see systems like Jev with a 1M context window, and that'll fix the retrieval problem.
|
||||||
|
>
|
||||||
|
> 7. Jev has 3 decision types: multiple-choice questions, scoring the probability, and Noul.
|
||||||
|
> Choice → Which one?
|
||||||
|
> Score → How much?
|
||||||
|
> Noul → Yes or no?
|
||||||
|
> That's how it doesn't need reasoning.
|
||||||
|
>
|
||||||
|
> 8. Jev works on parallel sampling. LLMs generate sequentially: Token 1 ↓ Token 2 ↓ Token 3 ↓ Token 4. Jev can evaluate multiple questions against the same state in parallel. That's one of the reasons it has great latency.
|
||||||
|
>
|
||||||
|
> 9. Instead of RLHF (Reinforcement Learning from Human Feedback), it works on RLCD (Reinforcement Learning for Calibrated Decisions). With RLCD, the model's goal is not just to predict the answer; it also shows how much confidence it has. A model saying: true is different from: true, 99% confidence.
|
||||||
|
>
|
||||||
|
> 10. Jev response times are roughly: 70–500 ms, which is 193.6× faster and 444.6× cheaper than frontier LLM workflows. The biggest issue with LLMs today is that they take too much time to execute tasks. With a Jev-like system, that'll be at least 50% faster.
|
||||||
|
|
||||||
|
## Metadaten
|
||||||
|
|
||||||
|
- **URL:** https://x.com/cjzafir/status/2100991512020725788 (von Pit Weber in OME Topic „JEV" geteilt, 18.09.2026 22:48 UTC)
|
||||||
|
- **Autor:** CJ Zafir ([@cjzafir](https://x.com/cjzafir), **64.375 Follower**, verifiziert; Bio: „I fine-tune small language models (SLMs) and beat large language models (LLMs)")
|
||||||
|
- **Erstellt:** 18.09.2026 16:53:05 UTC (also ~5,9 h vor dem Teilen)
|
||||||
|
- **Engagement (Abruf 18.09.2026 ~22:48 UTC):** 33.238 Views · 517 Likes · 38 Retweets · 32 Replies
|
||||||
|
- **Typ:** Einzelpost, Liste in 10 Punkten
|
||||||
|
|
||||||
|
## Neuheitswert
|
||||||
|
|
||||||
|
Der erste Beitrag der Jev-Akte mit einer **Ausgabenangabe aus eigener Nutzung**: 3,40 US-Dollar in 24 Stunden. Alle bisherigen Kostenaussagen waren Anbieterpreise oder Demo-Rechnungen Dritter.
|
||||||
|
|
||||||
|
## Gegenrechnung zur Ausgabe
|
||||||
|
|
||||||
|
Bei $0,042 pro Million Input-Token entsprechen $3,40 rund **81 Millionen Input-Token**. Zum Vergleich: der bekannte Demo-Durchlauf „1.700 E-Mails" verbrauchte 4,2 Mio. Input-Token — $3,40 sind also etwa **19 solcher Postfach-Durchläufe**. Die Zahl ist plausibel für einen Entwickler, der 24 Stunden lang systematisch experimentiert.
|
||||||
|
|
||||||
|
## Prüfung der Einzelaussagen
|
||||||
|
|
||||||
|
| # | Aussage | Prüfung |
|
||||||
|
|---|---------|---------|
|
||||||
|
| 1 | Jev als System-1-Controller neben LLMs (Routing, Tool-Wahl, Scoring) | ✅ deckt sich mit der Anbieter-Dokumentation und den genannten Anwendungsfällen |
|
||||||
|
| 2 | „Can learn what to do from just 1 prompt" | ⚠️ **Überzeichnet.** Belegt ist nicht Lernen, sondern **Konfiguration**: Beispiel + Schema definieren die Entscheidung. TypeSafe dokumentiert keine Gewichtsanpassung zur Laufzeit |
|
||||||
|
| 3 | „crazy fast … without a thinking blocker" | ✅ plausibel, deckt sich mit dem dokumentierten parallelen Sampling |
|
||||||
|
| 4 | Keine Planungs-Token, nur Wahrscheinlichkeiten | ✅ korrekt für Choice/Score/Noul |
|
||||||
|
| 5 | Output $0 | ✅ dokumentiert ($42/Btok bzw. $0,042/Mtok Input; Output kostenlos) |
|
||||||
|
| 6 | „current 32k context is too low; 1M will fix RAG" | ⚠️ **teilweise falsch.** Dokumentiert sind **64k pro Request** und **32k für State + längste Frage** — die genannte 32k sind die engere der beiden Grenzen, nicht die einzige. Das angekündigte 1M-Fenster existiert **nicht** in der Dokumentation und würde Retrieval-Probleme (Qualität, Aktualität, Berechtigungen, „lost in the middle") ohnehin nicht lösen |
|
||||||
|
| 7 | Drei Entscheidungstypen Choice/Score/Noul | ✅ korrekt (Anbieter-Primitive) |
|
||||||
|
| 8 | Paralleles Sampling statt sequenzieller Token | ✅ korrekt, Kern der Architektur |
|
||||||
|
| 9 | RLCD statt RLHF, Ziel ist Kalibrierung | ✅ korrekt (Anbieterangabe) |
|
||||||
|
| 10 | 70–500 ms, 193,6× / 444,6× | ✅ Anbieterwerte, korrekt wiedergegeben — es sind **Spannen-Obergrenzen** aus Workflow-Evals, keine Agenten-End-to-End-Werte |
|
||||||
|
|
||||||
|
## Wichtige nicht genannte Einschränkung
|
||||||
|
|
||||||
|
Die Dokumentation nennt als Eingabe **ausschließlich Text** (String, JSON-Objekt oder Array) — „No image, audio, or video input". Für Computer-Use-Anwendungen heißt das: Bildschirminhalte können **nicht** direkt an Jev gehen; ein Agent müsste den Zustand erst in Text übersetzen. Das relativiert die Desktop-Demos, die den Eindruck erwecken, Jev „sehe" den Bildschirm.
|
||||||
|
|
||||||
|
## Offene Punkte
|
||||||
|
|
||||||
|
- ⚠️ Erfahrungsbericht eines einzelnen Entwicklers; keine Angabe, wofür die $3,40 ausgegeben wurden (Verteilung über Aufgabentypen fehlt).
|
||||||
|
- ⚠️ Der Autor hat ein Eigeninteresse an kleinen Modellen (Bio) — seine These „Jev + LLMs" passt zu dieser Position.
|
||||||
|
- ⚠️ Keine Messung der eigenen Latenz oder Genauigkeit.
|
||||||
|
|
@ -1,7 +1,7 @@
|
||||||
---
|
---
|
||||||
created: 2026-09-17
|
created: 2026-09-17
|
||||||
updated: 2026-09-18
|
updated: 2026-09-18
|
||||||
sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md, blog/2026-09-16_theregister-typesafe-jev-doom.md, blog/2026-09-16_vercel-jev-ai-gateway.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, xpost/2026-09-15_almeida-jev-launch-post.md, youtube/2026-09-18_berman-jev.md, other/2026-09-17_typesafe-workflow-evals.md, blog/2026-09-17_devto-jev-vs-luna-bake-off.md]
|
sources: [blog/2026-09-15_typesafe-system-one-models-jev.md, blog/2026-09-15_every-mike-taylor-jev-vibe-check.md, youtube/2026-09-17_aicopium-typesafe-jev.md, blog/2026-09-16_theregister-typesafe-jev-doom.md, blog/2026-09-16_vercel-jev-ai-gateway.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, xpost/2026-09-15_almeida-jev-launch-post.md, youtube/2026-09-18_berman-jev.md, other/2026-09-17_typesafe-workflow-evals.md, blog/2026-09-17_devto-jev-vs-luna-bake-off.md, other/2026-09-18_typesafe-docs-jev-spezifikation.md, xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md]
|
||||||
tags: [concept, llm, typesafe, jev, system-one-models, rlcd, structured-outputs, calibrated-decisions, parallel-sampling, inference-cost, automation, harness]
|
tags: [concept, llm, typesafe, jev, system-one-models, rlcd, structured-outputs, calibrated-decisions, parallel-sampling, inference-cost, automation, harness]
|
||||||
---
|
---
|
||||||
|
|
||||||
|
|
@ -107,6 +107,25 @@ Der Mittelwert verbirgt eine Spanne von 61,7 % bis 76,0 %; bei Rechnungsverarbei
|
||||||
|
|
||||||
Der bislang gewichtigste **Fremdnutzen** liegt nicht in den Evals, sondern in einem Werkzeugwechsel: Vercel-CEO **Guillermo Rauch** ([@rauchg](https://x.com/rauchg), 871.158 Follower) schreibt laut Dev.to-Bericht, der Sicherheits-Reviewer in `fx` (Vercel-Labs-CLI, Modus „auto", prüft jeden Befehl) laufe heute auf **GPT-5.6 Luna** und **Jev sei „up to 18x faster (p95) and more accurate"** — „likely new default". Vercel-Bauer **Pranit** ([@fazxes](https://x.com/fazxes)) berichtet „~5-18x faster and more accurate than gpt-5.6-luna, our current top choice". ⚠️ **Vercel hat den Benchmark nicht veröffentlicht** (Stand 17.09.): keine Fallzahlen, kein Datensatz. Die Zahlen sind als Werkzeugangabe zu lesen, nicht als Messung.
|
Der bislang gewichtigste **Fremdnutzen** liegt nicht in den Evals, sondern in einem Werkzeugwechsel: Vercel-CEO **Guillermo Rauch** ([@rauchg](https://x.com/rauchg), 871.158 Follower) schreibt laut Dev.to-Bericht, der Sicherheits-Reviewer in `fx` (Vercel-Labs-CLI, Modus „auto", prüft jeden Befehl) laufe heute auf **GPT-5.6 Luna** und **Jev sei „up to 18x faster (p95) and more accurate"** — „likely new default". Vercel-Bauer **Pranit** ([@fazxes](https://x.com/fazxes)) berichtet „~5-18x faster and more accurate than gpt-5.6-luna, our current top choice". ⚠️ **Vercel hat den Benchmark nicht veröffentlicht** (Stand 17.09.): keine Fallzahlen, kein Datensatz. Die Zahlen sind als Werkzeugangabe zu lesen, nicht als Messung.
|
||||||
|
|
||||||
|
## Spezifikation (Anbieter-Docs, lokal gelesen 18.09.2026)
|
||||||
|
|
||||||
|
Harte Angaben aus **https://docs.typesafe.ai/models** (HTTP 200, 338.781 Byte; Raw: `raw/other/2026-09-18_typesafe-docs-jev-spezifikation.md`):
|
||||||
|
|
||||||
|
| Feld | Wert |
|
||||||
|
|------|------|
|
||||||
|
| Aktuelles Modell | **Jev 1.13** · Modell-ID **`jev-1.13.0`** |
|
||||||
|
| Preis | **$42/Btok** bzw. $0,042/Mtok Input; „Output tokens are free" |
|
||||||
|
| Rate Limits | **250.000 Token/Sekunde** · **1.200 Requests/Minute** |
|
||||||
|
| Kontext | **64k Token pro Request**; **32k für State + längste Frage** |
|
||||||
|
| Eingabe | **Nur Text** — String, JSON-Objekt oder Array. **Keine Bild-, Audio- oder Video-Eingabe** |
|
||||||
|
|
||||||
|
Zwei Punkte, die in der öffentlichen Diskussion regelmäßig falsch wiedergegeben werden:
|
||||||
|
|
||||||
|
- **„32k Kontext" ist die engere der zwei Grenzen.** Die Doku nennt 64k pro Request; die 32k beziehen sich auf State plus die *längste Einzelfrage*. Wer nur 32k nennt, unterschlägt die Hälfte (so im [[../../people/cj-zafir.md|CJ-Zafir]]-Post).
|
||||||
|
- **Text-Only ist eine harte Grenze für Computer-Use.** Ein Desktop- oder Browser-Agent kann Bildschirminhalte **nicht** an Jev geben; er muss den Zustand erst in Text übersetzen. Das relativiert jede Demo, die den Eindruck erweckt, Jev „sehe" den Bildschirm (etwa [[../agents/jev-sprachsteuerung-computer-use.md]]).
|
||||||
|
|
||||||
|
**Erster Nutzungs-Kostenwert:** [[../../people/cj-zafir.md|CJ Zafir]] berichtet **$3,40 Ausgaben in 24 Stunden** — bei $0,042/MTok rund **81 Mio. Input-Token**, also etwa 19 Durchläufe des bekannten 4,2-Mio.-Postfachs. Bisher waren alle Kostenangaben Anbieterpreise oder Demo-Rechnungen Dritter.
|
||||||
|
|
||||||
## Quellenkritik der Benchmarks
|
## Quellenkritik der Benchmarks
|
||||||
|
|
||||||
Die eigenen Workflow-Evals messen **Übereinstimmung mit Referenzantworten** (Durchschnitt aus GPT-6 Astra und Fable 5.1), nicht unabhängig verifizierte Korrektheit. TypeSafe legt die Bias-Richtungen selbst offen:
|
Die eigenen Workflow-Evals messen **Übereinstimmung mit Referenzantworten** (Durchschnitt aus GPT-6 Astra und Fable 5.1), nicht unabhängig verifizierte Korrektheit. TypeSafe legt die Bias-Richtungen selbst offen:
|
||||||
|
|
@ -169,6 +188,8 @@ Neben Benchmarks und Verteilung entstand eine Welle öffentlicher Bauprojekte
|
||||||
- [[llm-sycophancy-confabulation.md]] — Fehlerklassen jenseits von Halluzination
|
- [[llm-sycophancy-confabulation.md]] — Fehlerklassen jenseits von Halluzination
|
||||||
- [[jev-vercel-ai-gateway.md]] — Verteilung über den Vercel AI Gateway, Isenberg-Post, sieben Geschäftsideen
|
- [[jev-vercel-ai-gateway.md]] — Verteilung über den Vercel AI Gateway, Isenberg-Post, sieben Geschäftsideen
|
||||||
- [[jev-praxis-demos.md]] — Demo-Welle (Doom, Wikipedia-Races, Schach, Modellrouter) und ihre Belastbarkeit
|
- [[jev-praxis-demos.md]] — Demo-Welle (Doom, Wikipedia-Races, Schach, Modellrouter) und ihre Belastbarkeit
|
||||||
|
- [[../agents/jev-sprachsteuerung-computer-use.md]] — Sprachsteuerung als Desktop-Agent (Text-Only-Grenze beachten)
|
||||||
|
- [[../../people/cj-zafir.md]] — Erfahrungsbericht mit Ausgabenwert und Fehllektüren
|
||||||
- [[../../institutions/vercel.md]] — Gateway-Betreiber
|
- [[../../institutions/vercel.md]] — Gateway-Betreiber
|
||||||
- [[../../people/greg-isenberg.md]] — Startup-Ideen-Kanal, der die „18 Cent"-Zahl verbreitet
|
- [[../../people/greg-isenberg.md]] — Startup-Ideen-Kanal, der die „18 Cent"-Zahl verbreitet
|
||||||
|
|
||||||
|
|
|
||||||
|
|
@ -2,7 +2,8 @@
|
||||||
|
|
||||||
*Auto-generated: 2026-07-07*
|
*Auto-generated: 2026-07-07*
|
||||||
|
|
||||||
*Letzte Aktualisierung: 2026-09-18 (224. Update — Jev als Desktop-Agent: sprachgesteuerter Mac-Computer-Use (Andy Gao) — **lokal geprüft**. Anlass: X-Link von Pit in OME Topic „JEV" (22:45 UTC). Post: 563-Follower-Account, aber **139.442 Views / 2.038 Likes** in ~17,6 h. **Video lokal ausgewertet** (6,58 MB, 48 s): STT-Transkript (Grok STT, `en`, 428 Zeichen) + **9 Standbilder** (imageio-ffmpeg nachinstalliert, da das `ffmpeg-static`-Symlink-Ziel fehlt). **Kernaussage am Material bestätigt:** Standbild Sekunde 6 zeigt das Overlay „…en up the Notes app for me? And, um," bei **bereits offenem Notes-Fenster**; Sekunde 12 zeigt „…ew node, let's make the title say hello." bei **bereits angelegter Notiz mit Titel „hello"** — Zielzustände sichtbar, während der Satz noch läuft. Damit ist die Post-Behauptung „opens before I even finish my sentence" für diesen Ablauf belegt (belastbarste Einzelaussage der ganzen Demo-Welle). Kette: Notes → neue Notiz → Arc → Google „Norbert Wiener" → x.com → Photo Booth (Countdown, Auslösung). Screenshot-Analyse fand **kein Terminal, kein Schema, keine Latenz-/Modellangabe** — nur Desktop-Ablauf mit Live-Transkript-Overlay. ⚠️ Keine Messung, kein Code/Repo, kein Nachweis des Jev-Anteils (ein lokales STT + Schlüsselwort-Matching würde dieselben Bilder erzeugen), nur lokal skriptbare Standard-Apps. Wiki: `concepts/agents/jev-sprachsteuerung-computer-use.md` (neu — Demo-Auswertung, Prüfung der Kernaussage, Gegenstück zur Schach-Lehre), `people/andy-gao.md` (neu); Update `concepts/llm/jev-praxis-demos.md` (Zeile + Cross-Ref). Raw: `raw/xpost/2026-09-18_andy-gao-jev-voice-computer-use.md` (neu).)*
|
*Letzte Aktualisierung: 2026-09-18 (225. Update — Jev-Spezifikation aus den Anbieter-Docs + erster Nutzungs-Kostenwert. Anlass: X-Post von CJ Zafir („I burned **$3.40 on Jev in 24 hours**. It's not Jev vs current LLMs. It'll be Jev + LLMs") von Pit in OME Topic „JEV" (22:48 UTC). **Lokal gelesen:** [docs.typesafe.ai/models](https://docs.typesafe.ai/models) (HTTP 200, 338.781 Byte) — Modell **Jev 1.13 / `jev-1.13.0`**, $42/Btok bzw. $0,042/Mtok Input, Output kostenlos, **Rate Limits 250.000 Token/Sekunde · 1.200 Requests/Minute**, **Kontext 64k pro Request / 32k für State + längste Frage**, **Eingabe nur Text — keine Bild-, Audio- oder Video-Eingabe**. Zwei Korrekturen damit belegt: (a) die kursierende „32k-Kontext"-Angabe ist die **engere** der beiden Grenzen (CJ Zafir nennt nur sie), das versprochene **1M-Fenster hat in der Doku keine Grundlage**; (b) **Text-Only relativiert die Desktop-/Browser-Demos** — ein Agent muss den Bildschirmzustand erst in Text übersetzen, Jev „sieht" nichts (betrifft direkt die Andy-Gao-Demo). **Kosten-Gegenrechnung:** $3,40 / $0,042 pro MTok ≈ **81 Mio. Input-Token** — rund **19 Durchläufe** des bekannten 4,2-Mio.-Postfachs (1.700 Mails). Erster Ausgabenwert aus echter Nutzung (bisher nur Anbieterpreise). Weitere Befunde zum Post: Kernthese „Jev + LLMs" (System-1-Controller für Routing/Tool-Wahl/Scoring) trägt; ⚠️ „lernt aus einem Prompt" überzeichnet (Konfiguration, nicht Lernen); Punkte 3/4/5/7/8/9/10 decken sich mit Doku-Anbieterangaben (Choice/Score/Noul, paralleles Sampling, RLCD, 70–500 ms, 193,6×/444,6× als Spannen-Obergrenzen). Wiki: `people/cj-zafir.md` (neu); Update `concepts/llm/system-one-models-jev.md` (neuer Abschnitt „Spezifikation (Anbieter-Docs)" mit Doku-Tabelle und den zwei Korrekturen). Raw: `raw/other/2026-09-18_typesafe-docs-jev-spezifikation.md` (neu), `raw/xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md` (neu).)*
|
||||||
|
*Vorherige Aktualisierung: 2026-09-18 (224. Update — Jev als Desktop-Agent: sprachgesteuerter Mac-Computer-Use (Andy Gao) — **lokal geprüft**. Anlass: X-Link von Pit in OME Topic „JEV" (22:45 UTC). Post: 563-Follower-Account, aber **139.442 Views / 2.038 Likes** in ~17,6 h. **Video lokal ausgewertet** (6,58 MB, 48 s): STT-Transkript (Grok STT, `en`, 428 Zeichen) + **9 Standbilder** (imageio-ffmpeg nachinstalliert, da das `ffmpeg-static`-Symlink-Ziel fehlt). **Kernaussage am Material bestätigt:** Standbild Sekunde 6 zeigt das Overlay „…en up the Notes app for me? And, um," bei **bereits offenem Notes-Fenster**; Sekunde 12 zeigt „…ew node, let's make the title say hello." bei **bereits angelegter Notiz mit Titel „hello"** — Zielzustände sichtbar, während der Satz noch läuft. Damit ist die Post-Behauptung „opens before I even finish my sentence" für diesen Ablauf belegt (belastbarste Einzelaussage der ganzen Demo-Welle). Kette: Notes → neue Notiz → Arc → Google „Norbert Wiener" → x.com → Photo Booth (Countdown, Auslösung). Screenshot-Analyse fand **kein Terminal, kein Schema, keine Latenz-/Modellangabe** — nur Desktop-Ablauf mit Live-Transkript-Overlay. ⚠️ Keine Messung, kein Code/Repo, kein Nachweis des Jev-Anteils (ein lokales STT + Schlüsselwort-Matching würde dieselben Bilder erzeugen), nur lokal skriptbare Standard-Apps. Wiki: `concepts/agents/jev-sprachsteuerung-computer-use.md` (neu — Demo-Auswertung, Prüfung der Kernaussage, Gegenstück zur Schach-Lehre), `people/andy-gao.md` (neu); Update `concepts/llm/jev-praxis-demos.md` (Zeile + Cross-Ref). Raw: `raw/xpost/2026-09-18_andy-gao-jev-voice-computer-use.md` (neu).)*
|
||||||
*Vorherige Aktualisierung: 2026-09-18 (223. Update — Jev-Episode per Briefing-Transcript: Token-Aufschlüsselung und Episodenzahlen. Anlass: Pit postete in OME Topic „JEV" das fertige deutsche Audio-Briefing (09:42) zur Episode „Jev is HERE. How to use it" (Isenberg/Vogel) als mp4. **Transkribiert** mit `~/workspace/scripts/grok-stt.sh --language de` (xAI Grok STT, 8.677 Zeichen, exit 0; STT-Fehler im Rohtext belassen: JEF/Jeff/Jed=Jev, Eisenberg=Isenberg, Ryan Fogel=Vogel, Vessel Gateway=Vercel AI Gateway). **Neue Zahlen:** 1.700 E-Mails · **4,2 Mio. Input-Token · 500k Output-Token · 18 US-Cent** (gegen `4,2 Mio. × $0,042 = $0,176` gerechnet → plausibel; die „~$0,16" einer Auto-Videobeschreibung ist Rundungsvariante), **~200 ms pro Anfrage** (⚠️ Briefing-Verdichtung der 70–500-ms-Spanne), **17 Highlights aus 1,1 Mio. Token in ~3 s** (Clipping), **Flug Zürich→London in 7,1 s** vs. 1–3 min bei herkömmlichen Agenten, Lead-Score 0–1 mit „98 % Qualität". ⚠️ Nur im Briefing, kein Originaltranscript — alle Episodenzahlen nicht am Original prüfbar. **These des Briefings:** Arbeit verschiebt sich „zu 100 % auf das Design der Aufgabenstruktur" — nicht Antworten sind das Produkt, sondern **Kategorien-Design**. Wiki: `concepts/llm/jev-vercel-ai-gateway.md` (neuer Abschnitt „Episodeninhalt (Briefing-Transkript)", Kennzahlen-Tabelle, 18-Cent-Herkunft präzisiert). Raw: `raw/other/2026-09-18_herman-briefing-jev-transcript.md` (neu — Volltext + Zahlen-Deckungstabelle).)*
|
*Vorherige Aktualisierung: 2026-09-18 (223. Update — Jev-Episode per Briefing-Transcript: Token-Aufschlüsselung und Episodenzahlen. Anlass: Pit postete in OME Topic „JEV" das fertige deutsche Audio-Briefing (09:42) zur Episode „Jev is HERE. How to use it" (Isenberg/Vogel) als mp4. **Transkribiert** mit `~/workspace/scripts/grok-stt.sh --language de` (xAI Grok STT, 8.677 Zeichen, exit 0; STT-Fehler im Rohtext belassen: JEF/Jeff/Jed=Jev, Eisenberg=Isenberg, Ryan Fogel=Vogel, Vessel Gateway=Vercel AI Gateway). **Neue Zahlen:** 1.700 E-Mails · **4,2 Mio. Input-Token · 500k Output-Token · 18 US-Cent** (gegen `4,2 Mio. × $0,042 = $0,176` gerechnet → plausibel; die „~$0,16" einer Auto-Videobeschreibung ist Rundungsvariante), **~200 ms pro Anfrage** (⚠️ Briefing-Verdichtung der 70–500-ms-Spanne), **17 Highlights aus 1,1 Mio. Token in ~3 s** (Clipping), **Flug Zürich→London in 7,1 s** vs. 1–3 min bei herkömmlichen Agenten, Lead-Score 0–1 mit „98 % Qualität". ⚠️ Nur im Briefing, kein Originaltranscript — alle Episodenzahlen nicht am Original prüfbar. **These des Briefings:** Arbeit verschiebt sich „zu 100 % auf das Design der Aufgabenstruktur" — nicht Antworten sind das Produkt, sondern **Kategorien-Design**. Wiki: `concepts/llm/jev-vercel-ai-gateway.md` (neuer Abschnitt „Episodeninhalt (Briefing-Transkript)", Kennzahlen-Tabelle, 18-Cent-Herkunft präzisiert). Raw: `raw/other/2026-09-18_herman-briefing-jev-transcript.md` (neu — Volltext + Zahlen-Deckungstabelle).)*
|
||||||
*Vorherige Aktualisierung: 2026-09-18 (222. Update — Jev-Benchmarklage: Evals-Seite lokal ausgewertet + Vercel-`fx`-Guardrail-Tausch + Label-Kritik. Anlass: Zusammenfassung von DeltaKralle (@DeltaKrallenbot) in OME Topic „JEV", die Jev als „auf Augenhöhe mit Luna/Terra/Sonnet 5, **über Opus 5**" beschreibt — **invertiert**. **Lokal verifiziert:** [evals.typesafe.ai](https://evals.typesafe.ai/) HTTP 200/65.008 Byte, Text vollständig extrahierbar. Aggregat (Workflow-Modus, vier Workflows gleichgewichtet): **Jev 67,8 % · $0,0004 · 0,4 s** · luna 66,8 %/$0,0033/12,9 s · terra **67,9 %**/$0,0304/10,1 s · sonnet 5 **67,8 %**/$0,1174/78,1 s · **sol 74,1 %**/$0,0836/23,3 s · **opus 5 73,1 %**/$0,1761/37,8 s · haiku 4.5 53,6 % · DS v4 flash 64,4 % · DS v4 pro 65,5 %. Jev liegt also **auf Augenhöhe mit Terra/Sonnet 5, einen Punkt über Luna — und ~5 Punkte UNTER Opus 5 sowie ~6 unter Sol.** Je Workflow streut das Mittel stark: Customer Service 76,0 % (sol 78,3), Agent Trace 71,6 % (sol 76,6), Security Incidents 61,7 % (opus 5 66,2), **Invoice Processing 61,8 % (sol 79,1 — fast 18 Punkte zurück)**. Referenzlabels = Durchschnitt aus GPT-6 Astra + Fable 5.1 (kein Mensch, keine Ground Truth; wer gegen einen gemeinsamen Blindfleck richtig liegt, wird abgewertet); Seite legt Harness-Annahme offen („we assume that the code is correct"). **Zweiter Neubefund:** Vercel-CEO Guillermo Rauch ([@rauchg](https://x.com/rauchg), 871.158 Follower) tauscht den Sicherheits-Reviewer in `fx` (Modus „auto", prüft jeden Befehl) von GPT-5.6 Luna auf Jev — „up to 18x faster (p95) and more accurate", „likely new default"; Vercel-Bauer Pranit (@fazxes): „~5-18x faster and more accurate". ⚠️ **Benchmark nicht veröffentlicht.** Wiki: `people/gabriel-anhaia.md` (neu — Autor der Label-Kritik + Prüf-Maßstab für Guardrail-Tausche); Update `concepts/llm/system-one-models-jev.md` (neue Abschnitte „Benchmark-Lage" und „Guardrail-Tausch bei Vercel fx", Genauigkeits-Fehllektüre markiert, offene Punkte korrigiert). Raw: `raw/other/2026-09-17_typesafe-workflow-evals.md` (neu), `raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md` (neu).)*
|
*Vorherige Aktualisierung: 2026-09-18 (222. Update — Jev-Benchmarklage: Evals-Seite lokal ausgewertet + Vercel-`fx`-Guardrail-Tausch + Label-Kritik. Anlass: Zusammenfassung von DeltaKralle (@DeltaKrallenbot) in OME Topic „JEV", die Jev als „auf Augenhöhe mit Luna/Terra/Sonnet 5, **über Opus 5**" beschreibt — **invertiert**. **Lokal verifiziert:** [evals.typesafe.ai](https://evals.typesafe.ai/) HTTP 200/65.008 Byte, Text vollständig extrahierbar. Aggregat (Workflow-Modus, vier Workflows gleichgewichtet): **Jev 67,8 % · $0,0004 · 0,4 s** · luna 66,8 %/$0,0033/12,9 s · terra **67,9 %**/$0,0304/10,1 s · sonnet 5 **67,8 %**/$0,1174/78,1 s · **sol 74,1 %**/$0,0836/23,3 s · **opus 5 73,1 %**/$0,1761/37,8 s · haiku 4.5 53,6 % · DS v4 flash 64,4 % · DS v4 pro 65,5 %. Jev liegt also **auf Augenhöhe mit Terra/Sonnet 5, einen Punkt über Luna — und ~5 Punkte UNTER Opus 5 sowie ~6 unter Sol.** Je Workflow streut das Mittel stark: Customer Service 76,0 % (sol 78,3), Agent Trace 71,6 % (sol 76,6), Security Incidents 61,7 % (opus 5 66,2), **Invoice Processing 61,8 % (sol 79,1 — fast 18 Punkte zurück)**. Referenzlabels = Durchschnitt aus GPT-6 Astra + Fable 5.1 (kein Mensch, keine Ground Truth; wer gegen einen gemeinsamen Blindfleck richtig liegt, wird abgewertet); Seite legt Harness-Annahme offen („we assume that the code is correct"). **Zweiter Neubefund:** Vercel-CEO Guillermo Rauch ([@rauchg](https://x.com/rauchg), 871.158 Follower) tauscht den Sicherheits-Reviewer in `fx` (Modus „auto", prüft jeden Befehl) von GPT-5.6 Luna auf Jev — „up to 18x faster (p95) and more accurate", „likely new default"; Vercel-Bauer Pranit (@fazxes): „~5-18x faster and more accurate". ⚠️ **Benchmark nicht veröffentlicht.** Wiki: `people/gabriel-anhaia.md` (neu — Autor der Label-Kritik + Prüf-Maßstab für Guardrail-Tausche); Update `concepts/llm/system-one-models-jev.md` (neue Abschnitte „Benchmark-Lage" und „Guardrail-Tausch bei Vercel fx", Genauigkeits-Fehllektüre markiert, offene Punkte korrigiert). Raw: `raw/other/2026-09-17_typesafe-workflow-evals.md` (neu), `raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md` (neu).)*
|
||||||
*Vorherige Aktualisierung: 2026-09-18 (221. Update — Jev praktisch: Berman-Video + Demo-Welle + Ankündigungspost. Anlass: YouTube-Link „We need to talk about Jev..." (Matthew Berman, 18.09.2026, 12:30, 82.291 Views, **mit Werbekennzeichnung**/Sponsor Zapier) von Pit Weber in OME Topic „JEV". ⚠️ **Kein Transcript** — yt-dlp „Sign in to confirm you're not a bot" (auch mit `--js-runtimes node`), kein `captionTracks`, Firecrawl lieferte nur Consent-/401-Seite, Crawl4AI startet nicht (Playwright-Binary fehlt), Transkriptdienste 403/522; auswertbar waren Beschreibung, Quellenliste und Aufrufzahl. **Aufgelöste Quellenliste des Videos** (fxtwitter): Diogo Almeida Launch-Post (15.09.2026, **34,9 Mio. Views/69.647 Likes** — nennt **Spannen** „20-200x faster"/„40-400x cheaper", nicht 200×/400× als Erwartungswert), AI/ML API Schach-Test (Jev vs. Fable 5.1: materiell unterlegen, **Sieg auf Zeit**, ~2,6 s/Zug vs. 6–15 s; vs. GPT-6 Astra: **Matt in 18 Zügen**), kitze „Unclutter" (Ad-/Slop-Blocker, BYOK/Open Source), Riley Brown („agent with model router powered by Jev"), Justin Schroeder („rebuilt Tesla FSD in <1 h" — viralster und inhaltsleerster Post der Reihe), @The_Alex (Melee). Wiki: `concepts/llm/jev-praxis-demos.md` (neu — Demos als Tabelle mit Belastbarkeits-Abstufung, Zeitökonomie als Kernbefund), `people/matthew-berman.md`, `people/kitze.md`, `people/riley-brown.md`, `people/justin-schroeder.md`, `people/alex-the-alex.md` (alle neu), `institutions/ai-ml-api.md` (neu); Updates `concepts/llm/system-one-models-jev.md` (Ankündigungspost + Demo-Welle), `people/diogo-almeida.md` (Launch-Post + Views). Raw: `raw/youtube/2026-09-18_berman-jev.md` (neu), `raw/xpost/2026-09-15_almeida-jev-launch-post.md` (neu).)*
|
*Vorherige Aktualisierung: 2026-09-18 (221. Update — Jev praktisch: Berman-Video + Demo-Welle + Ankündigungspost. Anlass: YouTube-Link „We need to talk about Jev..." (Matthew Berman, 18.09.2026, 12:30, 82.291 Views, **mit Werbekennzeichnung**/Sponsor Zapier) von Pit Weber in OME Topic „JEV". ⚠️ **Kein Transcript** — yt-dlp „Sign in to confirm you're not a bot" (auch mit `--js-runtimes node`), kein `captionTracks`, Firecrawl lieferte nur Consent-/401-Seite, Crawl4AI startet nicht (Playwright-Binary fehlt), Transkriptdienste 403/522; auswertbar waren Beschreibung, Quellenliste und Aufrufzahl. **Aufgelöste Quellenliste des Videos** (fxtwitter): Diogo Almeida Launch-Post (15.09.2026, **34,9 Mio. Views/69.647 Likes** — nennt **Spannen** „20-200x faster"/„40-400x cheaper", nicht 200×/400× als Erwartungswert), AI/ML API Schach-Test (Jev vs. Fable 5.1: materiell unterlegen, **Sieg auf Zeit**, ~2,6 s/Zug vs. 6–15 s; vs. GPT-6 Astra: **Matt in 18 Zügen**), kitze „Unclutter" (Ad-/Slop-Blocker, BYOK/Open Source), Riley Brown („agent with model router powered by Jev"), Justin Schroeder („rebuilt Tesla FSD in <1 h" — viralster und inhaltsleerster Post der Reihe), @The_Alex (Melee). Wiki: `concepts/llm/jev-praxis-demos.md` (neu — Demos als Tabelle mit Belastbarkeits-Abstufung, Zeitökonomie als Kernbefund), `people/matthew-berman.md`, `people/kitze.md`, `people/riley-brown.md`, `people/justin-schroeder.md`, `people/alex-the-alex.md` (alle neu), `institutions/ai-ml-api.md` (neu); Updates `concepts/llm/system-one-models-jev.md` (Ankündigungspost + Demo-Welle), `people/diogo-almeida.md` (Launch-Post + Views). Raw: `raw/youtube/2026-09-18_berman-jev.md` (neu), `raw/xpost/2026-09-15_almeida-jev-launch-post.md` (neu).)*
|
||||||
|
|
@ -439,6 +440,7 @@
|
||||||
| [Justin Schroeder](people/justin-schroeder.md) | Entwickler (@jpschroeder): „I rebuilt Tesla Full Self Driving with Jev in less than an hour" (16.09.2026, **568.108 Views / 4.580 Likes** — viralster Post der Welle). **Lehrstück über Viralität:** stärkstes Engagement auf schwächster Evidenz, kein Repo/keine Metrik/kein Aufbau | youtube/2026-09-18_berman-jev.md |
|
| [Justin Schroeder](people/justin-schroeder.md) | Entwickler (@jpschroeder): „I rebuilt Tesla Full Self Driving with Jev in less than an hour" (16.09.2026, **568.108 Views / 4.580 Likes** — viralster Post der Welle). **Lehrstück über Viralität:** stärkstes Engagement auf schwächster Evidenz, kein Repo/keine Metrik/kein Aufbau | youtube/2026-09-18_berman-jev.md |
|
||||||
| [Alex (@The_Alex)](people/alex-the-alex.md) | Kleiner X-Account, „Jev can play Melee" (17.09.2026, 2.478 Views). Reine Behauptung; Gegenpol zur Viralitäts-These (Reichweite und Substanz hier gleich gering) | youtube/2026-09-18_berman-jev.md |
|
| [Alex (@The_Alex)](people/alex-the-alex.md) | Kleiner X-Account, „Jev can play Melee" (17.09.2026, 2.478 Views). Reine Behauptung; Gegenpol zur Viralitäts-These (Reichweite und Substanz hier gleich gering) | youtube/2026-09-18_berman-jev.md |
|
||||||
| [Andy Gao](people/andy-gao.md) | Entwickler (@instantricecook, **563 Follower**, verifiziert, gao.haus): „I built a voice controlled computer-use for my mac using @typesafeai's Jev" (18.09.2026, **139.442 Views** — Reichweite aus dem Thema, nicht aus dem Account). Erster Demo-Erbauer, dessen Material eine **visuelle Prüfung der Kernaussage** zulässt (STT + 9 Standbilder). ⚠️ Keine Beziehung zu TypeSafe bekannt, kein Code | xpost/2026-09-18_andy-gao-jev-voice-computer-use.md |
|
| [Andy Gao](people/andy-gao.md) | Entwickler (@instantricecook, **563 Follower**, verifiziert, gao.haus): „I built a voice controlled computer-use for my mac using @typesafeai's Jev" (18.09.2026, **139.442 Views** — Reichweite aus dem Thema, nicht aus dem Account). Erster Demo-Erbauer, dessen Material eine **visuelle Prüfung der Kernaussage** zulässt (STT + 9 Standbilder). ⚠️ Keine Beziehung zu TypeSafe bekannt, kein Code | xpost/2026-09-18_andy-gao-jev-voice-computer-use.md |
|
||||||
|
| [CJ Zafir](people/cj-zafir.md) | Entwickler (@cjzafir, **64.375 Follower**, verifiziert), Bio „I fine-tune small language models (SLMs) and beat large language models". **Erfahrungsbericht zu Jev** (18.09.2026, 33.238 Views): „I burned **$3.40 on Jev in 24 hours**" — erster Ausgabenwert aus echter Nutzung (≈81 Mio. Input-Token, ~19 Postfach-Durchläufe). Kern „**Jev + LLMs**" (System-1-Controller für Routing, Tool-Wahl, Scoring) trägt; ⚠️ zwei Punkte überzeichnet („lernt aus einem Prompt" = Konfiguration; „32k → 1M wird RAG reparieren" — Doku kennt 64k/32k, kein 1M). Eigeninteresse: kleine Modelle | xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md |
|
||||||
| [Ryan Vogel](people/ryan-vogel.md) | Entwickler/Unternehmer (@ryanvogel, 18.201 Follower): „ceo of @rebasetv / founding developer @opencode @anomalyco", Standort Florida. Gast der Episode „Jev is HERE. How to use it" bei Greg Isenberg (18.09.2026). Relevanz fürs Wiki v. a. über **OpenCode** (Open-Source-Coding-Agent, Partnermodus von DeepSeek V4.1 Flash). ⚠️ Episode-Inhalt nicht ausgewertet; Rebase-TV-Selbstbeschreibung ungeprüft | xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md |
|
| [Ryan Vogel](people/ryan-vogel.md) | Entwickler/Unternehmer (@ryanvogel, 18.201 Follower): „ceo of @rebasetv / founding developer @opencode @anomalyco", Standort Florida. Gast der Episode „Jev is HERE. How to use it" bei Greg Isenberg (18.09.2026). Relevanz fürs Wiki v. a. über **OpenCode** (Open-Source-Coding-Agent, Partnermodus von DeepSeek V4.1 Flash). ⚠️ Episode-Inhalt nicht ausgewertet; Rebase-TV-Selbstbeschreibung ungeprüft | xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md |
|
||||||
|
|
||||||
*(Weitere Kandidaten: Graeme (gkisokay), Mr. Cy (Cyb3rblade), Pit Weber (Kai) — bei Bedarf nachziehen)*
|
*(Weitere Kandidaten: Graeme (gkisokay), Mr. Cy (Cyb3rblade), Pit Weber (Kai) — bei Bedarf nachziehen)*
|
||||||
|
|
@ -724,4 +726,6 @@
|
||||||
| `raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md` | blog | Gabriel Anhaia (17.09.2026): „Jev Beat GPT Luna by 1 Point. GPT-6 and Claude Wrote the Answer Key." — Vercel-`fx`-Reviewer-Wechsel (Rauchg/@fazxes, „~5-18x faster and more accurate", **Benchmark unveröffentlicht**), TypeSafe-Aggregat-Tabelle (gegengeprüft, korrekt), **Label-Kritik** (Reference-Labels aus zwei Frontier-Modellen → gemeinsame Blindflecken werten richtige Abweichler ab; TypeSafe legt Bias selbst offen und nennt die Homepage-Zahl „higher end of real world gains"). Fünf Prüfschritte vor dem Tausch. Wiki: `people/gabriel-anhaia.md` (neu) |
|
| `raw/blog/2026-09-17_devto-jev-vs-luna-bake-off.md` | blog | Gabriel Anhaia (17.09.2026): „Jev Beat GPT Luna by 1 Point. GPT-6 and Claude Wrote the Answer Key." — Vercel-`fx`-Reviewer-Wechsel (Rauchg/@fazxes, „~5-18x faster and more accurate", **Benchmark unveröffentlicht**), TypeSafe-Aggregat-Tabelle (gegengeprüft, korrekt), **Label-Kritik** (Reference-Labels aus zwei Frontier-Modellen → gemeinsame Blindflecken werten richtige Abweichler ab; TypeSafe legt Bias selbst offen und nennt die Homepage-Zahl „higher end of real world gains"). Fünf Prüfschritte vor dem Tausch. Wiki: `people/gabriel-anhaia.md` (neu) |
|
||||||
| `raw/other/2026-09-18_herman-briefing-jev-transcript.md` | other | **Herman-Briefing zu Jev** (deutsches Audio-Briefing 09:42 zur Episode „Jev is HERE. How to use it", Isenberg/Vogel), gepostet von Pit in OME Topic „JEV" (18.09.2026 22:38 UTC, mp4 15,3 MB). **STT-Transkript** (Grok STT, de, 8.677 Zeichen) — Volltext + Zahlen-Deckungstabelle. Kernzahlen: 1.700 Mails/4,2 Mio Input-/500k Output-Token/18 US-Cent; ~200 ms/Anfrage; 17 Highlights aus 1,1 Mio Token in ~3 s; Flug Zürich→London in 7,1 s. ⚠️ Dritt-Zusammenfassung, kein Originaltranscript; STT-Fehler dokumentiert. Wiki: `concepts/llm/jev-vercel-ai-gateway.md` |
|
| `raw/other/2026-09-18_herman-briefing-jev-transcript.md` | other | **Herman-Briefing zu Jev** (deutsches Audio-Briefing 09:42 zur Episode „Jev is HERE. How to use it", Isenberg/Vogel), gepostet von Pit in OME Topic „JEV" (18.09.2026 22:38 UTC, mp4 15,3 MB). **STT-Transkript** (Grok STT, de, 8.677 Zeichen) — Volltext + Zahlen-Deckungstabelle. Kernzahlen: 1.700 Mails/4,2 Mio Input-/500k Output-Token/18 US-Cent; ~200 ms/Anfrage; 17 Highlights aus 1,1 Mio Token in ~3 s; Flug Zürich→London in 7,1 s. ⚠️ Dritt-Zusammenfassung, kein Originaltranscript; STT-Fehler dokumentiert. Wiki: `concepts/llm/jev-vercel-ai-gateway.md` |
|
||||||
| `raw/xpost/2026-09-18_andy-gao-jev-voice-computer-use.md` | xpost | Andy Gao (@instantricecook, 563 Follower): „voice controlled computer-use for my mac using @typesafeai's Jev" (https://x.com/instantricecook/status/2100814590300889426, 18.09.2026 05:10 UTC; 139.442 Views / 2.038 Likes; geteilt von Pit in OME Topic „JEV"). **Video lokal ausgewertet:** STT-Transkript (428 Zeichen) + 9 Standbilder; Kette Notes/Notiz/Arc/Google/x.com/Photo Booth; keine Messwerte, kein Terminal im Bild; Kernaussage (App offen vor Satzende) am Overlay belegt. Wiki: `concepts/agents/jev-sprachsteuerung-computer-use.md` (neu), `people/andy-gao.md` (neu) |
|
| `raw/xpost/2026-09-18_andy-gao-jev-voice-computer-use.md` | xpost | Andy Gao (@instantricecook, 563 Follower): „voice controlled computer-use for my mac using @typesafeai's Jev" (https://x.com/instantricecook/status/2100814590300889426, 18.09.2026 05:10 UTC; 139.442 Views / 2.038 Likes; geteilt von Pit in OME Topic „JEV"). **Video lokal ausgewertet:** STT-Transkript (428 Zeichen) + 9 Standbilder; Kette Notes/Notiz/Arc/Google/x.com/Photo Booth; keine Messwerte, kein Terminal im Bild; Kernaussage (App offen vor Satzende) am Overlay belegt. Wiki: `concepts/agents/jev-sprachsteuerung-computer-use.md` (neu), `people/andy-gao.md` (neu) |
|
||||||
|
| `raw/other/2026-09-18_typesafe-docs-jev-spezifikation.md` | other | TypeSafe **Docs-Spezifikation** (https://docs.typesafe.ai/models + /primitives, lokal gelesen, HTTP 200): Jev **1.13 / `jev-1.13.0`**, $42/Btok bzw. $0,042/Mtok, Output frei, **250.000 Token/s · 1.200 Requests/min**, **64k pro Request / 32k für State + längste Frage**, **Eingabe nur Text** (keine Bild-/Audio-/Video-Eingabe). Primitive: Noul/Choice/Score, eine Frage ist eine Frage („no context-rot" beim Hinzufügen). Rate-Limit-Abgleich: 1,1 Mio. Token ≈ 4,4 s theoretische Mindestdauer gegen die 3 s des Briefings. Wiki: `concepts/llm/system-one-models-jev.md` |
|
||||||
|
| `raw/xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md` | xpost | CJ Zafir (@cjzafir, 64.375 Follower): „I burned $3.40 on Jev in 24 hours. It's not Jev vs current LLMs. It'll be Jev + LLMs" (https://x.com/cjzafir/status/2100991512020725788, 18.09.2026 16:53 UTC; 33.238 Views / 517 Likes; geteilt von Pit in OME Topic „JEV"). Zehn Punkte mit Volltext-Prüfung: ✅ Punkte 3/4/5/7/8/9/10 dokukonform; ⚠️ Punkt 2 („learn from 1 prompt" = Konfiguration) und Punkt 6 (32k→1M-RAG) überzeichnet; Text-Only-Grenze nicht erwähnt. Kosten-Gegenrechnung ≈81 Mio. Input-Token. Wiki: `people/cj-zafir.md` (neu) |
|
||||||
| `raw/xpost/2026-09-15_almeida-jev-launch-post.md` | xpost | Diogo Almeida ([@CompleteSkeptic](https://x.com/CompleteSkeptic), 113.333 Follower; Bio „co-created RLHF/ChatGPT @ @openai … (ceo @typesafeai)"): **Jev-Launch-Post** (15.09.2026 18:17 UTC, 34.903.594 Views / 69.647 Likes bei Abruf). Wortlaut: „After co-inventing ChatGPT…"; Zahlen als **Spannen** „20-200x faster / 40-400x cheaper (w/ output tokens free)" — die kursierenden 200×/400× sind die Obergrenzen. Wiki: `people/diogo-almeida.md` (Launch-Post-Abschnitt), `concepts/llm/system-one-models-jev.md` |
|
| `raw/xpost/2026-09-15_almeida-jev-launch-post.md` | xpost | Diogo Almeida ([@CompleteSkeptic](https://x.com/CompleteSkeptic), 113.333 Follower; Bio „co-created RLHF/ChatGPT @ @openai … (ceo @typesafeai)"): **Jev-Launch-Post** (15.09.2026 18:17 UTC, 34.903.594 Views / 69.647 Likes bei Abruf). Wortlaut: „After co-inventing ChatGPT…"; Zahlen als **Spannen** „20-200x faster / 40-400x cheaper (w/ output tokens free)" — die kursierenden 200×/400× sind die Obergrenzen. Wiki: `people/diogo-almeida.md` (Launch-Post-Abschnitt), `concepts/llm/system-one-models-jev.md` |
|
||||||
|
|
|
||||||
25
wiki/log.md
25
wiki/log.md
|
|
@ -2,6 +2,31 @@
|
||||||
|
|
||||||
*Append-only changelog. Start: 2026-06-05*
|
*Append-only changelog. Start: 2026-06-05*
|
||||||
|
|
||||||
|
## 2026-09-18 — Jev: Anbieter-Spezifikation aus den Docs + erster Nutzungs-Kostenwert
|
||||||
|
|
||||||
|
**Type:** ingest + wiki-update | **Scope:** raw/other, raw/xpost, wiki/concepts/llm, wiki/people, wiki/index, wiki/log
|
||||||
|
**Anlass:** X-Post https://x.com/cjzafir/status/2100991512020725788 von Pit Weber in OME Topic „JEV" (22:48 UTC) — zehn Punkte Vor-/Nachteile, eingangs „I burned **$3.40 on Jev in 24 hours**".
|
||||||
|
**Vorgehen:** Statt den Post nur zu referieren, die **Anbieter-Dokumentation** lokal gelesen: https://docs.typesafe.ai/models (HTTP 200, 338.781 Byte) und /primitives (HTTP 200, 449.968 Byte), Text extrahierbar.
|
||||||
|
**Harte Spezifikation (erstmals im Wiki):**
|
||||||
|
- Modell **Jev 1.13**, ID **`jev-1.13.0`** · **$42/Btok** bzw. **$0,042/Mtok** Input, „Output tokens are free".
|
||||||
|
- **Rate Limits: 250.000 Token/Sekunde · 1.200 Requests/Minute.**
|
||||||
|
- **Kontext: 64k Token pro Request; 32k Token für State + die längste Frage.**
|
||||||
|
- **Eingabe nur Text** (String, JSON-Objekt, Array) — „No image, audio, or video input".
|
||||||
|
**Zwei belegte Korrekturen:**
|
||||||
|
1. **Die kursierende „32k-Kontext"-Angabe ist die engere der beiden Grenzen.** CJ Zafir nennt nur sie. Das in seinem Post versprochene **1M-Fenster hat in der Dokumentation keine Grundlage** — und würde Retrieval-Qualität, Aktualität, Berechtigungen und „lost in the middle" ohnehin nicht lösen.
|
||||||
|
2. **Text-Only relativiert die Desktop-/Browser-Demos.** Ein Computer-Use-Agent kann Bildschirminhalte nicht an Jev geben; er muss den Zustand erst in Text übersetzen. Das betrifft direkt die am selben Abend ingestierte Andy-Gao-Sprachsteuerungs-Demo.
|
||||||
|
**Kosten-Gegenrechnung:** $3,40 bei $0,042/MTok ≈ **81 Mio. Input-Token** — rund **19 Durchläufe** des bekannten Postfachs (1.700 Mails / 4,2 Mio. Token). Erster Ausgabenwert aus echter Nutzung; alle früheren Kostenangaben waren Anbieterpreise oder Demo-Rechnungen.
|
||||||
|
**Post-Prüfung (zehn Punkte):** Punkte 3/4/5/7/8/9/10 sind dokukonform (Schnelligkeit ohne Planungs-Token, Output $0, Choice/Score/Noul, paralleles Sampling, RLCD, 70–500 ms, 193,6×/444,6× als Spannen-Obergrenzen). ⚠️ Punkt 2 („learn what to do from just 1 prompt") beschreibt **Konfiguration** durch Schema und Beispiel, nicht Lernen. ⚠️ Punkt 6 überzeichnet (siehe oben). Die **Text-Only-Grenze** fehlt im Post ganz.
|
||||||
|
**Rate-Limit-Nebenabgleich:** 1,1 Mio. Token gegen 250.000 Token/s ergeben ~4,4 s theoretische Mindestdauer — das deutsche Briefing nannte für denselben Test „rund drei Sekunden". ⚠️ Abweichung nicht auflösbar, nicht als Widerspruch behauptet.
|
||||||
|
**Dateien:**
|
||||||
|
- raw (NEW): `raw/other/2026-09-18_typesafe-docs-jev-spezifikation.md`, `raw/xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md`
|
||||||
|
- wiki (NEW): `wiki/people/cj-zafir.md`
|
||||||
|
- wiki (UPDATED): `wiki/concepts/llm/system-one-models-jev.md` (Abschnitt „Spezifikation (Anbieter-Docs)" mit Tabelle, zwei Korrekturen, Kostenwert)
|
||||||
|
- `wiki/index.md` (225. Update-Zeile, People-Row, 2 Raw-Rows)
|
||||||
|
**⚠️:** Erfahrungsbericht eines Einzelnen ohne Verteilung der Ausgaben über Aufgabentypen; Autor hat Eigeninteresse an kleinen Modellen.
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
## 2026-09-18 — Jev als Desktop-Agent: sprachgesteuerter Mac-Computer-Use (lokal geprüft)
|
## 2026-09-18 — Jev als Desktop-Agent: sprachgesteuerter Mac-Computer-Use (lokal geprüft)
|
||||||
|
|
||||||
**Type:** ingest + wiki-update | **Scope:** raw/xpost, wiki/concepts/agents, wiki/concepts/llm, wiki/people, wiki/index, wiki/log
|
**Type:** ingest + wiki-update | **Scope:** raw/xpost, wiki/concepts/agents, wiki/concepts/llm, wiki/people, wiki/index, wiki/log
|
||||||
|
|
|
||||||
31
wiki/people/cj-zafir.md
Normal file
31
wiki/people/cj-zafir.md
Normal file
|
|
@ -0,0 +1,31 @@
|
||||||
|
---
|
||||||
|
created: 2026-09-18
|
||||||
|
updated: 2026-09-18
|
||||||
|
sources: [xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md]
|
||||||
|
tags: [person, cj-zafir, small-language-models, jev, erfahrungsbericht]
|
||||||
|
---
|
||||||
|
|
||||||
|
# CJ Zafir
|
||||||
|
|
||||||
|
Entwickler ([@cjzafir](https://x.com/cjzafir) auf X, **64.375 Follower**, verifiziert; Bio: „I fine-tune small language models (SLMs) and beat large language models (LLMs)"). Arbeitet an kleinen, selbst trainierten Modellen.
|
||||||
|
|
||||||
|
## Auftritt im Wiki
|
||||||
|
|
||||||
|
**Erfahrungsbericht zu Jev** ([Post 18.09.2026, 16:53 UTC](https://x.com/cjzafir/status/2100991512020725788), 33.238 Views / 517 Likes / 32 Replies bei Abruf am Abend): „I burned **$3.40 on Jev in 24 hours**. It's not Jev vs current LLMs. It'll be **Jev + LLMs**." Zehn Punkte Vor- und Nachteile.
|
||||||
|
|
||||||
|
Bedeutung für das Wiki:
|
||||||
|
|
||||||
|
- **Erster Ausgabenwert aus echter Nutzung** — bei $0,042/MTok sind $3,40 rund 81 Mio. Input-Token, etwa 19 Durchläufe des bekannten 4,2-Mio.-Postfachs. Alle früheren Kostenangaben waren Anbieterpreise oder Demo-Rechnungen.
|
||||||
|
- **Kernthese brauchbar:** Jev als **System-1-Controller neben** dem LLM (Routing, Tool-Wahl, Guardrails, Retrieval-Filter), nicht als Ersatz. Das deckt sich mit der Einordnung im Wiki.
|
||||||
|
- **Zwei Punkte überzeichnet:** „kann aus einem Prompt lernen\" beschreibt **Konfiguration** per Schema und Beispiel, nicht Lernen. Und „32k Kontext ist zu knapp, 1M wird RAG reparieren\" verwechselt die zwei dokumentierten Grenzen (64k pro Request / 32k für State + längste Frage) und verspricht eine Kontextgröße, die in der Dokumentation **nicht** existiert.
|
||||||
|
- **Keine Erwähnung der Text-Only-Grenze:** Die Docs nennen als Eingabe ausschließlich Text — Bild, Audio und Video sind ausgeschlossen.
|
||||||
|
|
||||||
|
⚠️ Eigeninteresse beachten: Die These „Jev + LLMs" passt zur Positionierung kleiner Modelle, die der Autor vertritt. Keine eigenen Messungen im Post; die Verteilung der $3,40 über Aufgabentypen fehlt.
|
||||||
|
|
||||||
|
Vollständige Prüfung der zehn Punkte: `raw/xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md`.
|
||||||
|
|
||||||
|
## Verwandte Wiki-Seiten
|
||||||
|
|
||||||
|
- [[../concepts/llm/system-one-models-jev.md]] — Spezifikation, Benchmarks, Einordnung
|
||||||
|
- [[../concepts/llm/jev-praxis-demos.md]] — Demo-Welle und Belastbarkeit
|
||||||
|
- [[../concepts/agents/ai-agents-2026.md]] — Agent-Architekturen
|
||||||
Loading…
Add table
Reference in a new issue