diff --git a/raw/xpost/2026-09-18_brivael-jev-demo-recap.md b/raw/xpost/2026-09-18_brivael-jev-demo-recap.md new file mode 100644 index 0000000..ccbd088 --- /dev/null +++ b/raw/xpost/2026-09-18_brivael-jev-demo-recap.md @@ -0,0 +1,71 @@ +--- +type: xpost +source_url: https://x.com/brivael/status/2100977781936947412 +retrieved: 2026-09-22 +author: "@brivael" +is_thread: false +quote_count: 8 +tags: [jev, typesafe-ai, demo-recap, franzoesisch, demo-welle, zweitquelle] +--- + +# brivael — französischsprachiger Jev-Demo-Recap (18.09.2026) + +## Metadaten (FxTwitter, Abruf 22.09.2026) + +- **Autor:** Brivael Le Pogam (@brivael), Paris, **CEO & CTO von Argil AI (YC S24)**, 164.358 Follower, verifiziert, Account seit 01.01.2025, Buch-Selbstvermarktung in der Bio (gumroad „theshiftingwall") +- **Post:** Note-Tweet, **18.09.2026 15:58 UTC** (während der Demo-Welle); 32.726 Views / 351 Likes / 41 Reposts / 31 Replies / 380 Bookmarks / 8 Quotes; keine Community Note +- **Geteilt von:** Rüdiger (@Stelariz_75) in OME Topic „JEV" (22.09.2026 20:14 UTC) mit der Aufforderung „Verifiziere." +- **Verlinkt:** nur http://typesafe.ai (Link-Vorschau: „Home - TypeSafe AI … Try our first System One Model, Jev, in early access"); die genannten Demos sind **nicht verlinkt** — keine Handles, keine Post-URLs + +## Wortlaut (vollständig, französisch) + +> X est en feu depuis 48h, et c'est presque toujours le même mot dans le feed : Jev de typesafe.ai +> +> Pas un nouveau chatbot. Un modèle qui refuse d'écrire. +> +> Le fondateur, Diogo Almeida, a co-inventé le RLHF chez OpenAI. La recette derrière ChatGPT. Puis il a passé deux ans en stealth à construire l'inverse : un modèle qui ne parle pas aux humains. Il rend des décisions typées à un logiciel, avec une proba collée dessus. +> +> On a passé trois ans à mettre un romancier dans le cockpit. Jev, c'est le pilote qui tire juste le levier. +> +> Concrètement : tu lui donnes un état (un mail, un DOM, un flux de prix, 3 000 posts) et des questions fermées. Choice, Score, ou oui/non calibré. Il répond en 70 à 500 ms. Sortie structurée. Pas de paragraphe à parser. S'il n'est pas sûr, il le dit. +> +> Le prix affiché : 42 $ le milliard de tokens d'entrée. La sortie est gratuite. Parce qu'il n'y a pas de roman à facturer. +> +> Et X a commencé à builder dessus tout de suite. +> +> Moritz pilote son navigateur à la voix. Il parle, Jev renvoie des probas en ~300 ms, le browser clique. 0,0002 $ la décision. Sur « go back », la requête était finie avant la fin de sa phrase. +> +> Jarrod a branché un bot de trading. Jev dit buy ou sell sur le flux de prix, et exécute pour de vrai sur Monad toutes les 300 ms. +> +> Matt a envoyé 724 pubs live de 37 marques. En 40 secondes : chaque hook, chaque format, l'offre, le CTA, le stade d'awareness, le mismatch landing page. 9 cents de tokens. +> +> Ori a fait la même chose sur la librairie d'un concurrent : 1 891 ads classées en 19 secondes, 12 cents. +> +> Ian a donné à Jev 3 282 de ses posts X, 100 millions de vues. 4,2 millions de tokens. 13 centimes. 8 minutes. Verdict : les how-to font 150 likes médians contre 44, et la formule qui sort est « AI coding + enseigner + provocateur ». +> +> Côté agents, ça devient plus intéressant. +> +> Browser Use + Jev trouve un vol en 7 secondes pour 0,0039 $. David Fant pose le cadre : router le modèle, computer use, review de sécurité, et surtout ne plus réveiller un frontier à 1 $ à chaque mail d'un sous-agent. +> +> Tamara s'en sert pour compactter le contexte : scorer chaque tool call, jeter le bruit. Alex a pris le plugin, passé une session Claude d'1 million de tokens à 86k. En une seconde. (Le design de la compaction, lui, est encore débattu. La vitesse, non.) +> +> Michael assemble une UI à la volée. Une requête utilisateur = 153 questions à choix. Jev les pose toutes en parallèle. Environ une seconde. 6× plus rapide que les petits frontier du moment. +> +> Scott va plus loin : les workflows d'entreprise qui passent déjà chaque ticket, chaque facture, chaque claim dans un LLM cher. Un modèle style Jev prend la décision évidente avec une proba honnête. Confiant → on saute le LLM. Pas sûr → le frontier reste. Sur 10 items, 6 ne touchent plus jamais le modèle cher. +> +> C'est ça, le shift. +> +> Les LLM sont extraordinaires pour écrire, raisonner long, parler. Ils sont médiocres dès que ton code a besoin d'une case cochée, mille fois par minute, sans hallucination de schéma. +> +> Jev n'écrit pas le mail. Il dit : billing, 0.91. Urgent, 0.96. Colère, 1.8. Ton logiciel route. +> +> On n'a pas besoin d'un Dieu qui discute. On a besoin d'une primitive aussi ennuyeuse, aussi fiable, aussi invocable qu'une requête SQL. Sauf que la requête porte sur du sens. +> +> X l'a compris en deux jours. Les démos tombent toutes les cinq minutes. +> +> Si tu construis encore des agents qui se parlent entre eux en prose, tu es en train de payer un romancier pour appuyer sur un bouton. + +## Notizen zur Identifikation + +- Keine der genannten Personen (Moritz, Jarrod, Matt, Ori, Ian, David Fant, Tamara, Alex, Michael, Scott) ist im Tweet verlinkt oder mit Handle benannt; ohne Original-Posts bleibt unklar, welche der Demos mit den im Wiki bereits dokumentierten identisch sind. Die Flugbuchung („7 secondes") deckt sich mit der 7,1-Sekunden-Angabe des Isenberg-Briefings; die Voice-Demo mit „Requête finie avant la fin de la phrase" erinnert an die Andy-Gao-Demo — Autorenschaft aber unklar. +- „Colère, 1.8" im Beispielsatz: Jev-Scores sind auf definierte Skalen; 1.8 auf einer Skala >1 ist nur als Skalenwert sinnvoll, nicht als Wahrscheinlichkeit — Beispielwert des Autors, keine Anbieterangabe. \ No newline at end of file diff --git a/wiki/concepts/llm/jev-praxis-demos.md b/wiki/concepts/llm/jev-praxis-demos.md index dbde347..a1eeb30 100644 --- a/wiki/concepts/llm/jev-praxis-demos.md +++ b/wiki/concepts/llm/jev-praxis-demos.md @@ -1,7 +1,7 @@ --- created: 2026-09-18 -updated: 2026-09-18 -sources: [youtube/2026-09-18_berman-jev.md, youtube/2026-09-19_nate-herk-jev-12-use-cases.md, xpost/2026-09-15_almeida-jev-launch-post.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, other/2026-09-19_jev-flyer-kombi-revolution.md, other/2026-09-19_jev-flyer-v11-korrektur.md] +updated: 2026-09-22 +sources: [youtube/2026-09-18_berman-jev.md, youtube/2026-09-19_nate-herk-jev-12-use-cases.md, xpost/2026-09-15_almeida-jev-launch-post.md, xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md, other/2026-09-19_jev-flyer-kombi-revolution.md, other/2026-09-19_jev-flyer-v11-korrektur.md, xpost/2026-09-18_brivael-jev-demo-recap.md] tags: [concept, llm, jev, typesafe-ai, bauprojekte, doom, wikipedia-race, schach, agent-loop, sponsoring, kalibrierung] --- @@ -103,6 +103,19 @@ Seine Zahlen, gegen Preis und Rate Limits gerechnet: ⚠️ Kein Transkript erreichbar (Bot-Check), Zahlen über das Bot-Briefing; **Genauigkeitswerte nennt das Briefing nicht** — verglichen werden Geschwindigkeit und Kosten, nicht Korrektheit. Beschreibung mit werblichen Elementen (Glaido, Hostinger). +## Demo-Recap brivael (18.09.2026, verifiziert 22.09.) + +**[[../../people/brivael.md|Brivael Le Pogam]]** (@brivael, CEO&CTO von Argil AI) veröffentlichte am 18.09.2026 den bislang einzigen **französischsprachigen, namentlich personifizierten Recap der Demo-Welle** (32.726 Views / 380 Bookmarks; Raw: `raw/xpost/2026-09-18_brivael-jev-demo-recap.md`; geteilt von Rüdiger mit „Verifiziere."). Er nennt zehn Demos mit Zahlen — darunter mehrere, die im Wiki bislang fehlen: Voice-Browser („~300 ms, $0,0002 pro Entscheidung"), Trading-Bot auf Monad (real, alle 300 ms), **Ads-Klassifikation in Serie** (724 Ads/40 s/9 ¢ und 1.891 Ads/19 s/12 ¢), **Compaction-Plugin** („1 Mio. Token → 86k in einer Sekunde"), UI-Assemblierung (153 Fragen parallel in ~1 s), und das **Confidence-Gate** („Confiant → on saute le LLM. Pas sûr → le frontier reste. Sur 10 items, 6 ne touchent plus jamais le modèle cher") — exakt die Gate-Logik, die Almeida am 21.09. selbst als Design beschreibt. + +**Prüfungsergebnis (Preis/Limits):** +- ✅ Doku-Angaben korrekt: $42/Btok, 70–500 ms, Stealth, Choice/Score/Boolean; „S'il n'est pas sûr, il le dit" deckt sich mit N8s Kalibrierung (ECE 1,74 pp). +- ⚠️ **Ian: 4,2 Mio. Token für „13 centimes"** — bei $0,042/MTok sind das 17,6 Cent; 13 Cent ergeben nur 3,1 Mio. Token (~26 % Abweichung). Isenberg nennt 18 Cent bei denselben 4,2 Mio. Token — die Recaps widersprechen einander. +- ⚠️ **Alex: „1 Mio. Token in einer Sekunde"** — Lesen von 1 Mio. Token braucht bei 250.000 Token/s **mindestens ~4 s**; der Faktor ~4 ist physikalisch nicht unterschreitbar. +- ⚠️ **Michael: 153 Fragen parallel in ~1 s** = ~9.180 Requests/Minute gegen 1.200 — nur mit Bündelung möglich (gleiche offene Frage wie bei [[../../people/nate-herk.md|Nate Herk]]). +- ✅/⚠️ Übrige Zahlen limit-konform (Moritz ~159k tok/s, Matt ~54k, Ori ~150k, Jarrod 200 RPM), aber unverifiziert. + +⚠️ **Der Tweet verlinkt keine der zitierten Original-Demos** — kein Handle, keine Post-URLs. Der Recap bleibt deshalb Verbreitungssignal und Demo-Inventar; die neuen Zahlen gelten als nicht verifiziert, bis die Original-Posts auftauchen. Identifizierung mit den oben dokumentierten Demos (Flug ≈ Isenberg 7,1 s; Voice ≈ Andy Gao) bleibt unklar. + ## Verwandte Wiki-Seiten - [[system-one-models-jev.md]] — Modell, RLCD, Anbieterangaben, unabhängiger Every-Test diff --git a/wiki/index.md b/wiki/index.md index e753f5f..bbb6585 100644 --- a/wiki/index.md +++ b/wiki/index.md @@ -2,7 +2,7 @@ *Auto-generated: 2026-07-07* -*Letzte Aktualisierung: 2026-09-22 (239. Update — Almeidas Coding-Agent-Notizen + Codilas Use-Case-Ranking. Anlass: X-Link von Rüdiger (@Stelariz_75) in OME Topic „JEV“. **Primärquelle volltextverifiziert:** Google-Doc „[public] thoughts on a typesafe coding agent“ von Diogo Almeida (21.09.2026; Begleitpost 538.493 Views / 3.097 Likes / 4.426 Bookmarks beim Abruf) via /export?format=txt (HTTP 200, 15.737 Byte) — raw/other/2026-09-21_almeida-typesafe-coding-agent-notes.md (neu). **Leitfrage:** „How would you design a coding agent if LLMs had no KV cache?“ — sechs Cache-Verzerrungen (Routing unrentabel ohne Cache-Wirtschaft, vorab spezifizierte Tools, globale Compaction, Subagent-State-Kuration, Restart, fehlende Batterien — **OpenClaw ausdrücklich als Einfachkeits-Extrem genannt**) plus TypeSafe-nativen Ideen: **Meta-Attention** (ein Noul pro Kontext-Chunk statt globaler Compaction), cost-aware Modell-Routing, Tool-Schema on demand, **Conditional AGENTS.md** (geladene Skills „fallen Compaction zum Opfer“), **Security-aware Routing** („don't use anthropic models for LLM research, don't use openai/anthropic for safety-sensitive things“), read-only Background-Tasks mit **Cross-Model Review**. **Status:** Ideen-/Annahmen-Katalog, keine Zusagen; im Begleitpost verneint Almeida, dass TypeSafe den Agenten selbst baut („we likely will never have time (ever again) to play themselves“); Routing-Rechnung selbst als „chatgpt-vibed“ markiert. **Rezeption:** @0xCodila quotete das Doc (89.907 Views / 1.038 Bookmarks; raw/xpost/2026-09-21_codila-jev-usecase-ranking.md, neu): zehn Use Cases gerankt 0–10, Gesamt 8,9 (arithmetisch korrekt); Top-Werte = Gate-/Kontext-Rollen (Kontext 10/10, Permission Gate 9,5, Security-Routing 9,5), Reasoning-Rollen fehlen durchgehend. **Achtung:** „I built and tested the FULL list“ unbelegt — kein Setup, keine Daten; Kuratierung + Lead-Magnet („14-page Jev engineering playbook“). Wiki: concepts/agents/typesafe-coding-agent-idee.md (neu), people/codila.md (neu); Updates people/diogo-almeida.md.)* +*Letzte Aktualisierung: 2026-09-22 (240. Update — brivaels Jev-Demo-Recap (18.09.) verifiziert. Anlass: X-Link von Rüdiger (@Stelariz_75) in OME Topic „JEV“ mit der Aufforderung „Verifiziere.“. **Quelle:** Note-Tweet von Brivael Le Pogam (@brivael, Paris, CEO&CTO Argil AI YC S24, 164.358 Follower; 18.09.2026 15:58 UTC; 32.726 Views / 351 Likes / 380 Bookmarks beim Abruf) — französischsprachiger Recap der Demo-Welle, **Volltext aus FxTwitter** (raw/xpost/2026-09-18_brivael-jev-demo-recap.md, neu). **Befund 1 — dokumentierte Angaben stimmen:** $42/Btok, 70–500 ms, zwei Jahre Stealth, Choice/Score/Boolean, „S'il n'est pas sûr, il le dit“ (Kalibrierung — inzwischen durch N8s ECE 1,74 pp belegt); Flug in 7 s deckt sich mit dem Isenberg-Briefing (7,1 s); Almeida-RLHF-Rahmung als „Co-Autor der RLHF-/InstructGPT-Papiere“ präzisiert (nicht „RLHF-Miterfinder“ — Grundlagenpapier 2017 stammt von anderen). **Befund 2 — zwei Zahlen halten der Prüfung nicht stand:** (a) Ian: 3.282 Posts / 4,2 Mio. Token / „13 centimes“ — bei $0,042/MTok wären 4,2 Mio. Token **17,6 Cent**; 13 Cent ergeben nur **3,1 Mio. Token** (~26 % Abweichung; Isenberg-Version sagt 18 Cent bei denselben 4,2 Mio. — die Recaps sind untereinander inkonsistent). (b) Alex: Compaction „1 Mio. Token → 86k in einer Sekunde“ — Lesen von 1 Mio. Token braucht bei 250.000 Token/s **mindestens ~4 s** (Faktor ~4), egal wie parallel. (c) Michael: 153 Fragen parallel in ~1 s = **~9.180 Requests/Minute** gegen 1.200 dokumentiert → nur mit Bündelung; bei ~400 Token/Frage liegen die ~61.200 Token/s unter dem Token-Limit — gleiche offene Frage wie bei Nate Herk. **Befund 3 — übrige Demo-Zahlen plausibel und limit-konform, aber unverifiziert:** Die zehn Demo-Autoren (Moritz, Jarrod, Matt, Ori, Ian, David Fant, Tamara, Alex, Michael, Scott) sind im Tweet **nicht verlinkt** — kein Handle, keine Post-URLs; der Recap ist Verbreitungssignal und Demo-Inventar, keine Evidenzquelle. Wiki: people/brivael.md (neu); Update concepts/llm/jev-praxis-demos.md.)* *Vorherige Aktualisierung: 2026-09-22 (239. Update — MacStories-Review „M5 Ultra Mac Studio Review: The Dream Mac for Local AI Agents" (Federico Viticci, 21.09.2026; geteilt von Kai @PWeber in OME Topic „Openclaw mit lokalen Modellen", #1744). **Erste unabhängige Verifikation der M5-Ultra-Versprechen** — schließt die Lücke „⚠️ nur Herstellerangaben" auf der Apple-Seite. Raw: `raw/blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md` (neu; web_fetch vollständig, 21.401 Zeichen). Wiki: `people/federico-viticci.md` (neu), `institutions/macstories.md` (neu), Updates in `concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md` (neuer Messwert-Abschnitt: 256-GB-Gerät gegen M3 Ultra 512 GB und RTX 5090 — Generierung ~+70 %, Prefill ~+150 % (≈2,5×), Flash-Next >100 tok/s bei kurzem Prompt und 60–85 tok/s bei 64K–256K Kontext; Prefill bei 6.000-Token-Prompt ~1.700 tok/s vs. 5090 ~3.000 tok/s; Generierung 5090 konstant ~25 % voraus (1,79 vs. 1,2 TB/s), verliert aber oberhalb 32 GB VRAM), `concepts/llm/qwen3.8-flash-next-qwen4-preview.md` (erster dokumentierter Praxiseinsatz: Flash-Next als lokales Default-Modell in Open Minis und Hermes Agent, 5-Bit vollständig im RAM, bis zu 3 parallele Sessions mit Subagenten via oMLX), `concepts/hardware/cloud-exit-and-local-superiority.md` (Cross-Ref). **Produktivnachweis:** 99 Tage Dauerbetrieb mit DeepSeek-V4-Flash-Agenten + olmOCR über 310 Dokumente fürs iOS-/iPadOS-27-Review — Gesamtkosten 0 $, weil dieselbe Dauerlast per Cloud-API als untragbar eingeschätzt wurde. ⚠️ Einzelsetup (n=1), keine reproduzierte Benchmark-Suite.)* *Vorherige Aktualisierung: 2026-09-22 (238. Update — Unabhängiger Jev-vs.-GPT-5.6-Terra-Benchmark von N8 Programs, geteilt als r/ProAI-Repost. **Quelle vollständig aufgelöst:** Reddit-RSS (17.09., normale Seite/JSON blockiert) → [X-Thread](https://x.com/N8Programs/status/2100088523403432357) (16.09.; 179.846 Views beim Abruf) → vier Originalgrafiken lokal gelesen. **Methode:** neun Multiple-Choice-Bedingungen; Terra `reasoning=none`, Letter-only. **Resultate:** Jev gewinnt MMLU 90,91:87,89, GPQA 68,18:56,06, ARC-Easy/Challenge knapp und WinoGrande 91,63:78,69; Terra gewinnt HellaSwag 95,32:94,86, GSM8K deutlich (87,72:79,68 bzw. 69,83:54,59) und Schach knapp 50,25:49,45. Ungewichteter Makromittelwert **Jev 80,69 % · Terra 80,15 %** → „Terra-tier“ trägt eng für diesen Test, nicht als allgemeine Intelligenzbehauptung. **Korrektur des Threadtexts:** Er behauptet einen Jev-Sieg auf HellaSwag; die eigene Tabelle zeigt Terra +0,46 Pp. **Kalibrierung:** N=33.735, ECE **1,74 Pp**, 10 Bins, Wilson-95-%-Intervalle, Einzelbenches 0,26–6,96 Pp — stärkste öffentliche Fremdevidenz für RLCD bisher. **Kosten:** Jev $0,6999 (estimated: Input-Token × $0,042/MTok) vs. Terra $12,9865 (API-reported) = **18,55×**; die ~18×-Rundung hält, die Hersteller-Obergrenze 400–444,6× nicht. **Nicht geprüft:** Geschwindigkeit; kein Repo, keine Prompts/Seeds/Logs, keine Reproduktion, Kontaminationsrisiko öffentlicher Benches. Wiki: `people/n8-programs.md` (neu), `concepts/llm/system-one-models-jev.md` (neuer unabhängiger Benchmark-Abschnitt). Raw: `raw/other/2026-09-17_reddit-n8-jev-terra-benchmark.md` (neu).)* *Vorherige Aktualisierung: 2026-09-22 (237. Update — Grok 4.7 + Grok-Bot-Praxis + ART19-Podcast. **Primärquellen:** [xAI Release](https://x.ai/news/grok-4-7), [API-Modellkarte](https://docs.x.ai/developers/models/grok-4.7), [Cursor-Modellseite](https://cursor.com/docs/models/grok-4-7). Grok 4.7: größerer Basismodell-Kern, längeres RL auf schwierigen mehrstündigen Aufgaben, stärkere Selbstprüfung, natives Grok-Bot-Harness-Verständnis; Modell-ID `grok-4.7`, 500k API-Kontext, Reasoning `low|medium|high|xhigh`; API <200k Prompt $2/M Input · $0,50/M Cached · $6/M Output, ab 200k $4/$1/$12. Herstellerbenchmarks u. a. CursorBench 46,3 %, DeepSWE 71,0 %, Terminal-Bench 38,0 % — **nicht unabhängig reproduziert**. @cb_doge-Post primär gegengeprüft; „twice as fast and half the price“ bleibt dessen Verdichtung. Alex Finns Video (14:06, geteilt von Pit): kein Transcript abrufbar; Workflow nur attribuiert aus YouTube-AI-Zusammenfassung + Herman-Auswertung (PM/Developer/Designer, Exec-Team, Linear/Notion-Issues, Cursor Cloud Agents). Zusätzlich Netbits’ ART19-MP3 als Voll-Ingest: „Grok AI Daily“, 21.09., 29:30, lokales Maschinen-ASR; allgemeiner Newsrecap zu Meta Muse, Cyber-/Safety-Claims, US–China, Trump und Newsom — **kein Grok 4.7**, Grok Bot nur beiläufig. Wiki: `institutions/grok-ai-daily.md` (neu); Updates `institutions/xai.md`, `tools/grok-bot-spacexai.md`, `concepts/llm/llm-model-catalog.md`, `concepts/policy/ai-regulation-2026.md`. Raw: 4 neue Einträge in blog/xpost/youtube/podcast.)* @@ -467,6 +467,7 @@ | [CJ Zafir](people/cj-zafir.md) | Entwickler (@cjzafir, **64.375 Follower**, verifiziert), Bio „I fine-tune small language models (SLMs) and beat large language models". **Erfahrungsbericht zu Jev** (18.09.2026, 33.238 Views): „I burned **$3.40 on Jev in 24 hours**" — erster Ausgabenwert aus echter Nutzung (≈81 Mio. Input-Token, ~19 Postfach-Durchläufe). Kern „**Jev + LLMs**" (System-1-Controller für Routing, Tool-Wahl, Scoring) trägt; ⚠️ zwei Punkte überzeichnet („lernt aus einem Prompt" = Konfiguration; „32k → 1M wird RAG reparieren" — Doku kennt 64k/32k, kein 1M). Eigeninteresse: kleine Modelle | xpost/2026-09-18_cjzafir-jev-3-40-dollar-erfahrung.md | | [Nate Herk](people/nate-herk.md) | Betreiber von **Nate Herk \| AI Automation** (@nateherk), Fokus Automatisierungsworkflows (AI Automation Society, X @nateherk). **Praktikerebene zu Jev** (19.09.2026, 13.549 Aufrufe, ~16:08, kein Transkript): zwölf Anwendungsfälle, Live-Builds (X-Feed-Classifier, Paper-Trading-Prototyp), Kostenvergleich gegen LLM-Workflow. Seine Kostenwerte **passen zum Preismodell** (siehe `concepts/llm/jev-praxis-demos.md`); Laufzeiten liegen teils am dokumentierten Rate Limit (offene Frage). Empfehlung: **Evals mit Golden Dataset** vor Produktiveinsatz — deckt sich mit Anhaias Label-Kritik und Zafirs „Jev + LLMs". ⚠️ Beschreibung mit werblichen Elementen | youtube/2026-09-19_nate-herk-jev-12-use-cases.md | | [codila](people/codila.md) | @0xCodila (21.096 Follower, verifiziert, Substack); kuratiert/vermarktet AI-Tooling. Quottete Almeidas Coding-Agent-Doc (89.907 Views, **1.038 Bookmarks** > 512 Likes) mit zehn gerankten Jev-Use-Cases (Gesamt 8,9/10; Kontext-Steuerung 10/10, Permission Gate/Security-Routing je 9,5 — Gate-Rollen vorn, Reasoning fehlt). **„Built and tested“ unbelegt; Lead-Magnet („14-page playbook“) | xpost/2026-09-21_codila-jev-usecase-ranking.md | +| [Brivael Le Pogam](people/brivael.md) | @brivael (Paris, 164.358 Follower, verifiziert, Account seit 01.01.2025); **CEO&CTO von Argil AI (YC S24)**, Bio bewirbt eigenes Buch (Gumroad). Französischsprachiger Jev-Demo-Recap (18.09.2026, 32.726 Views; geteilt von Rüdiger mit „Verifiziere.“): erste nicht-englische, namentlich personifizierte Zusammenfassung der Demo-Welle (Voice-Demo, Trading-Bot auf Monad, Ads-Klassifikation, Compaction-Plugin, Confidence-Gate). **Dokumentierte Angaben stimmen** ($42/Btok, 70–500 ms, Stealth, Choice/Score/Boolean, Kalibrierung, Flug 7 s); **Ian-Kosten (13 ¢ vs. 17,6 ¢ bei 4,2 Mio. Token) und Alex-Compaction (1 Mio. Token in 1 s vs. min. ~4 s)** halten der Prüfung nicht stand; Demo-Autoren nicht verlinkt. **Verbreitungssignal, keine Evidenzquelle** | xpost/2026-09-18_brivael-jev-demo-recap.md | | [N8 Programs](people/n8-programs.md) | @N8Programs / GitHub `N8python`; laut Profil Student für angewandte Mathematik/Statistik an Johns Hopkins und In-Context-Learning-Forschung. Veröffentlichte den unabhängigen Jev-vs.-Terra-System-1-Benchmark: neun Multiple-Choice-Bedingungen, Terra `reasoning=none`; Makro nahezu Gleichstand (80,69 % vs. 80,15 %), ECE 1,74 Pp bei N=33.735, Kosten **18,55×** zugunsten Jev. ⚠️ Kein öffentliches Eval-Repo, keine Prompts/Seeds/Logs; HellaSwag-Textclaim widerspricht eigener Tabelle | other/2026-09-17_reddit-n8-jev-terra-benchmark.md | | [Ryan Vogel](people/ryan-vogel.md) | Entwickler/Unternehmer (@ryanvogel, 18.201 Follower): „ceo of @rebasetv / founding developer @opencode @anomalyco", Standort Florida. Gast der Episode „Jev is HERE. How to use it" bei Greg Isenberg (18.09.2026). Relevanz fürs Wiki v. a. über **OpenCode** (Open-Source-Coding-Agent, Partnermodus von DeepSeek V4.1 Flash). ⚠️ Episode-Inhalt nicht ausgewertet; Rebase-TV-Selbstbeschreibung ungeprüft | xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md | @@ -785,6 +786,7 @@ | `raw/youtube/2026-09-19_nate-herk-jev-12-use-cases.md` | youtube | Nate Herk („I Tested Jev on 12 Real Use Cases. My Honest Thoughts.", https://www.youtube.com/watch?v=ymgH8jS6Wb8, 19.09.2026, 13.549 Aufrufe, ~16:08; geteilt von Pit in OME Topic „JEV"; **kein Transkript**, 0 `captionTracks`, yt-dlp Bot-Check). Beschreibung + 10 Kapitelmarken (E-Mail-Benchmark, X-Erweiterung, Evals, Trading). Zahlen über das Bot-Briefing: 1.000 Mails/7 Regeln 6 s/9 Cent (vorher 70 s), 1.000 Mails/1 Regel 4 s/5 Cent, 1.000 Kommentare 5 s/5 Cent, Dashboard 20.000 Requests/85 Cent, LLM-Vergleich 5 min/62 Cent. **Rechnung im Raw:** Kosten konsistent (~2.143/1.190/1.012 Token), Laufzeiten 1,43×/1,19× über dem Token-Limit, 8× über dem Request-Limit. Wiki: `people/nate-herk.md` (neu), `concepts/llm/jev-praxis-demos.md` | | `raw/xpost/2026-09-15_almeida-jev-launch-post.md` | xpost | Diogo Almeida ([@CompleteSkeptic](https://x.com/CompleteSkeptic), 113.333 Follower; Bio „co-created RLHF/ChatGPT @ @openai … (ceo @typesafeai)"): **Jev-Launch-Post** (15.09.2026 18:17 UTC, 34.903.594 Views / 69.647 Likes bei Abruf). Wortlaut: „After co-inventing ChatGPT…"; Zahlen als **Spannen** „20-200x faster / 40-400x cheaper (w/ output tokens free)" — die kursierenden 200×/400× sind die Obergrenzen. Wiki: `people/diogo-almeida.md` (Launch-Post-Abschnitt), `concepts/llm/system-one-models-jev.md` | | `raw/xpost/2026-09-21_codila-jev-usecase-ranking.md` | xpost | codila (@0xCodila, 21.096 Follower): Note-Tweet (21.09.2026 19:15 UTC; 89.907 Views / 512 Likes / **1.038 Bookmarks**; geteilt von Rüdiger/@Stelariz_75 in OME Topic „JEV“) als Quote von Almeidas Coding-Agent-Doc. Zehn Use Cases gerankt 0–10, Gesamt 8,9 (Mittel 8,85 korrekt); Top: dynamischer Kontext 10/10, Permission Gate 9,5, Security-Routing 9,5, Tool-/Modell-Routing je 9. CTA „Copy my complete 14-page Jev engineering playbook“. **„I built and tested the FULL list“ unbelegt — kein Setup, keine Daten, keine Runs; Ableitungen aus dem Primärdoc.** Wiki: people/codila.md (neu), concepts/agents/typesafe-coding-agent-idee.md (Rezeptions-Abschnitt) | +| `raw/xpost/2026-09-18_brivael-jev-demo-recap.md` | xpost | Brivael Le Pogam (@brivael, CEO&CTO Argil AI YC S24, 164.358 Follower): französischsprachiger Jev-Demo-Recap (https://x.com/brivael/status/2100977781936947412, 18.09.2026 15:58 UTC; 32.726 Views / 351 Likes / 380 Bookmarks; geteilt von Rüdiger/@Stelariz_75 in OME Topic „JEV“ 22.09. mit „Verifiziere.“). Volltext aus FxTwitter (nicht abgeschnitten). Enthält zehn zitierte Demos mit Zahlen (Voice-Demo ~300 ms/$0,0002, Trading auf Monad alle 300 ms, 724 Ads/40 s/9 ¢, 1.891 Ads/19 s/12 ¢, 3.282 Posts/4,2 Mio. Token/13 ¢, Flug 7 s/$0,0039, Compaction 1 Mio.→86k in 1 s, 153 Fragen parallel in ~1 s, Confidence-Gate 6/10). **Eigene Rechnung:** $42/Btok, 70–500 ms, Stealth, Choice/Score/Boolean und Kalibrierung stimmen; **13 ¢ vs. 17,6 ¢** und **1 s vs. min. ~4 s** widersprechen Preis/Limits; Demo-Autoren nicht verlinkt. RLHF-Rahmung: Co-Autor der Papiere, nicht Miterfinder des Verfahrens. Wiki: people/brivael.md (neu), concepts/llm/jev-praxis-demos.md | | `raw/youtube/2026-09-18_gary-explains-jev-caveat.md` | youtube | Gary Explains (18.09.2026, geteilt von plebcoach Andreas in OME): „Jev From TypeSafe is a New Class of AI Model that is FAST and CHEAP - But There is a Caveat!" — 17.324 Aufrufe beim Abruf; **kein Transkript** (keine captionTracks), Angaben aus oembed + Videobeschreibung. Beschreibung: „Jev is a new class of AI model from TypeSafe. It is FAST and CHEAP, but there is a caveat, it isn't an LLM. It is a model that understands natural language but it replies with structured responses along with a confidence level." Wiki: `concepts/llm/system-one-models-jev.md` (Rezeptions-Abschnitt). ⚠️ Videoinhalt nicht ausgewertet; Zahlen im Video = Hersteller-vermittelt | | `raw/blog/2026-09-19_cursor-grok-bot-plans-und-trial.md` | blog | Cursor-Doku + x.ai-Announcement (abgerufen 19.09.2026): Grok-Bot-Zugang (jeder bezahlte Cursor-Plan + Teams; Pro/Pro+/Ultra-Wochenquoten; Verknüpfung Einzel-SuperGrok/Plus/Heavy/X Premium+ als Nutzungs-Grant, **nicht stapelbar**, permanent, 24-h-Nachziehfenster; SuperGrok Lite/Team/Enterprise nicht enthalten), Free Trial (Nutzungs-Guthaben + 7-Tage-Fenster, wird nie bezahlter Plan, „Cancel Trial" sofort, iOS-App-Store-Trial ≠ Guthaben-Trial, Android ohne In-App-Trial), On-demand (nur wenn aktiviert; Monatslimit = kein harter Stopp; Teams default an), Preise Hobby gratis · Individual $20/Mo (Pro/Pro+/Ultra) · Teams $40/User/Mo. Wiki: `tools/grok-bot-spacexai.md` | | `raw/youtube/2026-09-19_princeton-griffiths-ai-researchers-wrong.md` | youtube | Dr Brian Keating („Into the Impossible", @DrBrianKeating): „Princeton Cognitive Scientist Says AI Researchers Are Wrong" (https://www.youtube.com/watch?v=6iMiCJHxTww, Video-ID `6iMiCJHxTww`, veröffentlicht **29.04.2026**; Kurzlink `https://tinyurl.com/2b7rnxmh` löst per 302 auf dieses Video auf; 198.871 Aufrufe / 3.337 Likes beim Abruf 19.09.2026). Gast: **Tom Griffiths**, Professor für Psychologie und Informatik in Princeton, Buch „The Laws of Thought" (https://amzn.to/492WO06). **Kein Transkript** — keine `captionTracks` in der Watch-Seite (EN wie DE geprüft), Dauer im Seiten-JSON nicht ausgewiesen; alle Angaben aus oembed + Beschreibung: Kind lernt aus „Brotkrumen" vs. „Kontinente" an Daten, Skalierung schließt die Lücke nicht („it'll just get more expensive"), Sycophancy statt Halluzination, AGI über kindliches Denken; 22 Kapitelmarken 00:00–50:10 (Gedanke/Bewusstsein/ChatGPT/Irrationalität/Chomsky/Boole/Turing/Energie/Jensen Huang/Rosenblatt-Minsky/Backpropagation). Wiki: `concepts/agi/kognition-vs-skalierung.md` (neu), `people/tom-griffiths.md` (neu), `people/brian-keating.md` (neu), `institutions/princeton.md` (neu). ⚠️ Videoinhalt nicht ausgewertet | diff --git a/wiki/log.md b/wiki/log.md index 9c4ca15..7e97532 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -2,6 +2,27 @@ *Append-only changelog. Start: 2026-06-05* +## 2026-09-22 — brivaels Jev-Demo-Recap (18.09.) verifiziert + +**Type:** ingest + wiki-update | **Scope:** raw/xpost, wiki/people, wiki/concepts/llm, wiki/index, wiki/log +**Anlass:** X-Link https://x.com/brivael/status/2100977781936947412 von Rüdiger (@Stelariz_75) in OME Topic „JEV" (22.09.2026 20:14 UTC) mit der Aufforderung „Verifiziere." +**Quellenlage:** Note-Tweet von **Brivael Le Pogam** (@brivael, Paris, CEO&CTO Argil AI YC S24, 164.358 Follower, Account seit 01.01.2025, Bio bewirbt eigenes Buch), 18.09.2026 15:58 UTC; 32.726 Views / 351 Likes / 380 Bookmarks beim Abruf; keine Community Note. **Volltext aus FxTwitter** (der API-Export liefert das vollständige Note; keine Abschneidung). **Die zehn zitierten Demo-Autoren sind im Tweet nicht verlinkt** (Moritz, Jarrod, Matt, Ori, Ian, David Fant, Tamara, Alex, Michael, Scott — kein Handle, keine Post-URLs); die Demo-Zugriffe bleiben deshalb Zweitquellen. +**Verifikation gegen Doku/Preis/Limits (250k tok/s, $0,042/MTok, 1.200 req/min):** +1. ✅ **Dokumentierte Angaben stimmen:** $42/Btok; 70–500 ms; zwei Jahre stealth; Choice/Score/Boolean; „S'il n'est pas sûr, il le dit" (Kalibrierung — inzwischen durch N8s ECE 1,74 pp belegt); Flug in 7 s deckt sich mit dem Isenberg-Briefing (7,1 s). +2. ⚠️ **Ian-Zahl widerspricht dem Preis:** 3.282 Posts / 4,2 Mio. Token / „13 centimes" — bei $0,042/MTok sind 4,2 Mio. Token 17,6 Cent; 13 Cent ergeben bei dokumentiertem Preis nur 3,1 Mio. Token (~26 % Abweichung). Die Isenberg-Version (dieselben 4,2 Mio. Token) nennt 18 Cent — die beiden Recaps sind untereinander inkonsistent. +3. ⚠️ **Alex-Zahl liegt unter der Rate:** Compaction „1 Mio. Token → 86k in einer Sekunde" — das Lesen von 1 Mio. Token braucht bei 250.000 Token/s mindestens ~4 s (Faktor ~4), unabhängig von Parallelität. +4. ⚠️ **Michael-Punkte:** 153 Fragen parallel in ~1 s = ~9.180 Requests/Minute gegen 1.200 dokumentiert → nur mit Bündelung; bei ~400 Token/Frage liegen die ~61.200 Token/s unter dem Token-Limit — gleiche offene Frage wie bei Nate Herk. +5. ✅/⚠️ **Übrige Demo-Zahlen plausibel und limit-konform, aber unverifiziert:** Moritz ~300 ms/$0,0002 pro Entscheidung (≈4.762 Token, ~159k tok/s); Jarrod realer Trading-Bot auf Monad alle 300 ms (200 RPM < Limit); Matt 724 Ads/40 s/9 ¢ (~54k tok/s); Ori 1.891 Ads/19 s/12 ¢ (~150k tok/s); Scott „6 von 10 Items berühren nie das teure Modell" als Illustration. +6. ✅ **Biografie-Rahmung mit Nuance:** „co-inventé le RLHF chez OpenAI" übersteigt Almeidas belegbare Rolle — er ist Co-Autor der RLHF-/InstructGPT-Papiere (arXiv:2009.01325, arXiv:2203.02155), nicht Miterfinder des Verfahrens (Grundlagenpapier 2017); die Wiki-Seite führt das schon korrekt. +**Einordnung:** Der Recap ist **Verbreitungssignal und Demo-Inventar, keine Evidenzquelle** — der Autor ist selbst AI-Unternehmer (Argil AI, Avatare), aber der Post bewirbt kein Konkurrenzprodukt und wirkt kuratiert, nicht gekauft. Er nennt bislang undokumentierte kleine Demos (Ads-Klassifikation, Compaction-Plugin, UI-Assemblierung, Confidence-Gate), ohne die Original-Posts liefern zu können — die Zahlen gelten als nicht verifiziert, bis die Original-Posts auftauchen. +**Dateien:** +- raw (NEW): `raw/xpost/2026-09-18_brivael-jev-demo-recap.md` +- wiki (NEW): `wiki/people/brivael.md` +- wiki (UPDATED): `wiki/concepts/llm/jev-praxis-demos.md` (Abschnitt „Demo-Recap brivael"), `wiki/index.md` (240. Update, People-/Raw-Zeilen) +**⚠️:** Zweitquellen-Recap ohne Links; 13-Cent- und 1-Sekunden-Angabe halten der Prüfung nicht stand; alle Demo-Zahlen unverifiziert; Identifikation der genannten Demos mit den bereits dokumentierten unklar. + +--- + ## 2026-09-22 — Almeidas Coding-Agent-Notizen + Codilas Use-Case-Ranking **Type:** ingest + wiki-update | **Scope:** raw/other, raw/xpost, wiki/concepts/agents, wiki/people, wiki/index, wiki/log diff --git a/wiki/people/brivael.md b/wiki/people/brivael.md new file mode 100644 index 0000000..d124540 --- /dev/null +++ b/wiki/people/brivael.md @@ -0,0 +1,24 @@ +--- +created: 2026-09-22 +updated: 2026-09-22 +sources: [xpost/2026-09-18_brivael-jev-demo-recap.md] +tags: [person, brivael, argil-ai, jev, demo-recap, rezeption] +--- + +# Brivael Le Pogam (@brivael) + +**Brivael Le Pogam** ([@brivael](https://x.com/brivael), Paris, Account seit 01.01.2025, 164.358 Follower, verifiziert) ist **CEO & CTO von [Argil AI](https://www.argil.ai) (YC S24)** — ein KI-Unternehmer, also kein neutraler Beobachter; die Bio bewirbt zugleich ein eigenes Buch („The Shifting Wall", Gumroad). + +## Jev-Demo-Recap (18.09.2026) + +Sein [französischsprachiger Note-Tweet](https://x.com/brivael/status/2100977781936947412) (32.726 Views / 351 Likes / 380 Bookmarks beim Abruf 22.09.; geteilt von Rüdiger mit der Aufforderung „Verifiziere.") ist ein **Recap der Demo-Welle vom 16.–18.09.2026** — die erste nicht-englische, namentlich personifizierte Zusammenfassung der Welle, und bis dahin die erste Quelle, die mehrere der kleinen Demos (Werbungs-Klassifikation, Compaction-Plugin, UI-Assemblierung, Confidence-Gate) überhaupt nennt. + +**Verifikation (Details: [[../concepts/llm/jev-praxis-demos.md]]):** + +- **Dokumentierte Angaben stimmen:** Preis $42/Btok (✅ Doku), 70–500 ms (✅ Doku), „zwei Jahre stealth" (✅ Launch-Post), Choice/Score/Boolean (✅), „S'il n'est pas sûr, il le dit" (Kalibrierung — inzwischen durch N8s ECE 1,74 pp belegt). Der Flug in 7 s deckt sich mit dem Isenberg-Briefing (7,1 s). +- **Eine Zahl widerspricht der Preisrechnung:** Ian mit 3.282 Posts und **4,2 Mio. Token** → laut $0,042/MTok **17,6 Cent**, laut Isenberg-Version (dieselben Token) 18 Cent — brivael schreibt „13 centimes" (~20 % abweichend). +- **Eine Zeitangabe ist unter der dokumentierten Rate:** Alex' Compaction „1 Mio. Token → 86k in **einer Sekunde**" — das Lesen von 1 Mio. Token braucht bei 250.000 Token/s **mindestens ~4 s** (Faktor ~4), egal wie parallel. +- **Michael-Punkte:** 153 Fragen in ~1 s = **~9.180 Requests/Minute** gegen 1.200 dokumentiert → nur mit Bündelung; bei ~400 Token/Frage liegen die ~61.200 Token/s aber unter dem Token-Limit. ⚠️ Request-Limit überschritten, gleiche offene Frage wie bei Nate Herk. +- **Die übrigen Zahlen sind plausibel und limit-konform, aber unverifiziert** — die zitierten Demo-Autoren sind im Tweet nicht verlinkt (Moritz ~300 ms/$0,0002 pro Entscheidung ≈ 4.762 Token; Jarrod realer Trading-Bot auf Monad alle 300 ms = 200 RPM < Limit; Matt 724 Ads/40 s/9 ¢; Ori 1.891 Ads/19 s/12 ¢; Michael 153 Fragen parallel in ~1 s bei ~400 Token/Frage unter 64k; Scott „6 von 10 Items berühren nie das teure Modell" als Illustration). + +⚠️ **Status:** Zweitquellen-Recap ohne Links zu den zugrundeliegenden Posts — für das Wiki ist er **Verbreitungssignal und Demo-Inventar**, keine Evidenzquelle; die neuen Demo-Zahlen gelten als nicht verifiziert (⚠️), bis die Original-Posts auftauchen. Einordnung: Der Autor ist selbst AI-Unternehmer (Argil AI, Avatare), aber der Post bewirbt kein Konkurrenzprodukt — der Recap wirkt kuratiert, nicht gekauft. \ No newline at end of file