ingest(xpost): macbrow - jev computer-use with public code
This commit is contained in:
parent
053e19673c
commit
b399618d59
5 changed files with 107 additions and 3 deletions
44
raw/xpost/2026-09-19_bhosal-pratim-macbrow.md
Normal file
44
raw/xpost/2026-09-19_bhosal-pratim-macbrow.md
Normal file
|
|
@ -0,0 +1,44 @@
|
|||
---
|
||||
type: xpost
|
||||
source_url: https://x.com/BhosalePratim/status/2101281829168792002
|
||||
retrieved: 2026-09-23
|
||||
author: "@BhosalePratim"
|
||||
is_thread: false
|
||||
quote_count: 8
|
||||
tags: [jev, typesafe-ai, macbrow, computer-use, sprachsteuerung, browser-use, gradium, repo, demo]
|
||||
---
|
||||
|
||||
# Pratim Bhosale — „Macbrow": sprachgesteuerter Mac-/Browser-Agent mit Jev (19.09.2026)
|
||||
|
||||
## Metadaten (FxTwitter/GitHub API, Abruf 23.09.2026)
|
||||
|
||||
- **Autor:** Pratim Bhosale (@BhosalePratim), Paris, 42.523 Follower, verifiziert; Bio „Education @GradiumAI | Building @spokira with @sachaarbonel | Prev Eng @ UBS" — **arbeitet bei Gradium**, dem im Stack genannten STT/TTS-Anbieter (Interessenkonflikt bei der Produktbewertung, nicht bei der Jev-Rolle)
|
||||
- **Post:** Note-Tweet, **19.09.2026 12:06 UTC**; **55.975 Views / 414 Likes / 27 Reposts / 39 Replies / 488 Bookmarks**; keine Community Note; Video-Anhang 152,3 s (1748×1080)
|
||||
- **Wortlaut:** „I've always wanted a way to talk to my Mac and do things on the go. Until now, it was super slow. So I built Macbrow. Voice-controlled browser and computer-use agent. Built using @GradiumAI @browser_use and @typesafeai — Still early and a work in progress."
|
||||
- **Repo:** https://github.com/timpratim/macbrow — öffentlich, MIT, **140 Stars / 15 Forks** beim Abruf, created 18.09.2026 22:18 UTC, letzter Push 21.09.2026, Sprache Python
|
||||
|
||||
## README (vollständig gelesen)
|
||||
|
||||
Kopf: „Talk to your Mac. Say a command and it runs as AppleScript; say a web task and it drives your Chrome. **Routing takes about 300 ms because a System One model chooses instead of generating.**"
|
||||
|
||||
- **Warnung:** „Experimental. Not for production." Eine frühe Version sollte „clean up my desktop" ausführen und **verschob alle Dateien des Desktops in einen Ordner** — deshalb existiert die Safety-Policy (`macbrow/policy.py`).
|
||||
- **Pipeline:** `Gradium STT → Jev picks tool + arguments (one request, ~300 ms) → AppleScript → Gradium TTS`; Website-Tasks über `jev-ultrafast` (Browser Use × TypeSafe) mit **einem Jev-Request pro Schritt**; unbekannte Aktionen: LLM schreibt ein neues Tool (Kompilier-, Effekt-, Policy- und Jev-Review-Gates, 3 Repair-Runden); Small Talk: LLM, ein Satz.
|
||||
- **Jev-Aufgaben konkret:** Routing als ein Choice über die Tools offener Apps (+ „chat"/„new action") mit Wahrscheinlichkeit je Option (hoch → ausführen, mittel → nachfragen, niedrig → nicht); **spekulative Arguments** (alle Enum-Argumente aller Kandidaten-Tools als eigene Choices im selben Request, nur die des Gewinners werden gelesen; Freitext-Argumente durch Span-Auswahl statt Generierung); Follow-up-/Vollständigkeits-Urteile als einzelne Noul/Choice.
|
||||
- **Browser-Schritt:** Seite als indizierte Tabelle der Controls; ein Jev-Request wählt Operation (click, type, select, scroll, wait, done) + Ziel-Index. „Nothing is generated except the text to type. Model output never becomes a selector or code; every target is an element the code observed. **No screenshots in the loop.**"
|
||||
- **Eigenmessung („Measured on this machine"):** „add the best vacuum cleaner to my Amazon cart" — 4 Schritte, 11 s; Follow-up „the return date should be November 4th" — 6 Schritte, 3,7 s; „play the Love Hypothesis trailer" — **1,6 s** vom Satzende bis zum Video.
|
||||
- **Policy:** Allowed: Apps, Dateien, URLs, Browser-Tasks, Slack/Messages/Mail, Notes/Reminders/Calendar, Medien. Blocked: Systemeinstellungen, Terminals, Shell außerhalb Allow-list, Datei-Löschen/Verschieben, Trash, Power, Keychain; im Browser: Kauf/Checkout/Payment/Sign-in. State-Änderungen brauchen gesprochene Bestätigung; Policy schützt nicht vor falsch verstandenen Wörtern, `MACBROW_POLICY=off` existiert zum Debuggen.
|
||||
- **Tests:** `uv run pytest -q` — **26 Offline-Tests**; ruff clean; MIT.
|
||||
|
||||
## Demo-Video (lokal ausgewertet: 15 Standbilder à 10 s + Volltext-STT via Grok STT, 152,4 s)
|
||||
|
||||
Kette: Outlander-Trailer auf YouTube („Done." nach ~4,5 s Sprachpause) → „find me bags under 300 euros" → Google Shopping „handbags under 300 euros" (Ergebnisse sichtbar: Polène €269, THEA MINI €264 u. a.) → „Paris to Istanbul, November 10–15" → Google Flights (AJet/Transavia/Turkish, Nonstop 3h45) → „open the desktop folder" → Finder öffnet Desktop → zwei Schließ-Befehle → Love-Hypothesis-Trailer → X-Suche „Jev site:twitter.com" (Suchvorschläge sichtbar; ein Timeline-Post von @thisiskp_ zufällig sichtbar: „running out of patience bookmarking every cool Jev demo on the timeline"). Chrome-Banner: „Chrome is being controlled by automated test software."
|
||||
|
||||
**Bemerkenswerte Sprachmomente (aus Wortzeitstempeln):** Nach dem Outlander-Befehl (Ende ~4,6 s) fällt das „Done." bereits bei 8,5 s — **unter 4 Sekunden bis zur fertigen YouTube-Suche**; die Korrektur „Sorry, the desktop folder, not the downloads folder" wird korrekt aufgelöst (Finder zeigt Desktop); am Ende **versagt** der Agent beim einfachen „close this tab": „Okay, stopping. Goodbye." — dann der Tester: „I asked you to close the tab. Okay, I think there's a lot of work to be done, but this is not bad." Das Demo endet mit einem dokumentierten Misserfolg.
|
||||
|
||||
## Einordnung
|
||||
|
||||
- **Erster Jev-Computer-Use-Build mit öffentlichem Code.** Anders als Andy-Gao (kein Repo, keine Messung) ist Macbrow nachprüfbar: README, Policy, 26 Tests, Architekturbeschreibung. Die Jev-Rolle ist **dokumentiert**, nicht nur mentioned: Routing + spekulative Argumente + Schrittentscheidungen im Browser + Noul/Choice-Urteile.
|
||||
- **Der Text-only-Befund wird konstruktiv aufgelöst:** Jev „sieht" nichts — hier liest `jev-ultrafast` die Seite als indizierte Tabelle der Controls, Jev wählt daraus. Keine Screenshots im Loop. Das ist die sauberste bisher dokumentierte Antwort auf die Text-Only-Grenze.
|
||||
- **Latenzplausibilität:** ~300 ms pro Jev-Request liegt in der dokumentierten 70–500-ms-Spanne; die 1,6-s-Gesamtlatenz (Sprachende → Video) ist mit STT + 1 Jev-Call + YouTube-Suche vereinbar. Keine unvereinbaren Zahlen.
|
||||
- ⚠️ **Interessenkonflikt des Autors** bei Gradium (Education), nicht bei TypeSafe; Eigenmessungen („measured on this machine") ohne Rohdaten.
|
||||
- ⚠️ Der Agent versagt in der Demo am Ende beim Tab-Schließen — vom Tester selbst eingeordnet; gut gegen Überglättung der Welle.
|
||||
|
|
@ -1,7 +1,7 @@
|
|||
---
|
||||
created: 2026-09-18
|
||||
updated: 2026-09-18
|
||||
sources: [xpost/2026-09-18_andy-gao-jev-voice-computer-use.md]
|
||||
updated: 2026-09-23
|
||||
sources: [xpost/2026-09-18_andy-gao-jev-voice-computer-use.md, xpost/2026-09-19_bhosal-pratim-macbrow.md]
|
||||
tags: [concept, agents, jev, computer-use, sprachsteuerung, macos, intent-routing, desktop-agent, demo-kritik]
|
||||
---
|
||||
|
||||
|
|
@ -56,6 +56,18 @@ Der Post behauptet, die App öffne sich „before I even finish my sentence". Di
|
|||
- **Die eigentlichen Hürden liegen hinter dem Video.** Für offene, mehrstufige Desktop-Aufgaben zählen Fehlertoleranz, Rechte (welche App darf was), Zustandsprüfung („ist die Notiz wirklich angelegt?") und Wiederaufsetzen nach Fehlern. Nichts davon ist hier zu sehen — und nichts davon löst ein schnelleres Klassifikationsmodell allein.
|
||||
- **Gegenstück zur Schach-Lehre.** Beim Schach ([[../llm/jev-praxis-demos.md]]) gewann Jev über die Zeit, obwohl es schlechter spielte. Hier ist es umgekehrt: Das Tempo **ist** der Nutzen, weil die Aufgabe (Deutung eines kurzen Befehls) pro Schritt trivial ist. Wo die Aufgabe pro Schritt trivial und die Kette kurz ist, trägt das Modell; wo Schritte mehrdeutig werden, entscheidet wieder der Zustand, nicht die Geschwindigkeit.
|
||||
|
||||
## Gegenstück: Macbrow — derselbe Slot, diesmal mit Code (19.09.2026)
|
||||
|
||||
Drei Tage später baute [[../../people/pratim-bhosale.md|Pratim Bhosale]] mit **Macbrow** ([Repo](https://github.com/timpratim/macbrow), MIT, 140 Stars beim Abruf; Raw: `raw/xpost/2026-09-19_bhosal-pratim-macbrow.md`) denselben Slot — Sprachbefehl → Entscheidung → Aktion — aber **dokumentiert statt behauptet**:
|
||||
|
||||
- **Jev-Rolle spezifiziert statt mentioned:** Routing als ein Choice (~300 ms) über die Tools der offenen Apps, **spekulative Arguments** (alle Enum-Argumente aller Kandidaten-Tools als eigene Choices im selben Request, nur die Gewinner-Antworten werden gelesen), Seite als **indizierte Tabelle der Controls** mit einem Jev-Request pro Schritt (click/type/select/scroll/wait/done), Follow-up-/Vollständigkeits-Urteile als Noul/Choice.
|
||||
- **Die Text-Only-Grenze wird konstruktiv aufgelöst:** „No screenshots in the loop" — der Browser-Task liest die Seite als Element-Tabelle, Jev wählt daraus; Freitext-Argumente entstehen durch **Span-Auswahl** im Diktat statt Generierung. Genau die Antwort auf die oben notierte Übersetzungs-Hürde.
|
||||
- **26 Offline-Tests, Safety-Policy** (Blocked: Systemeinstellungen, Shell, Datei-Delete, Payment/Checkout im Browser; State-Änderungen brauchen gesprochene Bestätigung) — inklusive dokumentiertem Grund: Eine frühe Version sollte „clean up my desktop" ausführen und verschob alle Desktop-Dateien in einen Ordner.
|
||||
- **Demo-Video lokal ausgewertet** (15 Frames + Grok-STT): Outlander-Trailer (~4 s nach Sprachende), Shopping „handbags under 300 euros", Flüge Paris–Istanbul, Finder-Ordner, Korrektur „Sorry, the desktop folder" korrekt aufgelöst, X-Suche „Jev site:twitter.com". **Endpunkt ist ein dokumentierter Misserfolg** („close this tab" scheitert; Tester: „there's a lot of work to be done, but this is not bad") — die Demo glättet nicht.
|
||||
- Eigenmessung („measured on this machine"): Amazon-Warenkorb 4 Schritte/11 s, Follow-up-Datum 6 Schritte/3,7 s, Trailer **1,6 s** von Sprachende bis Video — mit ~300 ms Jev-Call konsistent, keine unvereinbaren Zahlen.
|
||||
|
||||
**Vergleich:** Andy Gao zeigt das *Erlebnis* (App offen vor Satzende), Macbrow die *Architektur* (Code owns the workflow, Jev wählt, LLM schreibt nur Text). Zwei unabhängige Builder, derselbe Slot — jetzt mit Code, Tests und benannter Fehlerrolle.
|
||||
|
||||
## Offene Punkte
|
||||
|
||||
- Offen: wie der Agent Fehler erkennt (Notiz nicht angelegt, App blockiert, Berechtigung fehlt).
|
||||
|
|
|
|||
|
|
@ -2,7 +2,7 @@
|
|||
|
||||
*Auto-generated: 2026-07-07*
|
||||
|
||||
*Letzte Aktualisierung: 2026-09-22 (240. Update — brivaels Jev-Demo-Recap (18.09.) verifiziert. Anlass: X-Link von Rüdiger (@Stelariz_75) in OME Topic „JEV“ mit der Aufforderung „Verifiziere.“. **Quelle:** Note-Tweet von Brivael Le Pogam (@brivael, Paris, CEO&CTO Argil AI YC S24, 164.358 Follower; 18.09.2026 15:58 UTC; 32.726 Views / 351 Likes / 380 Bookmarks beim Abruf) — französischsprachiger Recap der Demo-Welle, **Volltext aus FxTwitter** (raw/xpost/2026-09-18_brivael-jev-demo-recap.md, neu). **Befund 1 — dokumentierte Angaben stimmen:** $42/Btok, 70–500 ms, zwei Jahre Stealth, Choice/Score/Boolean, „S'il n'est pas sûr, il le dit“ (Kalibrierung — inzwischen durch N8s ECE 1,74 pp belegt); Flug in 7 s deckt sich mit dem Isenberg-Briefing (7,1 s); Almeida-RLHF-Rahmung als „Co-Autor der RLHF-/InstructGPT-Papiere“ präzisiert (nicht „RLHF-Miterfinder“ — Grundlagenpapier 2017 stammt von anderen). **Befund 2 — zwei Zahlen halten der Prüfung nicht stand:** (a) Ian: 3.282 Posts / 4,2 Mio. Token / „13 centimes“ — bei $0,042/MTok wären 4,2 Mio. Token **17,6 Cent**; 13 Cent ergeben nur **3,1 Mio. Token** (~26 % Abweichung; Isenberg-Version sagt 18 Cent bei denselben 4,2 Mio. — die Recaps sind untereinander inkonsistent). (b) Alex: Compaction „1 Mio. Token → 86k in einer Sekunde“ — Lesen von 1 Mio. Token braucht bei 250.000 Token/s **mindestens ~4 s** (Faktor ~4), egal wie parallel. (c) Michael: 153 Fragen parallel in ~1 s = **~9.180 Requests/Minute** gegen 1.200 dokumentiert → nur mit Bündelung; bei ~400 Token/Frage liegen die ~61.200 Token/s unter dem Token-Limit — gleiche offene Frage wie bei Nate Herk. **Befund 3 — übrige Demo-Zahlen plausibel und limit-konform, aber unverifiziert:** Die zehn Demo-Autoren (Moritz, Jarrod, Matt, Ori, Ian, David Fant, Tamara, Alex, Michael, Scott) sind im Tweet **nicht verlinkt** — kein Handle, keine Post-URLs; der Recap ist Verbreitungssignal und Demo-Inventar, keine Evidenzquelle. Wiki: people/brivael.md (neu); Update concepts/llm/jev-praxis-demos.md.)*
|
||||
*Letzte Aktualisierung: 2026-09-23 (241. Update — Macbrow: Jev-Computer-Use-Build mit öffentlichem Code. Anlass: X-Link https://x.com/BhosalePratim/status/2101281829168792002 von Pit in OME Topic „JEV“ (23.09.). **Quelle:** Note-Tweet von Pratim Bhosale (@BhosalePratim, Paris, 42.523 Follower; 19.09.2026 12:06 UTC; 55.975 Views / 414 Likes / 488 Bookmarks; Bio: Education @GradiumAI — Interessenkonflikt bei Gradium, nicht bei TypeSafe) + **Repo volltextverifiziert:** https://github.com/timpratim/macbrow (MIT, 140 Stars / 15 Forks beim Abruf, created 18.09.2026) + **Demo-Video lokal ausgewertet** (15 Standbilder à 10 s + Grok-STT-Volltext, 152,4 s). **Wiki-Bedeutung:** der erste Jev-Computer-Use-Build mit öffentlichem Code — gegenüber Andy-Gao (kein Repo, keine Messung) dokumentiert: README, Safety-Policy (existiert wegen eines Desktop-Fehlers: „clean up my desktop“ verschob alle Dateien), **26 Offline-Tests**. **Jev-Rolle spezifiziert:** Routing als ein Choice (~300 ms, in der dokumentierten Spanne), **spekulative Arguments** (alle Enum-Argumente aller Kandidaten-Tools als eigene Choices im selben Request), Browser-Seite als **indizierte Tabelle der Controls** mit einem Jev-Request pro Schritt (click/type/select/scroll/wait/done), Follow-up-/Vollständigkeits-Urteile als Noul/Choice; LLM (GPT-5-mini oder lokal) schreibt nur Text. **Text-Only-Grenze konstruktiv aufgelöst:** „No screenshots in the loop“ — jev-ultrafast liest die Seite als Element-Tabelle; Freitext-Argumente durch Span-Auswahl im Diktat. **Eigenmessung:** Amazon-Warenkorb 4 Schritte/11 s; Follow-up 6 Schritte/3,7 s; Trailer „Love Hypothesis“ **1,6 s** von Sprachende bis Video — mit ~300-ms-Call konsistent, keine unvereinbaren Zahlen. **Demo:** Trailer → Shopping → Flüge Paris–Istanbul → Finder (Korrektur „Sorry, the desktop folder“ korrekt aufgelöst) → X-Suche; **Endpunkt = dokumentierter Misserfolg** („close this tab“ scheitert; Tester: „a lot of work to be done, but this is not bad“). Wiki: people/pratim-bhosale.md (neu); Update concepts/agents/jev-sprachsteuerung-computer-use.md (Abschnitt „Gegenstück: Macbrow“). Raw: raw/xpost/2026-09-19_bhosal-pratim-macbrow.md (neu).)*
|
||||
*Vorherige Aktualisierung: 2026-09-22 (239. Update — MacStories-Review „M5 Ultra Mac Studio Review: The Dream Mac for Local AI Agents" (Federico Viticci, 21.09.2026; geteilt von Kai @PWeber in OME Topic „Openclaw mit lokalen Modellen", #1744). **Erste unabhängige Verifikation der M5-Ultra-Versprechen** — schließt die Lücke „⚠️ nur Herstellerangaben" auf der Apple-Seite. Raw: `raw/blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md` (neu; web_fetch vollständig, 21.401 Zeichen). Wiki: `people/federico-viticci.md` (neu), `institutions/macstories.md` (neu), Updates in `concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md` (neuer Messwert-Abschnitt: 256-GB-Gerät gegen M3 Ultra 512 GB und RTX 5090 — Generierung ~+70 %, Prefill ~+150 % (≈2,5×), Flash-Next >100 tok/s bei kurzem Prompt und 60–85 tok/s bei 64K–256K Kontext; Prefill bei 6.000-Token-Prompt ~1.700 tok/s vs. 5090 ~3.000 tok/s; Generierung 5090 konstant ~25 % voraus (1,79 vs. 1,2 TB/s), verliert aber oberhalb 32 GB VRAM), `concepts/llm/qwen3.8-flash-next-qwen4-preview.md` (erster dokumentierter Praxiseinsatz: Flash-Next als lokales Default-Modell in Open Minis und Hermes Agent, 5-Bit vollständig im RAM, bis zu 3 parallele Sessions mit Subagenten via oMLX), `concepts/hardware/cloud-exit-and-local-superiority.md` (Cross-Ref). **Produktivnachweis:** 99 Tage Dauerbetrieb mit DeepSeek-V4-Flash-Agenten + olmOCR über 310 Dokumente fürs iOS-/iPadOS-27-Review — Gesamtkosten 0 $, weil dieselbe Dauerlast per Cloud-API als untragbar eingeschätzt wurde. ⚠️ Einzelsetup (n=1), keine reproduzierte Benchmark-Suite.)*
|
||||
*Vorherige Aktualisierung: 2026-09-22 (238. Update — Unabhängiger Jev-vs.-GPT-5.6-Terra-Benchmark von N8 Programs, geteilt als r/ProAI-Repost. **Quelle vollständig aufgelöst:** Reddit-RSS (17.09., normale Seite/JSON blockiert) → [X-Thread](https://x.com/N8Programs/status/2100088523403432357) (16.09.; 179.846 Views beim Abruf) → vier Originalgrafiken lokal gelesen. **Methode:** neun Multiple-Choice-Bedingungen; Terra `reasoning=none`, Letter-only. **Resultate:** Jev gewinnt MMLU 90,91:87,89, GPQA 68,18:56,06, ARC-Easy/Challenge knapp und WinoGrande 91,63:78,69; Terra gewinnt HellaSwag 95,32:94,86, GSM8K deutlich (87,72:79,68 bzw. 69,83:54,59) und Schach knapp 50,25:49,45. Ungewichteter Makromittelwert **Jev 80,69 % · Terra 80,15 %** → „Terra-tier“ trägt eng für diesen Test, nicht als allgemeine Intelligenzbehauptung. **Korrektur des Threadtexts:** Er behauptet einen Jev-Sieg auf HellaSwag; die eigene Tabelle zeigt Terra +0,46 Pp. **Kalibrierung:** N=33.735, ECE **1,74 Pp**, 10 Bins, Wilson-95-%-Intervalle, Einzelbenches 0,26–6,96 Pp — stärkste öffentliche Fremdevidenz für RLCD bisher. **Kosten:** Jev $0,6999 (estimated: Input-Token × $0,042/MTok) vs. Terra $12,9865 (API-reported) = **18,55×**; die ~18×-Rundung hält, die Hersteller-Obergrenze 400–444,6× nicht. **Nicht geprüft:** Geschwindigkeit; kein Repo, keine Prompts/Seeds/Logs, keine Reproduktion, Kontaminationsrisiko öffentlicher Benches. Wiki: `people/n8-programs.md` (neu), `concepts/llm/system-one-models-jev.md` (neuer unabhängiger Benchmark-Abschnitt). Raw: `raw/other/2026-09-17_reddit-n8-jev-terra-benchmark.md` (neu).)*
|
||||
*Vorherige Aktualisierung: 2026-09-22 (237. Update — Grok 4.7 + Grok-Bot-Praxis + ART19-Podcast. **Primärquellen:** [xAI Release](https://x.ai/news/grok-4-7), [API-Modellkarte](https://docs.x.ai/developers/models/grok-4.7), [Cursor-Modellseite](https://cursor.com/docs/models/grok-4-7). Grok 4.7: größerer Basismodell-Kern, längeres RL auf schwierigen mehrstündigen Aufgaben, stärkere Selbstprüfung, natives Grok-Bot-Harness-Verständnis; Modell-ID `grok-4.7`, 500k API-Kontext, Reasoning `low|medium|high|xhigh`; API <200k Prompt $2/M Input · $0,50/M Cached · $6/M Output, ab 200k $4/$1/$12. Herstellerbenchmarks u. a. CursorBench 46,3 %, DeepSWE 71,0 %, Terminal-Bench 38,0 % — **nicht unabhängig reproduziert**. @cb_doge-Post primär gegengeprüft; „twice as fast and half the price“ bleibt dessen Verdichtung. Alex Finns Video (14:06, geteilt von Pit): kein Transcript abrufbar; Workflow nur attribuiert aus YouTube-AI-Zusammenfassung + Herman-Auswertung (PM/Developer/Designer, Exec-Team, Linear/Notion-Issues, Cursor Cloud Agents). Zusätzlich Netbits’ ART19-MP3 als Voll-Ingest: „Grok AI Daily“, 21.09., 29:30, lokales Maschinen-ASR; allgemeiner Newsrecap zu Meta Muse, Cyber-/Safety-Claims, US–China, Trump und Newsom — **kein Grok 4.7**, Grok Bot nur beiläufig. Wiki: `institutions/grok-ai-daily.md` (neu); Updates `institutions/xai.md`, `tools/grok-bot-spacexai.md`, `concepts/llm/llm-model-catalog.md`, `concepts/policy/ai-regulation-2026.md`. Raw: 4 neue Einträge in blog/xpost/youtube/podcast.)*
|
||||
|
|
@ -249,6 +249,7 @@
|
|||
| [Jev über den Vercel AI Gateway](concepts/llm/jev-vercel-ai-gateway.md) | **Verteilung statt Waitlist:** Jev läuft seit **16.09.2026** im [Vercel AI Gateway](institutions/vercel.md) unter `typesafe-ai/jev` — AI SDK 7.0.105+, `experimental evaluate`, Frage-Typen **Choice/Score/Boolean**, ein `state` + Map benannter `questions`, Confidence unter `providerMetadata.typesafe.confidence`, **Zero Data Retention / No Training** per Request, Abrechnung gegen Gateway-Budgets. Gateway-Preis **$0.04/1M Input** (gerundet; TypeSafe: $0,042). Anlass: Startup-Ideen-Post von [Greg Isenberg](people/greg-isenberg.md) mit sieben Geschäftsideen („find an expensive queue and put Jev at the front of it"). ⚠️ „1.700 E-Mails für 18 Cent" ohne Token-Aufschlüsselung/Datensatz, „94 %" nur Illustration, Leistungszahlen von Vercel als TypeSafe-Angabe weitergegeben | xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md + blog/2026-09-16_vercel-jev-ai-gateway.md |
|
||||
| [Jev in der Praxis — Demo-Urteile](concepts/llm/jev-praxis-demos.md) | **Die Bauprojekt-Welle (16.–18.09.2026)** als Ersatz-Evidenz, solange keine unabhängigen Benchmarks existieren: Wikipedia-Races und Doom ([Matthew Berman](people/matthew-berman.md)), Kleinstadt-Simulation, Skittles-Sortierung, **[Schach-Blitz gegen Frontier-LLMs](https://x.com/aimlapi/status/2100372930282573876)** ([AI/ML API](institutions/ai-ml-api.md): Jev materiell unterlegen, **gewinnt auf Zeit** gegen Fable 5.1 — ~2,6 s vs. 6–15 s pro Zug; Matt in 18 Zügen gegen GPT-6 Astra), „Unclutter"-Ad-Blocker ([kitze](people/kitze.md)), Jev-Modellrouter ([Riley Brown](people/riley-brown.md)). Kernbefund: Der **Schleifen-Slot ohne Sprachmodell** ist real, Geschwindigkeit schlägt Qualität pro Zug — aber nur wo Zeit die Metrik ist. ⚠️ Alle Demos selbstveröffentlicht, kein Aufbau veröffentlicht; viralster Post („rebuilt Tesla FSD", [Justin Schroeder](people/justin-schroeder.md), 568.108 Views) ist der inhaltsleerste | youtube/2026-09-18_berman-jev.md + xpost/2026-09-15_almeida-jev-launch-post.md |
|
||||
| [Sprachsteuerung als Computer-Use — Jev als Desktop-Agent](concepts/agents/jev-sprachsteuerung-computer-use.md) | **Demo 18.09.2026, lokal ausgewertet** ([Andy Gao](people/andy-gao.md), 563 Follower, aber 139.442 Views): Sprechbefehl → Desktop-Aktion (Notes → Notiz → Arc → Google „Norbert Wiener" → x.com → Photo Booth). **Am Material bestätigt:** Zielzustände sichtbar, während das Live-Transkript-Overlay noch unvollständig ist — die belastbarste Einzelaussage der Demo-Welle. Einordnung: Sprache→Absicht ist Klassifikation (Jev-Slot), Absicht→Desktop ist klassische Automatisierung und **der eigentliche Fehlerort**; ein lokales STT mit Schlüsselwort-Matching würde dieselben Bilder erzeugen. ⚠️ Keine Messung, kein Code, nur trivial skriptbare Apps | xpost/2026-09-18_andy-gao-jev-voice-computer-use.md |
|
||||
| [Macbrow — sprachgesteuerter Mac-/Browser-Agent mit Jev](concepts/agents/jev-sprachsteuerung-computer-use.md) | **Erster Jev-Computer-Use-Build mit öffentlichem Code** ([Pratim Bhosale](people/pratim-bhosale.md), 19.09.2026; Gradium STT/TTS + LiveKit + Jev + jev-ultrafast; MIT, 140 Stars). Jev-Rolle dokumentiert: Routing als Choice (~300 ms), **spekulative Arguments**, Browser-Seite als indizierte Tabelle mit 1 Jev-Request pro Schritt, Urteile als Noul/Choice, **keine Screenshots im Loop** — Text-Only-Grenze konstruktiv aufgelöst. 26 Tests + Safety-Policy (mit dokumentiertem Fehler-Ursprung). Demo (lokal ausgewertet): Trailer ~4 s, Flüge, Finder, Korrektur korrekt aufgelöst; **Endpunkt = dokumentierter Misserfolg**. Eigenmessung 1,6 s Sprachende→Video, konsistent mit Doku-Limits | xpost/2026-09-19_bhosal-pratim-macbrow.md |
|
||||
| [TypeSafe-Coding-Agent-Idee (Almeida, 21.09.)](concepts/agents/typesafe-coding-agent-idee.md) | **Primärdokument des Jev-Schöpfers**, volltextverifiziert: Leitfrage „Coding-Agent ohne KV-Cache designt“; sechs Cache-Verzerrungen (u. a. Routing unrentabel ohne Cache-Wirtschaft, globale Compaction als Fehlannahme) und Jev-nativen Ideen — **Meta-Attention** (Noul pro Kontext-Chunk), Permission Gate, cost-aware Modell-Routing, Conditional AGENTS.md (geladene Skills fallen Compaction zum Opfer), Security-aware Routing, read-only Background-Tasks/Cross-Model Review. **OpenClaw als Einfachkeits-Extrem** im Batterie-Trade-off benannt. Rezeption: @0xCodila rangiert zehn abgeleitete Use Cases (Gesamt 8,9/10; Kontext 10/10, Permission Gate 9,5). **Ideen-Katalog, keine Zusagen; „built and tested“ im Quote-Post unbelegt | other/2026-09-21_almeida-typesafe-coding-agent-notes.md + xpost/2026-09-21_codila-jev-usecase-ranking.md |
|
||||
| [DeepSeek V4-Pro GA + Harness v0.1 (Open Source)](concepts/llm/deepseek-v4-pro-ga-harness-open-source.md) | DeepSeek launcht 13.08.2026 Open Source: V4-Pro GA (App/Web/API, Reasoning-Effort low/high/max, OpenAI-Responses-API + Codex, Peak/Off-Peak-Pricing) + DeepSeek Harness v0.1 (MIT, Open-Source-Agent-Harness, Rivale zu Claude Code). Dritter Baustein der chinesischen Welle in 24h. **Update 21.08.:** Deep-Dive-Video zum Harness (Stephen G. Pope) + Turing-Post-TV-Video "The End Of Coding Agents". **Update 02.09.:** WorldofAI-Video "Claude Code & Codex Killer?" (3. Blickwinkel, erweitert um OpenAI/Codex) + Herman-DSH-Details (Everything-is-a-Plugin/Cordis, Trajectory-View, Web-UI-Remote, ~122k Stars; ⚠️ Second-hand) | other/2026-08-14_deepseek-v4-pro-ga-harness-open-source.md + youtube/2026-08-13_deepseek-v4-pro-0813-aicodeking.md + youtube/2026-08-21_deepseek-agent-harness-explained.md + youtube/2026-08-21_deepseek-harness-end-of-coding-agents.md + youtube/2026-09-02_worldofai-deepseek-harness-claude-code-codex-killer.md + other/2026-09-02_herman-deepseek-harness-dsh-summary.md |
|
||||
| [DeepSeek-V4.1-Flash](concepts/llm/deepseek-v4.1-flash.md) | Kleinstes Modell einer neuen DeepSeek-Architektur-Familie (552B-MoE, Causal-Encoder–Decoder, nativ multimodal; offizielle Benchmark-Tabelle). **Update 10.09.:** auf Nous Portal verfügbar (`/model deepseek/deepseek-v4.1-flash`; Listung $0,24/$0,96 per 1M) — Route `nous/deepseek/deepseek-v4.1-flash` in unserem Setup konfiguriert. **Update 17.09.:** Lokale-Inferenz-Sektion ergänzt — Hardware-Stufen, Q2/Q4, Payback (siehe `concepts/hardware/deepseek-v41-flash-lokale-hardware.md`) | xpost/2026-09-10_deepseek-v41-flash-official-release.md + other/2026-09-10_deepseek-v41-flash-official-announcement.md + other/2026-09-10_deepseek-api-updates-changelog.md + youtube/2026-09-10_deepseek-v41-flash-aicodeking.md + xpost/2026-09-10_hermeswatcher-deepseek-v41-flash-nous-portal.md + youtube/2026-09-16_marfil-draws-deepseek-v41-flash-any-hardware.md |
|
||||
|
|
@ -468,6 +469,7 @@
|
|||
| [Nate Herk](people/nate-herk.md) | Betreiber von **Nate Herk \| AI Automation** (@nateherk), Fokus Automatisierungsworkflows (AI Automation Society, X @nateherk). **Praktikerebene zu Jev** (19.09.2026, 13.549 Aufrufe, ~16:08, kein Transkript): zwölf Anwendungsfälle, Live-Builds (X-Feed-Classifier, Paper-Trading-Prototyp), Kostenvergleich gegen LLM-Workflow. Seine Kostenwerte **passen zum Preismodell** (siehe `concepts/llm/jev-praxis-demos.md`); Laufzeiten liegen teils am dokumentierten Rate Limit (offene Frage). Empfehlung: **Evals mit Golden Dataset** vor Produktiveinsatz — deckt sich mit Anhaias Label-Kritik und Zafirs „Jev + LLMs". ⚠️ Beschreibung mit werblichen Elementen | youtube/2026-09-19_nate-herk-jev-12-use-cases.md |
|
||||
| [codila](people/codila.md) | @0xCodila (21.096 Follower, verifiziert, Substack); kuratiert/vermarktet AI-Tooling. Quottete Almeidas Coding-Agent-Doc (89.907 Views, **1.038 Bookmarks** > 512 Likes) mit zehn gerankten Jev-Use-Cases (Gesamt 8,9/10; Kontext-Steuerung 10/10, Permission Gate/Security-Routing je 9,5 — Gate-Rollen vorn, Reasoning fehlt). **Cover lokal gelesen:** Forschungs-Paper-Optik („Jev Engineering Research · September 2026“, Footer @0xCodila), neun Module + zehn Systeme 1:1 aus dem Creator-Doc; Abstract „empirical lessons from early implementations“ ohne Beleg — Cover ≠ lauffähiger Inhalt. **„Built and tested“ unbelegt; Lead-Magnet („14-page playbook“) | xpost/2026-09-21_codila-jev-usecase-ranking.md |
|
||||
| [Brivael Le Pogam](people/brivael.md) | @brivael (Paris, 164.358 Follower, verifiziert, Account seit 01.01.2025); **CEO&CTO von Argil AI (YC S24)**, Bio bewirbt eigenes Buch (Gumroad). Französischsprachiger Jev-Demo-Recap (18.09.2026, 32.726 Views; geteilt von Rüdiger mit „Verifiziere.“): erste nicht-englische, namentlich personifizierte Zusammenfassung der Demo-Welle (Voice-Demo, Trading-Bot auf Monad, Ads-Klassifikation, Compaction-Plugin, Confidence-Gate). **Dokumentierte Angaben stimmen** ($42/Btok, 70–500 ms, Stealth, Choice/Score/Boolean, Kalibrierung, Flug 7 s); **Ian-Kosten (13 ¢ vs. 17,6 ¢ bei 4,2 Mio. Token) und Alex-Compaction (1 Mio. Token in 1 s vs. min. ~4 s)** halten der Prüfung nicht stand; Demo-Autoren nicht verlinkt. **Verbreitungssignal, keine Evidenzquelle** | xpost/2026-09-18_brivael-jev-demo-recap.md |
|
||||
| [Pratim Bhosale](people/pratim-bhosale.md) | @BhosalePratim (Paris, 42.523 Follower, verifiziert); **Education bei Gradium** (STT/TTS-Anbieter — Interessenkonflikt dort, nicht bei TypeSafe), baut Spokira, prev. UBS. Baute **Macbrow** (19.09.2026, 55.975 Views): sprachgesteuerter Mac-/Browser-Agent mit Jev als Decision-Layer — **erster Jev-Computer-Use-Build mit öffentlichem Code** (Repo MIT, 140 Stars, 26 Offline-Tests, Safety-Policy). Jev-Rolle: Routing-Choice ~300 ms + spekulative Arguments + Element-Tabellen-Browser mit 1 Request/Schritt, keine Screenshots im Loop. Demo-Endpunkt = dokumentierter Misserfolg | xpost/2026-09-19_bhosal-pratim-macbrow.md |
|
||||
| [N8 Programs](people/n8-programs.md) | @N8Programs / GitHub `N8python`; laut Profil Student für angewandte Mathematik/Statistik an Johns Hopkins und In-Context-Learning-Forschung. Veröffentlichte den unabhängigen Jev-vs.-Terra-System-1-Benchmark: neun Multiple-Choice-Bedingungen, Terra `reasoning=none`; Makro nahezu Gleichstand (80,69 % vs. 80,15 %), ECE 1,74 Pp bei N=33.735, Kosten **18,55×** zugunsten Jev. ⚠️ Kein öffentliches Eval-Repo, keine Prompts/Seeds/Logs; HellaSwag-Textclaim widerspricht eigener Tabelle | other/2026-09-17_reddit-n8-jev-terra-benchmark.md |
|
||||
| [Ryan Vogel](people/ryan-vogel.md) | Entwickler/Unternehmer (@ryanvogel, 18.201 Follower): „ceo of @rebasetv / founding developer @opencode @anomalyco", Standort Florida. Gast der Episode „Jev is HERE. How to use it" bei Greg Isenberg (18.09.2026). Relevanz fürs Wiki v. a. über **OpenCode** (Open-Source-Coding-Agent, Partnermodus von DeepSeek V4.1 Flash). ⚠️ Episode-Inhalt nicht ausgewertet; Rebase-TV-Selbstbeschreibung ungeprüft | xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md |
|
||||
|
||||
|
|
@ -787,6 +789,7 @@
|
|||
| `raw/xpost/2026-09-15_almeida-jev-launch-post.md` | xpost | Diogo Almeida ([@CompleteSkeptic](https://x.com/CompleteSkeptic), 113.333 Follower; Bio „co-created RLHF/ChatGPT @ @openai … (ceo @typesafeai)"): **Jev-Launch-Post** (15.09.2026 18:17 UTC, 34.903.594 Views / 69.647 Likes bei Abruf). Wortlaut: „After co-inventing ChatGPT…"; Zahlen als **Spannen** „20-200x faster / 40-400x cheaper (w/ output tokens free)" — die kursierenden 200×/400× sind die Obergrenzen. Wiki: `people/diogo-almeida.md` (Launch-Post-Abschnitt), `concepts/llm/system-one-models-jev.md` |
|
||||
| `raw/xpost/2026-09-21_codila-jev-usecase-ranking.md` | xpost | codila (@0xCodila, 21.096 Follower): Note-Tweet (21.09.2026 19:15 UTC; 89.907 Views / 512 Likes / **1.038 Bookmarks**; geteilt von Rüdiger/@Stelariz_75 in OME Topic „JEV“) als Quote von Almeidas Coding-Agent-Doc. Zehn Use Cases gerankt 0–10, Gesamt 8,9 (Mittel 8,85 korrekt); Top: dynamischer Kontext 10/10, Permission Gate 9,5, Security-Routing 9,5, Tool-/Modell-Routing je 9. CTA „Copy my complete 14-page Jev engineering playbook“. **„I built and tested the FULL list“ unbelegt — kein Setup, keine Daten, keine Runs; Ableitungen aus dem Primärdoc.** Wiki: people/codila.md (neu), concepts/agents/typesafe-coding-agent-idee.md (Rezeptions-Abschnitt) |
|
||||
| `raw/xpost/2026-09-18_brivael-jev-demo-recap.md` | xpost | Brivael Le Pogam (@brivael, CEO&CTO Argil AI YC S24, 164.358 Follower): französischsprachiger Jev-Demo-Recap (https://x.com/brivael/status/2100977781936947412, 18.09.2026 15:58 UTC; 32.726 Views / 351 Likes / 380 Bookmarks; geteilt von Rüdiger/@Stelariz_75 in OME Topic „JEV“ 22.09. mit „Verifiziere.“). Volltext aus FxTwitter (nicht abgeschnitten). Enthält zehn zitierte Demos mit Zahlen (Voice-Demo ~300 ms/$0,0002, Trading auf Monad alle 300 ms, 724 Ads/40 s/9 ¢, 1.891 Ads/19 s/12 ¢, 3.282 Posts/4,2 Mio. Token/13 ¢, Flug 7 s/$0,0039, Compaction 1 Mio.→86k in 1 s, 153 Fragen parallel in ~1 s, Confidence-Gate 6/10). **Eigene Rechnung:** $42/Btok, 70–500 ms, Stealth, Choice/Score/Boolean und Kalibrierung stimmen; **13 ¢ vs. 17,6 ¢** und **1 s vs. min. ~4 s** widersprechen Preis/Limits; Demo-Autoren nicht verlinkt. RLHF-Rahmung: Co-Autor der Papiere, nicht Miterfinder des Verfahrens. Wiki: people/brivael.md (neu), concepts/llm/jev-praxis-demos.md |
|
||||
| `raw/xpost/2026-09-19_bhosal-pratim-macbrow.md` | xpost | Pratim Bhosale (@BhosalePratim, 42.523 Follower): „Macbrow“ (https://x.com/BhosalePratim/status/2101281829168792002, 19.09.2026 12:06 UTC; 55.975 Views / 414 Likes / 488 Bookmarks; geteilt von Pit in OME Topic „JEV“ 23.09.) — sprachgesteuerter Mac-/Browser-Agent, Stack Gradium + LiveKit + **Jev** + jev-ultrafast. **Repo volltextverifiziert** (https://github.com/timpratim/macbrow, MIT, 140 Stars/15 Forks; README: Routing-Choice ~300 ms, spekulative Arguments, Element-Tabelle statt Screenshots, Safety-Policy nach Desktop-Fehler, 26 Tests). **Demo-Video lokal ausgewertet** (15 Frames à 10 s + Grok-STT-Volltext): 8 Befehle, 7 erfolgreich, 1 Misserfolg am Ende (Tab schließen); Eigenmessung 1,6 s Sprachende→Video. ⚠️ Interessenkonflikt bei Gradium; Eigenmessungen ohne Rohdaten. Wiki: people/pratim-bhosale.md (neu), concepts/agents/jev-sprachsteuerung-computer-use.md |
|
||||
| `raw/youtube/2026-09-18_gary-explains-jev-caveat.md` | youtube | Gary Explains (18.09.2026, geteilt von plebcoach Andreas in OME): „Jev From TypeSafe is a New Class of AI Model that is FAST and CHEAP - But There is a Caveat!" — 17.324 Aufrufe beim Abruf; **kein Transkript** (keine captionTracks), Angaben aus oembed + Videobeschreibung. Beschreibung: „Jev is a new class of AI model from TypeSafe. It is FAST and CHEAP, but there is a caveat, it isn't an LLM. It is a model that understands natural language but it replies with structured responses along with a confidence level." Wiki: `concepts/llm/system-one-models-jev.md` (Rezeptions-Abschnitt). ⚠️ Videoinhalt nicht ausgewertet; Zahlen im Video = Hersteller-vermittelt |
|
||||
| `raw/blog/2026-09-19_cursor-grok-bot-plans-und-trial.md` | blog | Cursor-Doku + x.ai-Announcement (abgerufen 19.09.2026): Grok-Bot-Zugang (jeder bezahlte Cursor-Plan + Teams; Pro/Pro+/Ultra-Wochenquoten; Verknüpfung Einzel-SuperGrok/Plus/Heavy/X Premium+ als Nutzungs-Grant, **nicht stapelbar**, permanent, 24-h-Nachziehfenster; SuperGrok Lite/Team/Enterprise nicht enthalten), Free Trial (Nutzungs-Guthaben + 7-Tage-Fenster, wird nie bezahlter Plan, „Cancel Trial" sofort, iOS-App-Store-Trial ≠ Guthaben-Trial, Android ohne In-App-Trial), On-demand (nur wenn aktiviert; Monatslimit = kein harter Stopp; Teams default an), Preise Hobby gratis · Individual $20/Mo (Pro/Pro+/Ultra) · Teams $40/User/Mo. Wiki: `tools/grok-bot-spacexai.md` |
|
||||
| `raw/youtube/2026-09-19_princeton-griffiths-ai-researchers-wrong.md` | youtube | Dr Brian Keating („Into the Impossible", @DrBrianKeating): „Princeton Cognitive Scientist Says AI Researchers Are Wrong" (https://www.youtube.com/watch?v=6iMiCJHxTww, Video-ID `6iMiCJHxTww`, veröffentlicht **29.04.2026**; Kurzlink `https://tinyurl.com/2b7rnxmh` löst per 302 auf dieses Video auf; 198.871 Aufrufe / 3.337 Likes beim Abruf 19.09.2026). Gast: **Tom Griffiths**, Professor für Psychologie und Informatik in Princeton, Buch „The Laws of Thought" (https://amzn.to/492WO06). **Kein Transkript** — keine `captionTracks` in der Watch-Seite (EN wie DE geprüft), Dauer im Seiten-JSON nicht ausgewiesen; alle Angaben aus oembed + Beschreibung: Kind lernt aus „Brotkrumen" vs. „Kontinente" an Daten, Skalierung schließt die Lücke nicht („it'll just get more expensive"), Sycophancy statt Halluzination, AGI über kindliches Denken; 22 Kapitelmarken 00:00–50:10 (Gedanke/Bewusstsein/ChatGPT/Irrationalität/Chomsky/Boole/Turing/Energie/Jensen Huang/Rosenblatt-Minsky/Backpropagation). Wiki: `concepts/agi/kognition-vs-skalierung.md` (neu), `people/tom-griffiths.md` (neu), `people/brian-keating.md` (neu), `institutions/princeton.md` (neu). ⚠️ Videoinhalt nicht ausgewertet |
|
||||
|
|
|
|||
20
wiki/log.md
20
wiki/log.md
|
|
@ -2,6 +2,26 @@
|
|||
|
||||
*Append-only changelog. Start: 2026-06-05*
|
||||
|
||||
## 2026-09-23 — Macbrow: Jev-Computer-Use-Build mit öffentlichem Code (Pratim Bhosale)
|
||||
|
||||
**Type:** ingest + wiki-update | **Scope:** raw/xpost, wiki/people, wiki/concepts/agents, wiki/index, wiki/log
|
||||
**Anlass:** X-Link https://x.com/BhosalePratim/status/2101281829168792002 von Pit Weber in OME Topic „JEV" (23.09.2026 06:45 UTC).
|
||||
**Quellenlage:** Note-Tweet von **Pratim Bhosale** (@BhosalePratim, Paris, 42.523 Follower, verifiziert), 19.09.2026 12:06 UTC; 55.975 Views / 414 Likes / 488 Bookmarks / 39 Replies beim Abruf; keine Community Note. Bio: „Education @GradiumAI | Building @spokira" — **Interessenkonflikt bei Gradium** (STT/TTS im Stack), nicht bei TypeSafe. **Repo volltextverifiziert:** github.com/timpratim/macbrow (MIT, Python, 140 Stars / 15 Forks, created 18.09.2026 22:18 UTC, letzter Push 21.09.). README vollständig gelesen.
|
||||
**Was Macbrow dokumentiert (erstmalig in der Akte: Computer-Use mit Code):**
|
||||
1. **Jev-Rolle spezifiziert statt nur mentioned:** Routing als ein Choice über die Tools der offenen Apps (+ chat/new action), ~300 ms, Wahrscheinlichkeit je Option (hoch → run, middling → ask, low → don't); **spekulative Arguments** — alle Enum-Argumente aller Kandidaten-Tools als eigene Choices im selben Request, nur die Gewinner-Antworten werden gelesen; Freitext-Argumente durch Span-Auswahl im Diktat statt Generierung; Follow-up-/Vollständigkeits-Urteile als einzelne Noul/Choice.
|
||||
2. **Text-Only-Grenze konstruktiv aufgelöst:** Browser über `jev-ultrafast` (Browser Use × TypeSafe): Seite als indizierte Tabelle der Controls, ein Jev-Request pro Schritt (click/type/select/scroll/wait/done + Ziel-Index); „Nothing is generated except the text to type. Model output never becomes a selector or code. **No screenshots in the loop**" — Jev „sieht" nichts, braucht es auch nicht.
|
||||
3. **Safety mit dokumentiertem Ursprung:** Eine frühe Version sollte „clean up my desktop" ausführen und verschob alle Desktop-Dateien in einen Ordner — deshalb Policy (`macbrow/policy.py`): Blocked = Systemeinstellungen, Terminals, Shell außerhalb Allow-list, Datei-Delete, Trash, Keychain; im Browser Kauf/Checkout/Payment/Sign-in. State-Änderungen brauchen gesprochene Bestätigung; Policy schützt nicht vor falsch verstandenen gültigen Befehlen.
|
||||
4. **Eigenmessung („measured on this machine"):** Amazon-Warenkorb 4 Schritte/11 s; Follow-up „return date November 4th" 6 Schritte/3,7 s; „play the Love Hypothesis trailer" **1,6 s** von Sprachende bis Video. ⚠️ Ohne Rohdaten, aber mit ~300-ms-Jev-Call konsistent; keine unvereinbaren Zahlen.
|
||||
5. **Demo-Video lokal ausgewertet** (15 Standbilder à 10 s, 582×360-Variante, + Grok-STT-Volltext 152,4 s): Kette Outlander-Trailer (~4 s nach Sprachende), Shopping „handbags under 300 euros", Flüge Paris–Istanbul 10.–15.11., Finder-Ordner (Korrektur „Sorry, the desktop folder, not the downloads folder" korrekt aufgelöst), Love-Hypothesis-Trailer, X-Suche „Jev site:twitter.com". **Endpunkt = dokumentierter Misserfolg:** „close this tab" scheitert („Okay, stopping. Goodbye." — „I asked you to close the tab. Okay, I think there's a lot of work to be done, but this is not bad."). 26 Offline-Tests, ruff clean, MIT.
|
||||
**Einordnung:** Andy Gao zeigte das Erlebnis (App offen vor Satzende), Macbrow die Architektur („Code owns the workflow and hands Jev small, typed questions") — zwei unabhängige Builder, derselbe Slot, jetzt mit Code, Tests und benannter Fehlerrolle. Erster Jev-Build, der die Text-Only-Grenze nicht umgeht, sondern dokumentiert löst (Element-Tabelle statt Screenshots).
|
||||
**Dateien:**
|
||||
- raw (NEW): `raw/xpost/2026-09-19_bhosal-pratim-macbrow.md`
|
||||
- wiki (NEW): `wiki/people/pratim-bhosale.md`
|
||||
- wiki (UPDATED): `wiki/concepts/agents/jev-sprachsteuerung-computer-use.md` (Abschnitt „Gegenstück: Macbrow"), `wiki/index.md` (241. Update, Konzept-/People-/Raw-Zeilen)
|
||||
**⚠️:** Eigenmessungen ohne Rohdaten; Interessenkonflikt bei Gradium; Repo-Code nicht ausgeführt/geprüft, nur README + Metadaten gelesen; die 1,6-s- und 300-ms-Angaben sind Autor-Aussagen, nicht unabhängig reproduziert.
|
||||
|
||||
---
|
||||
|
||||
## 2026-09-22 — Codila-Guide-Cover verifiziert (Delta zum 239. Update)
|
||||
|
||||
**Type:** wiki-update | **Scope:** wiki/concepts/agents, wiki/index, wiki/log
|
||||
|
|
|
|||
25
wiki/people/pratim-bhosale.md
Normal file
25
wiki/people/pratim-bhosale.md
Normal file
|
|
@ -0,0 +1,25 @@
|
|||
---
|
||||
created: 2026-09-23
|
||||
updated: 2026-09-23
|
||||
sources: [xpost/2026-09-19_bhosal-pratim-macbrow.md]
|
||||
tags: [person, pratim-bhosale, macbrow, gradium, jev, computer-use, repo]
|
||||
---
|
||||
|
||||
# Pratim Bhosale (@BhosalePratim)
|
||||
|
||||
**Pratim Bhosale** ([@BhosalePratim](https://x.com/BhosalePratim), Paris, 42.523 Follower, verifiziert, Account seit 03/2021) ist **Education bei [Gradium](https://gradium.ai)** und baut mit Sacha Arbonel das Produkt **Spokira**; zuvor Engineer bei UBS. ⚠️ Bei seinen Gradium-Beiträgen besteht ein Interessenkonflikt (er bewirbt den Arbeitgeber); die Jev-Rolle in seinem Build ist davon unberührt.
|
||||
|
||||
## Macbrow (19.09.2026)
|
||||
|
||||
Sein [Tweet](https://x.com/BhosalePratim/status/2101281829168792002) (55.975 Views / 414 Likes / **488 Bookmarks** beim Abruf) stellte **Macbrow** vor: sprachgesteuerter Mac-/Browser-Agent, Stack **Gradium (STT/TTS) + LiveKit Agents + Jev + jev-ultrafast (Browser Use × TypeSafe) + LLM nur zum Schreiben**. Repo: [timpratim/macbrow](https://github.com/timpratim/macbrow) (MIT, 140 Stars / 15 Forks beim Abruf, created 18.09.2026).
|
||||
|
||||
**Wiki-Bedeutung:** der **erste Jev-Computer-Use-Build mit öffentlichem Code** — gegenüber der Andy-Gao-Demo (kein Repo, keine Messung) dokumentiert und nachprüfbar: README, Safety-Policy, 26 Offline-Tests. Die Jev-Rolle ist spezifiziert: Routing als ein Choice (~300 ms), **spekulative Arguments** (alle Enum-Argumente aller Kandidaten-Tools als eigene Choices im selben Request), Seite als indizierte Tabelle mit **einem Jev-Request pro Schritt**, Follow-up-/Vollständigkeits-Urteile als Noul/Choice — und **keine Screenshots im Loop**, was die Text-Only-Grenze konstruktiv auflöst (Anbieter-Doku: Jev nimmt nur Text). Details, Videoframes und Audio-Transkript: `raw/xpost/2026-09-19_bhosal-pratim-macbrow.md`, Einordnung in [[../concepts/agents/jev-sprachsteuerung-computer-use.md]].
|
||||
|
||||
Eigenmessung im README: Amazon-Warenkorb 4 Schritte/11 s; Follow-up Datum 6 Schritte/3,7 s; „play the Love Hypothesis trailer" **1,6 s** von Sprachende bis Video. Demo-Video (lokal ausgewertet, 15 Frames + Grok-STT): Kette Trailer → Shopping → Flüge Paris–Istanbul → Finder-Ordner → Trailer → X-Suche; Korrektur „Sorry, the desktop folder" korrekt aufgelöst; **Endpunkt ist ein dokumentierter Misserfolg** („close this tab" scheitert; Tester: „there's a lot of work to be done, but this is not bad").
|
||||
|
||||
## Verwandte Wiki-Seiten
|
||||
|
||||
- [[../concepts/agents/jev-sprachsteuerung-computer-use.md]] — Vergleich Andy Gao vs. Macbrow
|
||||
- [[../concepts/llm/system-one-models-jev.md]] — Modell
|
||||
- [[../concepts/llm/jev-praxis-demos.md]] — Demo-Welle mit Belastbarkeits-Abstufung
|
||||
- [[../institutions/typesafe-ai.md]] — Anbieter
|
||||
Loading…
Add table
Reference in a new issue