knowledge-base/wiki/concepts/agents/jev-sprachsteuerung-computer-use.md

8.2 KiB
Raw Blame History

created updated sources tags
2026-09-18 2026-09-23
xpost/2026-09-18_andy-gao-jev-voice-computer-use.md
xpost/2026-09-19_bhosal-pratim-macbrow.md
concept
agents
jev
computer-use
sprachsteuerung
macos
intent-routing
desktop-agent
demo-kritik

Sprachsteuerung als Computer-Use — Jev als Desktop-Agent (Demo 18.09.2026)

Quelle: Andy Gao (@instantricecook, 563 Follower), X-Post vom 18.09.2026 (../../people/andy-gao.md), geteilt von Pit in OME Topic „JEV". Video (48 s) lokal ausgewertet: STT-Transkript + neun Standbilder. Raw: raw/xpost/2026-09-18_andy-gao-jev-voice-computer-use.md.

Was gezeigt wird

Ein Mac-Agent, der gesprochene Befehle in Desktop-Aktionen übersetzt. Kette im Video:

  1. „open up the Notes app" → Notes öffnet
  2. „create a new note … title say hello" → neue Notiz mit Titel „hello"
  3. „open up the Arc browser" → Arc öffnet
  4. „Google search Norbert Wiener" → Suchergebnisseite
  5. „open up x.com" → x.com lädt
  6. „open up the photo booth and let's take a picture of me" → Photo Booth mit 3-Sekunden-Countdown, Auslösung

Am oberen Bildschirmrand läuft eine schwarze Pille mit dem live transkribierten Sprechtext.

Warum das der passende Anwendungsfall für ein Entscheidungsmodell ist

Sprachsteuerung zerfällt in zwei sehr unterschiedliche Teile:

  • Sprache → Absicht: welches Verb, welches Objekt, welche Parameter. Das ist eine Klassifikationsaufgabe — genau der Slot von Jev (Choice für die App, Score für die Sicherheit der Deutung, Boolean für „Befehl vollständig?").
  • Absicht → Desktop: Fenster finden, fokussieren, Zustand prüfen, Erfolg verifizieren. Das ist klassische Automatisierung und der eigentliche Fehlerort.

Die Demo zeigt den ersten Teil überzeugend und den zweiten nur für triviale Fälle. Das ist keine Schwäche des Videos, sondern die korrekte Grenze der Aussage: Ein Entscheidungsmodell beschleunigt die Deutung, nicht die Zustandsprüfung.

Prüfung der Kernaussage (lokal, am Material)

Der Post behauptet, die App öffne sich „before I even finish my sentence". Diese Aussage lässt sich am Video prüfen, weil Sprech-Overlay und Bildschirminhalt gleichzeitig sichtbar sind:

Beobachtung Beleg
Notes-Fenster offen, während der Satz noch läuft Standbild Sekunde 6: Overlay zeigt „…en up the Notes app for me? And, um," — Notes ist bereits offen
Notiz „hello" existiert, während der Auftrag noch läuft Standbild Sekunde 12: Overlay zeigt „…ew node, let's make the title say hello." — Notiz mit Titel „hello" liegt bereits vor

Ergebnis: Innerhalb dieses Ablaufs ist die Aussage zutreffend — die Zielzustände sind sichtbar, während der zugehörige Satz im Overlay noch unvollständig ist. Das ist die belastbarste Einzelaussage der ganzen Jev-Demo-Welle (siehe ../llm/jev-praxis-demos.md): nicht „Jev ist schnell", sondern hier ist die Gleichzeitigkeit von Sprechen und Ausführung sichtbar.

Was die Demo nicht belegt

  • ⚠️ Keine Messung — keine Latenz, keine Tokens, keine Kosten, kein Vergleichslauf.
  • ⚠️ Kein Nachweis des Jev-Anteils — ob Jev Intent und Parameter entscheidet oder ob Teilergebnisse der Spracherkennung direkt vorgefertigte App-Aktionen auslösen („open notes" → Makro), ist aus dem Material nicht ableitbar. Ein lokales STT mit Schlüsselwort-Matching würde dieselben Bilder erzeugen.
  • ⚠️ Nur lokal skriptbare Standard-Apps — Notes, Arc, Google, x.com, Photo Booth. Alle mit eindeutigem Verb und Objekt, keine Dialoge, keine Formulare, keine Anmeldung, kein Fehlerfall.
  • ⚠️ Kein Code, kein Repo — der Autor schreibt nur „working on something new".
  • ⚠️ Reihenfolge vorhersehbar — die Kette ist sequenziell und aus früheren Läufen bekannt (Notes-Liste zeigt Einträge von 12:42 und 12:43 AM, die Aufnahme um 12:46 AM).

Einordnung

  • Der Desktop ist der nächste natürliche Ort für Entscheidungsmodelle. Wenn jede UI-Aktion eine Millisekunden-Entscheidung ist, wird ein Desktop-Agent von einem Denk-Problem zu einem Verdrahtungsproblem. Die Demo zeigt genau diesen Übergang — sie verkauft Geschwindigkeit als Erlebnis, nicht als Zahl.
  • Die eigentlichen Hürden liegen hinter dem Video. Für offene, mehrstufige Desktop-Aufgaben zählen Fehlertoleranz, Rechte (welche App darf was), Zustandsprüfung („ist die Notiz wirklich angelegt?") und Wiederaufsetzen nach Fehlern. Nichts davon ist hier zu sehen — und nichts davon löst ein schnelleres Klassifikationsmodell allein.
  • Gegenstück zur Schach-Lehre. Beim Schach (../llm/jev-praxis-demos.md) gewann Jev über die Zeit, obwohl es schlechter spielte. Hier ist es umgekehrt: Das Tempo ist der Nutzen, weil die Aufgabe (Deutung eines kurzen Befehls) pro Schritt trivial ist. Wo die Aufgabe pro Schritt trivial und die Kette kurz ist, trägt das Modell; wo Schritte mehrdeutig werden, entscheidet wieder der Zustand, nicht die Geschwindigkeit.

Gegenstück: Macbrow — derselbe Slot, diesmal mit Code (19.09.2026)

Drei Tage später baute ../../people/pratim-bhosale.md mit Macbrow (Repo, MIT, 140 Stars beim Abruf; Raw: raw/xpost/2026-09-19_bhosal-pratim-macbrow.md) denselben Slot — Sprachbefehl → Entscheidung → Aktion — aber dokumentiert statt behauptet:

  • Jev-Rolle spezifiziert statt mentioned: Routing als ein Choice (~300 ms) über die Tools der offenen Apps, spekulative Arguments (alle Enum-Argumente aller Kandidaten-Tools als eigene Choices im selben Request, nur die Gewinner-Antworten werden gelesen), Seite als indizierte Tabelle der Controls mit einem Jev-Request pro Schritt (click/type/select/scroll/wait/done), Follow-up-/Vollständigkeits-Urteile als Noul/Choice.
  • Die Text-Only-Grenze wird konstruktiv aufgelöst: „No screenshots in the loop" — der Browser-Task liest die Seite als Element-Tabelle, Jev wählt daraus; Freitext-Argumente entstehen durch Span-Auswahl im Diktat statt Generierung. Genau die Antwort auf die oben notierte Übersetzungs-Hürde.
  • 26 Offline-Tests, Safety-Policy (Blocked: Systemeinstellungen, Shell, Datei-Delete, Payment/Checkout im Browser; State-Änderungen brauchen gesprochene Bestätigung) — inklusive dokumentiertem Grund: Eine frühe Version sollte „clean up my desktop" ausführen und verschob alle Desktop-Dateien in einen Ordner.
  • Demo-Video lokal ausgewertet (15 Frames + Grok-STT): Outlander-Trailer (~4 s nach Sprachende), Shopping „handbags under 300 euros", Flüge ParisIstanbul, Finder-Ordner, Korrektur „Sorry, the desktop folder" korrekt aufgelöst, X-Suche „Jev site:twitter.com". Endpunkt ist ein dokumentierter Misserfolg („close this tab" scheitert; Tester: „there's a lot of work to be done, but this is not bad") — die Demo glättet nicht.
  • Eigenmessung („measured on this machine"): Amazon-Warenkorb 4 Schritte/11 s, Follow-up-Datum 6 Schritte/3,7 s, Trailer 1,6 s von Sprachende bis Video — mit ~300 ms Jev-Call konsistent, keine unvereinbaren Zahlen.

Vergleich: Andy Gao zeigt das Erlebnis (App offen vor Satzende), Macbrow die Architektur (Code owns the workflow, Jev wählt, LLM schreibt nur Text). Zwei unabhängige Builder, derselbe Slot — jetzt mit Code, Tests und benannter Fehlerrolle.

Offene Punkte

  • Offen: wie der Agent Fehler erkennt (Notiz nicht angelegt, App blockiert, Berechtigung fehlt).
  • Offen: wie Berechtigungen gesetzt sind — ein Desktop-Agent mit Freigabe für Notes, Browser und Kamera ist ein Sicherheitsthema, das im Video nicht vorkommt.
  • Offen: ob Jev hier über den Vercel AI Gateway, die TypeSafe-API oder lokal läuft.
  • Offen: ob die Live-Transkription (Overlay am Bildschirmrand) Teil des Agenten ist oder ein separates Diktat-Werkzeug.

Verwandte Wiki-Seiten