--- created: 2026-09-18 updated: 2026-09-18 sources: [xpost/2026-09-18_andy-gao-jev-voice-computer-use.md] tags: [concept, agents, jev, computer-use, sprachsteuerung, macos, intent-routing, desktop-agent, demo-kritik] --- # Sprachsteuerung als Computer-Use — Jev als Desktop-Agent (Demo 18.09.2026) > **Quelle:** Andy Gao ([@instantricecook](https://x.com/instantricecook), 563 Follower), X-Post vom 18.09.2026 ([[../../people/andy-gao.md|Person]]), geteilt von Pit in OME Topic „JEV". Video (48 s) lokal ausgewertet: STT-Transkript + neun Standbilder. Raw: `raw/xpost/2026-09-18_andy-gao-jev-voice-computer-use.md`. ## Was gezeigt wird Ein Mac-Agent, der **gesprochene Befehle** in Desktop-Aktionen übersetzt. Kette im Video: 1. „open up the Notes app" → Notes öffnet 2. „create a new note … title say hello" → neue Notiz mit Titel „hello" 3. „open up the Arc browser" → Arc öffnet 4. „Google search Norbert Wiener" → Suchergebnisseite 5. „open up x.com" → x.com lädt 6. „open up the photo booth and let's take a picture of me" → Photo Booth mit 3-Sekunden-Countdown, Auslösung Am oberen Bildschirmrand läuft eine schwarze Pille mit dem **live transkribierten Sprechtext**. ## Warum das der passende Anwendungsfall für ein Entscheidungsmodell ist Sprachsteuerung zerfällt in zwei sehr unterschiedliche Teile: - **Sprache → Absicht:** welches Verb, welches Objekt, welche Parameter. Das ist eine **Klassifikationsaufgabe** — genau der Slot von Jev (Choice für die App, Score für die Sicherheit der Deutung, Boolean für „Befehl vollständig?"). - **Absicht → Desktop:** Fenster finden, fokussieren, Zustand prüfen, Erfolg verifizieren. Das ist **klassische Automatisierung** und der eigentliche Fehlerort. Die Demo zeigt den ersten Teil überzeugend und den zweiten nur für triviale Fälle. Das ist keine Schwäche des Videos, sondern die korrekte Grenze der Aussage: Ein Entscheidungsmodell beschleunigt die Deutung, nicht die Zustandsprüfung. ## Prüfung der Kernaussage (lokal, am Material) Der Post behauptet, die App öffne sich „before I even finish my sentence". Diese Aussage lässt sich am Video **prüfen**, weil Sprech-Overlay und Bildschirminhalt gleichzeitig sichtbar sind: | Beobachtung | Beleg | |---|---| | Notes-Fenster offen, während der Satz noch läuft | Standbild Sekunde 6: Overlay zeigt „…en up the Notes app for me? And, um," — Notes ist bereits offen | | Notiz „hello" existiert, während der Auftrag noch läuft | Standbild Sekunde 12: Overlay zeigt „…ew node, let's make the title say hello." — Notiz mit Titel „hello" liegt bereits vor | **Ergebnis:** Innerhalb dieses Ablaufs ist die Aussage zutreffend — die Zielzustände sind sichtbar, während der zugehörige Satz im Overlay noch unvollständig ist. Das ist die belastbarste Einzelaussage der ganzen Jev-Demo-Welle (siehe [[../llm/jev-praxis-demos.md]]): nicht „Jev ist schnell", sondern **hier ist die Gleichzeitigkeit von Sprechen und Ausführung sichtbar**. ## Was die Demo nicht belegt - ⚠️ **Keine Messung** — keine Latenz, keine Tokens, keine Kosten, kein Vergleichslauf. - ⚠️ **Kein Nachweis des Jev-Anteils** — ob Jev Intent und Parameter entscheidet oder ob Teilergebnisse der Spracherkennung direkt vorgefertigte App-Aktionen auslösen („open notes" → Makro), ist aus dem Material nicht ableitbar. Ein lokales STT mit Schlüsselwort-Matching würde dieselben Bilder erzeugen. - ⚠️ **Nur lokal skriptbare Standard-Apps** — Notes, Arc, Google, x.com, Photo Booth. Alle mit eindeutigem Verb und Objekt, keine Dialoge, keine Formulare, keine Anmeldung, kein Fehlerfall. - ⚠️ **Kein Code, kein Repo** — der Autor schreibt nur „working on something new". - ⚠️ **Reihenfolge vorhersehbar** — die Kette ist sequenziell und aus früheren Läufen bekannt (Notes-Liste zeigt Einträge von 12:42 und 12:43 AM, die Aufnahme um 12:46 AM). ## Einordnung - **Der Desktop ist der nächste natürliche Ort für Entscheidungsmodelle.** Wenn jede UI-Aktion eine Millisekunden-Entscheidung ist, wird ein Desktop-Agent von einem Denk-Problem zu einem Verdrahtungsproblem. Die Demo zeigt genau diesen Übergang — sie verkauft Geschwindigkeit als Erlebnis, nicht als Zahl. - **Die eigentlichen Hürden liegen hinter dem Video.** Für offene, mehrstufige Desktop-Aufgaben zählen Fehlertoleranz, Rechte (welche App darf was), Zustandsprüfung („ist die Notiz wirklich angelegt?") und Wiederaufsetzen nach Fehlern. Nichts davon ist hier zu sehen — und nichts davon löst ein schnelleres Klassifikationsmodell allein. - **Gegenstück zur Schach-Lehre.** Beim Schach ([[../llm/jev-praxis-demos.md]]) gewann Jev über die Zeit, obwohl es schlechter spielte. Hier ist es umgekehrt: Das Tempo **ist** der Nutzen, weil die Aufgabe (Deutung eines kurzen Befehls) pro Schritt trivial ist. Wo die Aufgabe pro Schritt trivial und die Kette kurz ist, trägt das Modell; wo Schritte mehrdeutig werden, entscheidet wieder der Zustand, nicht die Geschwindigkeit. ## Offene Punkte - Offen: wie der Agent Fehler erkennt (Notiz nicht angelegt, App blockiert, Berechtigung fehlt). - Offen: wie Berechtigungen gesetzt sind — ein Desktop-Agent mit Freigabe für Notes, Browser und Kamera ist ein Sicherheitsthema, das im Video nicht vorkommt. - Offen: ob Jev hier über den Vercel AI Gateway, die TypeSafe-API oder lokal läuft. - Offen: ob die Live-Transkription (Overlay am Bildschirmrand) Teil des Agenten ist oder ein separates Diktat-Werkzeug. ## Verwandte Wiki-Seiten - [[../llm/jev-praxis-demos.md]] — Demo-Welle und Belastbarkeits-Abstufung - [[../llm/system-one-models-jev.md]] — Modell, RLCD, Benchmarks - [[../../people/andy-gao.md]] — Autor der Demo - [[ai-agents-2026.md]] — Agent-Frameworks und Computer-Use - [[harness-loop-graph-engineering.md]] — Schleifen- und Werkzeug-Ebene - [[../llm/jev-vercel-ai-gateway.md]] — Zugangswege (Gateway, Waitlist)