knowledge-base/wiki/concepts/agents/jev-sprachsteuerung-computer-use.md
Hector 0953e8d44a ingest(xpost): jev als desktop-agent - sprachsteuerung (andy gao, video lokal ausgewertet)
- raw: post + stt-transkript + 9 frames, belegtabelle kernaussage
- wiki neu: concepts/agents/jev-sprachsteuerung-computer-use, people/andy-gao
- wiki update: concepts/llm/jev-praxis-demos (zeile + crossref)
- index 224. update + log
2026-09-19 00:47:26 +02:00

73 lines
5.8 KiB
Markdown

---
created: 2026-09-18
updated: 2026-09-18
sources: [xpost/2026-09-18_andy-gao-jev-voice-computer-use.md]
tags: [concept, agents, jev, computer-use, sprachsteuerung, macos, intent-routing, desktop-agent, demo-kritik]
---
# Sprachsteuerung als Computer-Use — Jev als Desktop-Agent (Demo 18.09.2026)
> **Quelle:** Andy Gao ([@instantricecook](https://x.com/instantricecook), 563 Follower), X-Post vom 18.09.2026 ([[../../people/andy-gao.md|Person]]), geteilt von Pit in OME Topic „JEV". Video (48 s) lokal ausgewertet: STT-Transkript + neun Standbilder. Raw: `raw/xpost/2026-09-18_andy-gao-jev-voice-computer-use.md`.
## Was gezeigt wird
Ein Mac-Agent, der **gesprochene Befehle** in Desktop-Aktionen übersetzt. Kette im Video:
1. „open up the Notes app" → Notes öffnet
2. „create a new note … title say hello" → neue Notiz mit Titel „hello"
3. „open up the Arc browser" → Arc öffnet
4. „Google search Norbert Wiener" → Suchergebnisseite
5. „open up x.com" → x.com lädt
6. „open up the photo booth and let's take a picture of me" → Photo Booth mit 3-Sekunden-Countdown, Auslösung
Am oberen Bildschirmrand läuft eine schwarze Pille mit dem **live transkribierten Sprechtext**.
## Warum das der passende Anwendungsfall für ein Entscheidungsmodell ist
Sprachsteuerung zerfällt in zwei sehr unterschiedliche Teile:
- **Sprache → Absicht:** welches Verb, welches Objekt, welche Parameter. Das ist eine **Klassifikationsaufgabe** — genau der Slot von Jev (Choice für die App, Score für die Sicherheit der Deutung, Boolean für „Befehl vollständig?").
- **Absicht → Desktop:** Fenster finden, fokussieren, Zustand prüfen, Erfolg verifizieren. Das ist **klassische Automatisierung** und der eigentliche Fehlerort.
Die Demo zeigt den ersten Teil überzeugend und den zweiten nur für triviale Fälle. Das ist keine Schwäche des Videos, sondern die korrekte Grenze der Aussage: Ein Entscheidungsmodell beschleunigt die Deutung, nicht die Zustandsprüfung.
## Prüfung der Kernaussage (lokal, am Material)
Der Post behauptet, die App öffne sich „before I even finish my sentence". Diese Aussage lässt sich am Video **prüfen**, weil Sprech-Overlay und Bildschirminhalt gleichzeitig sichtbar sind:
| Beobachtung | Beleg |
|---|---|
| Notes-Fenster offen, während der Satz noch läuft | Standbild Sekunde 6: Overlay zeigt „…en up the Notes app for me? And, um," — Notes ist bereits offen |
| Notiz „hello" existiert, während der Auftrag noch läuft | Standbild Sekunde 12: Overlay zeigt „…ew node, let's make the title say hello." — Notiz mit Titel „hello" liegt bereits vor |
**Ergebnis:** Innerhalb dieses Ablaufs ist die Aussage zutreffend — die Zielzustände sind sichtbar, während der zugehörige Satz im Overlay noch unvollständig ist. Das ist die belastbarste Einzelaussage der ganzen Jev-Demo-Welle (siehe [[../llm/jev-praxis-demos.md]]): nicht „Jev ist schnell", sondern **hier ist die Gleichzeitigkeit von Sprechen und Ausführung sichtbar**.
## Was die Demo nicht belegt
- ⚠️ **Keine Messung** — keine Latenz, keine Tokens, keine Kosten, kein Vergleichslauf.
- ⚠️ **Kein Nachweis des Jev-Anteils** — ob Jev Intent und Parameter entscheidet oder ob Teilergebnisse der Spracherkennung direkt vorgefertigte App-Aktionen auslösen („open notes" → Makro), ist aus dem Material nicht ableitbar. Ein lokales STT mit Schlüsselwort-Matching würde dieselben Bilder erzeugen.
- ⚠️ **Nur lokal skriptbare Standard-Apps** — Notes, Arc, Google, x.com, Photo Booth. Alle mit eindeutigem Verb und Objekt, keine Dialoge, keine Formulare, keine Anmeldung, kein Fehlerfall.
- ⚠️ **Kein Code, kein Repo** — der Autor schreibt nur „working on something new".
- ⚠️ **Reihenfolge vorhersehbar** — die Kette ist sequenziell und aus früheren Läufen bekannt (Notes-Liste zeigt Einträge von 12:42 und 12:43 AM, die Aufnahme um 12:46 AM).
## Einordnung
- **Der Desktop ist der nächste natürliche Ort für Entscheidungsmodelle.** Wenn jede UI-Aktion eine Millisekunden-Entscheidung ist, wird ein Desktop-Agent von einem Denk-Problem zu einem Verdrahtungsproblem. Die Demo zeigt genau diesen Übergang — sie verkauft Geschwindigkeit als Erlebnis, nicht als Zahl.
- **Die eigentlichen Hürden liegen hinter dem Video.** Für offene, mehrstufige Desktop-Aufgaben zählen Fehlertoleranz, Rechte (welche App darf was), Zustandsprüfung („ist die Notiz wirklich angelegt?") und Wiederaufsetzen nach Fehlern. Nichts davon ist hier zu sehen — und nichts davon löst ein schnelleres Klassifikationsmodell allein.
- **Gegenstück zur Schach-Lehre.** Beim Schach ([[../llm/jev-praxis-demos.md]]) gewann Jev über die Zeit, obwohl es schlechter spielte. Hier ist es umgekehrt: Das Tempo **ist** der Nutzen, weil die Aufgabe (Deutung eines kurzen Befehls) pro Schritt trivial ist. Wo die Aufgabe pro Schritt trivial und die Kette kurz ist, trägt das Modell; wo Schritte mehrdeutig werden, entscheidet wieder der Zustand, nicht die Geschwindigkeit.
## Offene Punkte
- Offen: wie der Agent Fehler erkennt (Notiz nicht angelegt, App blockiert, Berechtigung fehlt).
- Offen: wie Berechtigungen gesetzt sind — ein Desktop-Agent mit Freigabe für Notes, Browser und Kamera ist ein Sicherheitsthema, das im Video nicht vorkommt.
- Offen: ob Jev hier über den Vercel AI Gateway, die TypeSafe-API oder lokal läuft.
- Offen: ob die Live-Transkription (Overlay am Bildschirmrand) Teil des Agenten ist oder ein separates Diktat-Werkzeug.
## Verwandte Wiki-Seiten
- [[../llm/jev-praxis-demos.md]] — Demo-Welle und Belastbarkeits-Abstufung
- [[../llm/system-one-models-jev.md]] — Modell, RLCD, Benchmarks
- [[../../people/andy-gao.md]] — Autor der Demo
- [[ai-agents-2026.md]] — Agent-Frameworks und Computer-Use
- [[harness-loop-graph-engineering.md]] — Schleifen- und Werkzeug-Ebene
- [[../llm/jev-vercel-ai-gateway.md]] — Zugangswege (Gateway, Waitlist)