74 lines
5.8 KiB
Markdown
74 lines
5.8 KiB
Markdown
|
|
---
|
||
|
|
created: 2026-09-18
|
||
|
|
updated: 2026-09-18
|
||
|
|
sources: [xpost/2026-09-18_andy-gao-jev-voice-computer-use.md]
|
||
|
|
tags: [concept, agents, jev, computer-use, sprachsteuerung, macos, intent-routing, desktop-agent, demo-kritik]
|
||
|
|
---
|
||
|
|
|
||
|
|
# Sprachsteuerung als Computer-Use — Jev als Desktop-Agent (Demo 18.09.2026)
|
||
|
|
|
||
|
|
> **Quelle:** Andy Gao ([@instantricecook](https://x.com/instantricecook), 563 Follower), X-Post vom 18.09.2026 ([[../../people/andy-gao.md|Person]]), geteilt von Pit in OME Topic „JEV". Video (48 s) lokal ausgewertet: STT-Transkript + neun Standbilder. Raw: `raw/xpost/2026-09-18_andy-gao-jev-voice-computer-use.md`.
|
||
|
|
|
||
|
|
## Was gezeigt wird
|
||
|
|
|
||
|
|
Ein Mac-Agent, der **gesprochene Befehle** in Desktop-Aktionen übersetzt. Kette im Video:
|
||
|
|
|
||
|
|
1. „open up the Notes app" → Notes öffnet
|
||
|
|
2. „create a new note … title say hello" → neue Notiz mit Titel „hello"
|
||
|
|
3. „open up the Arc browser" → Arc öffnet
|
||
|
|
4. „Google search Norbert Wiener" → Suchergebnisseite
|
||
|
|
5. „open up x.com" → x.com lädt
|
||
|
|
6. „open up the photo booth and let's take a picture of me" → Photo Booth mit 3-Sekunden-Countdown, Auslösung
|
||
|
|
|
||
|
|
Am oberen Bildschirmrand läuft eine schwarze Pille mit dem **live transkribierten Sprechtext**.
|
||
|
|
|
||
|
|
## Warum das der passende Anwendungsfall für ein Entscheidungsmodell ist
|
||
|
|
|
||
|
|
Sprachsteuerung zerfällt in zwei sehr unterschiedliche Teile:
|
||
|
|
|
||
|
|
- **Sprache → Absicht:** welches Verb, welches Objekt, welche Parameter. Das ist eine **Klassifikationsaufgabe** — genau der Slot von Jev (Choice für die App, Score für die Sicherheit der Deutung, Boolean für „Befehl vollständig?").
|
||
|
|
- **Absicht → Desktop:** Fenster finden, fokussieren, Zustand prüfen, Erfolg verifizieren. Das ist **klassische Automatisierung** und der eigentliche Fehlerort.
|
||
|
|
|
||
|
|
Die Demo zeigt den ersten Teil überzeugend und den zweiten nur für triviale Fälle. Das ist keine Schwäche des Videos, sondern die korrekte Grenze der Aussage: Ein Entscheidungsmodell beschleunigt die Deutung, nicht die Zustandsprüfung.
|
||
|
|
|
||
|
|
## Prüfung der Kernaussage (lokal, am Material)
|
||
|
|
|
||
|
|
Der Post behauptet, die App öffne sich „before I even finish my sentence". Diese Aussage lässt sich am Video **prüfen**, weil Sprech-Overlay und Bildschirminhalt gleichzeitig sichtbar sind:
|
||
|
|
|
||
|
|
| Beobachtung | Beleg |
|
||
|
|
|---|---|
|
||
|
|
| Notes-Fenster offen, während der Satz noch läuft | Standbild Sekunde 6: Overlay zeigt „…en up the Notes app for me? And, um," — Notes ist bereits offen |
|
||
|
|
| Notiz „hello" existiert, während der Auftrag noch läuft | Standbild Sekunde 12: Overlay zeigt „…ew node, let's make the title say hello." — Notiz mit Titel „hello" liegt bereits vor |
|
||
|
|
|
||
|
|
**Ergebnis:** Innerhalb dieses Ablaufs ist die Aussage zutreffend — die Zielzustände sind sichtbar, während der zugehörige Satz im Overlay noch unvollständig ist. Das ist die belastbarste Einzelaussage der ganzen Jev-Demo-Welle (siehe [[../llm/jev-praxis-demos.md]]): nicht „Jev ist schnell", sondern **hier ist die Gleichzeitigkeit von Sprechen und Ausführung sichtbar**.
|
||
|
|
|
||
|
|
## Was die Demo nicht belegt
|
||
|
|
|
||
|
|
- ⚠️ **Keine Messung** — keine Latenz, keine Tokens, keine Kosten, kein Vergleichslauf.
|
||
|
|
- ⚠️ **Kein Nachweis des Jev-Anteils** — ob Jev Intent und Parameter entscheidet oder ob Teilergebnisse der Spracherkennung direkt vorgefertigte App-Aktionen auslösen („open notes" → Makro), ist aus dem Material nicht ableitbar. Ein lokales STT mit Schlüsselwort-Matching würde dieselben Bilder erzeugen.
|
||
|
|
- ⚠️ **Nur lokal skriptbare Standard-Apps** — Notes, Arc, Google, x.com, Photo Booth. Alle mit eindeutigem Verb und Objekt, keine Dialoge, keine Formulare, keine Anmeldung, kein Fehlerfall.
|
||
|
|
- ⚠️ **Kein Code, kein Repo** — der Autor schreibt nur „working on something new".
|
||
|
|
- ⚠️ **Reihenfolge vorhersehbar** — die Kette ist sequenziell und aus früheren Läufen bekannt (Notes-Liste zeigt Einträge von 12:42 und 12:43 AM, die Aufnahme um 12:46 AM).
|
||
|
|
|
||
|
|
## Einordnung
|
||
|
|
|
||
|
|
- **Der Desktop ist der nächste natürliche Ort für Entscheidungsmodelle.** Wenn jede UI-Aktion eine Millisekunden-Entscheidung ist, wird ein Desktop-Agent von einem Denk-Problem zu einem Verdrahtungsproblem. Die Demo zeigt genau diesen Übergang — sie verkauft Geschwindigkeit als Erlebnis, nicht als Zahl.
|
||
|
|
- **Die eigentlichen Hürden liegen hinter dem Video.** Für offene, mehrstufige Desktop-Aufgaben zählen Fehlertoleranz, Rechte (welche App darf was), Zustandsprüfung („ist die Notiz wirklich angelegt?") und Wiederaufsetzen nach Fehlern. Nichts davon ist hier zu sehen — und nichts davon löst ein schnelleres Klassifikationsmodell allein.
|
||
|
|
- **Gegenstück zur Schach-Lehre.** Beim Schach ([[../llm/jev-praxis-demos.md]]) gewann Jev über die Zeit, obwohl es schlechter spielte. Hier ist es umgekehrt: Das Tempo **ist** der Nutzen, weil die Aufgabe (Deutung eines kurzen Befehls) pro Schritt trivial ist. Wo die Aufgabe pro Schritt trivial und die Kette kurz ist, trägt das Modell; wo Schritte mehrdeutig werden, entscheidet wieder der Zustand, nicht die Geschwindigkeit.
|
||
|
|
|
||
|
|
## Offene Punkte
|
||
|
|
|
||
|
|
- Offen: wie der Agent Fehler erkennt (Notiz nicht angelegt, App blockiert, Berechtigung fehlt).
|
||
|
|
- Offen: wie Berechtigungen gesetzt sind — ein Desktop-Agent mit Freigabe für Notes, Browser und Kamera ist ein Sicherheitsthema, das im Video nicht vorkommt.
|
||
|
|
- Offen: ob Jev hier über den Vercel AI Gateway, die TypeSafe-API oder lokal läuft.
|
||
|
|
- Offen: ob die Live-Transkription (Overlay am Bildschirmrand) Teil des Agenten ist oder ein separates Diktat-Werkzeug.
|
||
|
|
|
||
|
|
## Verwandte Wiki-Seiten
|
||
|
|
|
||
|
|
- [[../llm/jev-praxis-demos.md]] — Demo-Welle und Belastbarkeits-Abstufung
|
||
|
|
- [[../llm/system-one-models-jev.md]] — Modell, RLCD, Benchmarks
|
||
|
|
- [[../../people/andy-gao.md]] — Autor der Demo
|
||
|
|
- [[ai-agents-2026.md]] — Agent-Frameworks und Computer-Use
|
||
|
|
- [[harness-loop-graph-engineering.md]] — Schleifen- und Werkzeug-Ebene
|
||
|
|
- [[../llm/jev-vercel-ai-gateway.md]] — Zugangswege (Gateway, Waitlist)
|