> **Kern:** Perplexity bringt mit **Portable Computer** den Agenten-Betrieb komplett auf die Hardware des Users: Orchestrator, Subagent-Modelle und Agent-Harness laufen on-device, sensible Daten verlassen das Gerät nicht. Cloud wird nur noch zur explizit freigegebenen Ausnahme. Damit zieht ein Big-Tech-Anbieter erstmals in dieser Konsequenz das lokale-first-Prinzip durch — inklusive User-Gate vor jeder Cloud-Eskalation.
## Was ist passiert
Perplexity hat am Dienstag (2026-08-25) "Portable Computer" veröffentlicht: eine vollständig lokale Version seiner agentic-AI-Plattform. Die Ankündigung lief über [X](https://x.com/perplexity_ai/status/2092268362386780270) und [Threads](https://www.threads.com/@perplexity/post/DceT206j8ul); die [NVIDIA-Blog-Meldung](https://blogs.nvidia.com/blog/local-ai-open-source-models-agents-nemotron/) begleitet die Partnerschaft.
## Architektur: kompletter Agent-Stack on-device
Entwickelt in Partnerschaft mit NVIDIA. Der gesamte agentische Stack läuft auf dem Gerät:
| Komponente | Ausführung |
|------------|------------|
| Orchestrator | lokal |
| Subagent-Modelle | lokal |
| Agent-Harness | lokal |
| Sensible Daten | bleiben vom Gerät fern der Cloud |
Für die meisten Tasks ist keine Cloud nötig. Braucht ein Task Frontier-Level-Reasoning, fragt der Orchestrator den User um **explizite Genehmigung**, bevor es an ein Cloud-Modell geroutet wird. Perplexity nennt das *"user-gated, PII-flagged, and text guidance only"*:
- **User-gated** — nichts geht ohne aktive Freigabe des Users in die Cloud
- **PII-flagged** — personenbezogene Daten werden markiert/gefiltert
- **Text guidance only** — nur Textanweisung, keine Rohdaten
## Benchmarks & Token-Limits
- On-Device-27B + Harness: **82,6 %** auf Real-World-Benchmarks (laut Perplexity).
- **Lokale Workflows zählen nicht gegen Token-Limits** — Subscriptions-Modell trifft auf lokales Flat-Rate-Verhalten; siehe [[../concepts/hardware/cloud-exit-and-local-superiority.md]].
## Hardware & Verfügbarkeit
| Aspekt | Detail |
|--------|--------|
| Erste Verfügbarkeit | NVIDIA DGX Spark (128 GB Unified Memory, bis zu 1 petaFLOP AI-Performance) |
| Lizenz | ohne Zusatzkosten für Perplexity Pro/Max; auch Enterprise Pro/Max |
DGX Spark ist im Wiki bereits als Prosumer-Einstieg der NVIDIA-Ladder dokumentiert ([[../concepts/hardware/nvidia-dgx-station-748gb.md]], ~$4.700). Portable Computer gibt dieser Hardware-Klasse erstmals eine **Agent-Plattform-Schicht** obendrauf.
- **Februar 2026:** "Computer" startete als Cloud-basierter Multi-Model-Agent für Knowledge Work.
- **Juli 2026:** "Personal Computer"-Software brachte die Plattform auf Windows-Desktops.
- **August 2026:** "Portable Computer" dreht das Modell um — lokal zuerst, Datenschutz vor Cloud-Komfort, positioniert gegen das wachsende Feld lokaler First-AI-Agents.
Zitat aus dem Threads-Post: *"Advances in models, chips, or devices will continually improve local-first"* capabilities.
## OME-Relevanz
Der für die OME-Community entscheidende Punkt ist nicht die Produktnews selbst, sondern das Muster:
1.**Vollständige lokale Agent-Stacks werden Mainstream:** Orchestrator + Subagents + Harness on-device ist exakt die Topologie, die OpenClaw/Hermes-Setups in der Community seit Langem praktizieren — jetzt als Big-Tech-Produkt (siehe [[openclaw.md]]).
2.**Cloud-Eskalation nur nach User-Freigabe:** Das "user-gated"-Modell formalisiert, was lokale Setups implizit tun — der Mensch bleibt Gatekeeper sensibler Daten. Ein Big-Tech-Produkt übernimmt dieses Prinzip als Feature.
3.**Lokale Workflows ohne Token-Limit:** Das entkoppelt Agent-Arbeit vom Subscription-Token-Zähler — wirtschaftlich dieselbe Logik wie der Cloud-Exit ([[../concepts/hardware/cloud-exit-and-local-superiority.md]]), nur von der Anbieter-Seite her gedacht.
## Einordnung & Verknüpfung
- **Gegenmodell zu Cloud-Consumer-Agents:** Meta "Hatch" ([[../concepts/agents/meta-hatch-ai-agent-platform.md]]) positioniert sich als Consumer-Agent mit $199,99/Monat-Premium-Tier und Distribution über Meta-Apps — cloud-zentriert und Monetarisierung-fokussiert. Portable Computer ist das komplementäre Gegenstück: lokal zuerst, Datenschutz als Verkaufsargument.
- **Unified-Memory-Vergleichsrahmen:** DGX Spark (128 GB Unified Memory) reiht sich in das Rennen ein, das dieses Wiki an mehreren Stellen dokumentiert: Strix Halo 128 GB ([[../concepts/hardware/edge-inference-als-cloud-alternative.md]]) → DGX Spark 128 GB → M5 Ultra 512 GB ([[../concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md]]) → DGX Station 748 GB ([[../concepts/hardware/nvidia-dgx-station-748gb.md]]).
- **27B-Klasse als lokaler Standard:** Dass Perplexity neben dem eigenen post-trainierten 27B-Modell ausgerechnet Qwen 3.8 27B anbietet, bestätigt die 27B-Klasse als lokale Referenzgröße — dieselbe Modellklasse, die im Wiki bereits als "Compact Frontier" geführt wird ([[../concepts/llm/qwen3.8-27b-alibaba.md]]).
Aus dem offiziellen Tech-Blogpost ([[../../raw/blog/2026-08-26_perplexity-local-first-agent-blog.md]]):
- **Kernthese Co-Design:** „Small models fail in harnesses built for frontier models." — Modell und Harness wurden gemeinsam entworfen, kein kleines Modell in ein Frontier-Harness gepresst.
- **Orchestrator = deterministischer Code, kein LLM:** Er führt die Agent-Loop, baut Kontext zusammen und setzt Policy durch; das 27B-Modell schlägt nur Aktionen vor.
- **Vier Harness-Prinzipien:**
1. Minimales System-Prompt, Skills nur on-demand — Qwen 3.8 27B hat nominell 260K Fenster, degradiert aber empirisch ab ~100K Tokens.
2. Connectors als kompakte CLI-Tools statt MCP-Server — MCP-Tooldefinitionen fressen zu viel Kontext.
3. Self-Verification eingebaut (modell-getriggert oder über Health-Hooks).
4. Always-on OS-Sandbox: ohne Sandbox verweigert der Harness sämtliche Tool-Calls.
- **Advisor-Eskalation:** Lokales Modell entscheidet wann, PII-Klassifizierer flaggt, User gibt explizit frei. Der Advisor erhält nur den freigegebenen Kontext und liefert ausschließlich Text-Guidance zurück — kein Tool-, kein File-Zugriff.
## Benchmarks (Herstellerangaben, vendor-self-run auf DGX Spark)
Als Gegner dienten öffentliche Open-Source-Harnesses mit demselben Qwen-3.8-27B-Basismodell — methodisch sauberer als übliches Vendor-Selfplay, aber weiterhin Eigenangabe. Der 53-Task-Eigenbench (Deep Research, Finanzanalyse, Dokumentenerstellung) soll open-sourced werden:
| Terminal Bench 2.1 | 59,6 % rein lokal (~$0/Rollout) | 73,0 % mit Advisor (~$0,42/Rollout); Claude Opus 5 pur: 82,4 % (~$0,65/Rollout) |
**Caveats:** Der BrowseComp-Vorteil speist sich teils daraus, dass Computer Perplexitys eigene Suchinfrastruktur nutzt, während Pi/Hermes „nur" Brave anbinden. Informativster Datenpunkt ist die Hybrid-Rechnung aus Terminal Bench 2.1: Advisor-Eskalation verkürzt die Frontier-Lücke (59,6 → 73,0 % bei ~64 % der Kosten eines reinen Frontier-Runs), schließt sie aber nicht (Opus 5 pur: 82,4 %).