--- created: 2026-08-26 updated: 2026-08-26 sources: [other/2026-08-26_perplexity-portable-computer-local-agent.md, blog/2026-08-26_perplexity-local-first-agent-blog.md] tags: [tool, perplexity, portable-computer, local-first, agents, orchestrator, nvidia, dgx-spark, privacy, on-device] --- # Perplexity Portable Computer — vollständig lokaler Agent-Stack > **Kern:** Perplexity bringt mit **Portable Computer** den Agenten-Betrieb komplett auf die Hardware des Users: Orchestrator, Subagent-Modelle und Agent-Harness laufen on-device, sensible Daten verlassen das Gerät nicht. Cloud wird nur noch zur explizit freigegebenen Ausnahme. Damit zieht ein Big-Tech-Anbieter erstmals in dieser Konsequenz das lokale-first-Prinzip durch — inklusive User-Gate vor jeder Cloud-Eskalation. ## Was ist passiert Perplexity hat am Dienstag (2026-08-25) "Portable Computer" veröffentlicht: eine vollständig lokale Version seiner agentic-AI-Plattform. Die Ankündigung lief über [X](https://x.com/perplexity_ai/status/2092268362386780270) und [Threads](https://www.threads.com/@perplexity/post/DceT206j8ul); die [NVIDIA-Blog-Meldung](https://blogs.nvidia.com/blog/local-ai-open-source-models-agents-nemotron/) begleitet die Partnerschaft. ## Architektur: kompletter Agent-Stack on-device Entwickelt in Partnerschaft mit NVIDIA. Der gesamte agentische Stack läuft auf dem Gerät: | Komponente | Ausführung | |------------|------------| | Orchestrator | lokal | | Subagent-Modelle | lokal | | Agent-Harness | lokal | | Sensible Daten | bleiben vom Gerät fern der Cloud | ### Modelle - Post-trainiertes 27B-Modell als lokaler Kern. - Zusätzlich verfügbar: Qwen 3.8 27B — siehe [[../concepts/llm/qwen3.8-27b-alibaba.md]]. - Support für NVIDIA Nemotron 3.5 Lightning angekündigt ([NVIDIA Blog](https://blogs.nvidia.com/blog/local-ai-open-source-models-agents-nemotron/)) — offen, 30B-MoE. - Bring-your-own-Model/-Inference-Server wird unterstützt. ### Cloud-Eskalation nur nach User-Freigabe Für die meisten Tasks ist keine Cloud nötig. Braucht ein Task Frontier-Level-Reasoning, fragt der Orchestrator den User um **explizite Genehmigung**, bevor es an ein Cloud-Modell geroutet wird. Perplexity nennt das *"user-gated, PII-flagged, and text guidance only"*: - **User-gated** — nichts geht ohne aktive Freigabe des Users in die Cloud - **PII-flagged** — personenbezogene Daten werden markiert/gefiltert - **Text guidance only** — nur Textanweisung, keine Rohdaten ## Benchmarks & Token-Limits - On-Device-27B + Harness: **82,6 %** auf Real-World-Benchmarks (laut Perplexity). - **Lokale Workflows zählen nicht gegen Token-Limits** — Subscriptions-Modell trifft auf lokales Flat-Rate-Verhalten; siehe [[../concepts/hardware/cloud-exit-and-local-superiority.md]]. ## Hardware & Verfügbarkeit | Aspekt | Detail | |--------|--------| | Erste Verfügbarkeit | NVIDIA DGX Spark (128 GB Unified Memory, bis zu 1 petaFLOP AI-Performance) | | Weitere Systeme | Linux mit NVIDIA RTX-GPUs ab 24 GB VRAM (DGX OS oder Ubuntu, ARM/x64; Installation via apt-Repo) | | Windows | erwartet im September | | macOS | laut MarkTechPost nicht auf der Roadmap | | Auslieferung Qwen 3.8 27B | 3-Bit-Quantisierung, 17,4 GB Download, benötigt 32 GB RAM | | Nemotron 3.5 Lightning (angekündigt) | offenes 30B-MoE, 4-Bit, 19 GB, benötigt 36 GB RAM | | Cluster | Launch unterstützt nur eine DGX Spark pro Setup; Clustering als Roadmap-Item | | Lizenz | ohne Zusatzkosten für Perplexity Pro/Max; auch Enterprise Pro/Max | DGX Spark ist im Wiki bereits als Prosumer-Einstieg der NVIDIA-Ladder dokumentiert ([[../concepts/hardware/nvidia-dgx-station-748gb.md]], ~$4.700). Portable Computer gibt dieser Hardware-Klasse erstmals eine **Agent-Plattform-Schicht** obendrauf. ## Kontext: die Computer-Plattform-Familie Portable Computer erweitert Perplexitys "Computer"-Plattform: - **Februar 2026:** "Computer" startete als Cloud-basierter Multi-Model-Agent für Knowledge Work. - **Juli 2026:** "Personal Computer"-Software brachte die Plattform auf Windows-Desktops. - **August 2026:** "Portable Computer" dreht das Modell um — lokal zuerst, Datenschutz vor Cloud-Komfort, positioniert gegen das wachsende Feld lokaler First-AI-Agents. Zitat aus dem Threads-Post: *"Advances in models, chips, or devices will continually improve local-first"* capabilities. ## OME-Relevanz Der für die OME-Community entscheidende Punkt ist nicht die Produktnews selbst, sondern das Muster: 1. **Vollständige lokale Agent-Stacks werden Mainstream:** Orchestrator + Subagents + Harness on-device ist exakt die Topologie, die OpenClaw/Hermes-Setups in der Community seit Langem praktizieren — jetzt als Big-Tech-Produkt (siehe [[openclaw.md]]). 2. **Cloud-Eskalation nur nach User-Freigabe:** Das "user-gated"-Modell formalisiert, was lokale Setups implizit tun — der Mensch bleibt Gatekeeper sensibler Daten. Ein Big-Tech-Produkt übernimmt dieses Prinzip als Feature. 3. **Lokale Workflows ohne Token-Limit:** Das entkoppelt Agent-Arbeit vom Subscription-Token-Zähler — wirtschaftlich dieselbe Logik wie der Cloud-Exit ([[../concepts/hardware/cloud-exit-and-local-superiority.md]]), nur von der Anbieter-Seite her gedacht. ## Einordnung & Verknüpfung - **Gegenmodell zu Cloud-Consumer-Agents:** Meta "Hatch" ([[../concepts/agents/meta-hatch-ai-agent-platform.md]]) positioniert sich als Consumer-Agent mit $199,99/Monat-Premium-Tier und Distribution über Meta-Apps — cloud-zentriert und Monetarisierung-fokussiert. Portable Computer ist das komplementäre Gegenstück: lokal zuerst, Datenschutz als Verkaufsargument. - **Unified-Memory-Vergleichsrahmen:** DGX Spark (128 GB Unified Memory) reiht sich in das Rennen ein, das dieses Wiki an mehreren Stellen dokumentiert: Strix Halo 128 GB ([[../concepts/hardware/edge-inference-als-cloud-alternative.md]]) → DGX Spark 128 GB → M5 Ultra 512 GB ([[../concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md]]) → DGX Station 748 GB ([[../concepts/hardware/nvidia-dgx-station-748gb.md]]). - **27B-Klasse als lokaler Standard:** Dass Perplexity neben dem eigenen post-trainierten 27B-Modell ausgerechnet Qwen 3.8 27B anbietet, bestätigt die 27B-Klasse als lokale Referenzgröße — dieselbe Modellklasse, die im Wiki bereits als "Compact Frontier" geführt wird ([[../concepts/llm/qwen3.8-27b-alibaba.md]]). ## Tech-Blog: Architektur-Details (2026-08-25) Aus dem offiziellen Tech-Blogpost ([[../../raw/blog/2026-08-26_perplexity-local-first-agent-blog.md]]): - **Kernthese Co-Design:** „Small models fail in harnesses built for frontier models." — Modell und Harness wurden gemeinsam entworfen, kein kleines Modell in ein Frontier-Harness gepresst. - **Orchestrator = deterministischer Code, kein LLM:** Er führt die Agent-Loop, baut Kontext zusammen und setzt Policy durch; das 27B-Modell schlägt nur Aktionen vor. - **Vier Harness-Prinzipien:** 1. Minimales System-Prompt, Skills nur on-demand — Qwen 3.8 27B hat nominell 260K Fenster, degradiert aber empirisch ab ~100K Tokens. 2. Connectors als kompakte CLI-Tools statt MCP-Server — MCP-Tooldefinitionen fressen zu viel Kontext. 3. Self-Verification eingebaut (modell-getriggert oder über Health-Hooks). 4. Always-on OS-Sandbox: ohne Sandbox verweigert der Harness sämtliche Tool-Calls. - **Advisor-Eskalation:** Lokales Modell entscheidet wann, PII-Klassifizierer flaggt, User gibt explizit frei. Der Advisor erhält nur den freigegebenen Kontext und liefert ausschließlich Text-Guidance zurück — kein Tool-, kein File-Zugriff. ## Benchmarks (Herstellerangaben, vendor-self-run auf DGX Spark) Als Gegner dienten öffentliche Open-Source-Harnesses mit demselben Qwen-3.8-27B-Basismodell — methodisch sauberer als übliches Vendor-Selfplay, aber weiterhin Eigenangabe. Der 53-Task-Eigenbench (Deep Research, Finanzanalyse, Dokumentenerstellung) soll open-sourced werden: | Benchmark | Portable Computer | Vergleich | |---|---|---| | Local Knowledge Work Bench (53 Tasks) | 82,6 % (Qwen 3.8 27B) / **85,4 % (PPLX 27B)** | Pi 77,6 % / Hermes 74,0 % (je gleiches Basismodell) | | BrowseComp | 66,7 % — zugleich 51 % weniger Wall-Time und 70 % weniger Tokens als Pi | Pi 50,2 % / Hermes 43,9 % | | ParseBench-100 (visuelle Dokumente) | 65,1 % | Hermes 34,6 % / Pi 13,9 % | | Terminal Bench 2.1 | 59,6 % rein lokal (~$0/Rollout) | 73,0 % mit Advisor (~$0,42/Rollout); Claude Opus 5 pur: 82,4 % (~$0,65/Rollout) | **Caveats:** Der BrowseComp-Vorteil speist sich teils daraus, dass Computer Perplexitys eigene Suchinfrastruktur nutzt, während Pi/Hermes „nur" Brave anbinden. Informativster Datenpunkt ist die Hybrid-Rechnung aus Terminal Bench 2.1: Advisor-Eskalation verkürzt die Frontier-Lücke (59,6 → 73,0 % bei ~64 % der Kosten eines reinen Frontier-Runs), schließt sie aber nicht (Opus 5 pur: 82,4 %). ## Verwandte Seiten - [[../concepts/hardware/cloud-exit-and-local-superiority.md]] — Cloud-Exit-These, RAM als Währung - [[../concepts/hardware/nvidia-dgx-station-748gb.md]] — NVIDIA-Ladder inkl. DGX Spark (~$4.700) - [[../concepts/hardware/edge-inference-als-cloud-alternative.md]] — Strix Halo (128 GB unified) - [[../concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md]] — M5 Ultra (512 GB Unified Memory) - [[../concepts/agents/meta-hatch-ai-agent-platform.md]] — Cloud-Consumer-Agent als Gegenmodell - [[../concepts/llm/qwen3.8-27b-alibaba.md]] — Qwen 3.8 27B als lokales Modell - [[openclaw.md]] — OpenClaw als lokale Agent-Plattform der Community ## Quellen - Perplexity-Page: https://www.perplexity.ai/page/96f3b132-02d6-49f1-8f91-4e8f9c9da38d (abgerufen via Firecrawl, 2026-08-26) - Tech-Blog: https://www.perplexity.ai/hub/blog/a-local-first-agent-for-private-and-cost-effective-knowledge-work - MarkTechPost (Benchmark-/Hardware-Details): https://www.marktechpost.com/2026/08/25/perplexity-ships-portable-computer-on-nvidia-dgx-spark-local-harness-os-enforced-sandbox-and-zero-per-token-cost-for-local-steps/ - X-Ankündigung: https://x.com/perplexity_ai/status/2092268362386780270 - Threads-Post: https://www.threads.com/@perplexity/post/DceT206j8ul - NVIDIA Blog: https://blogs.nvidia.com/blog/local-ai-open-source-models-agents-nemotron/ - NVIDIA DGX Spark: https://www.nvidia.com/en-us/products/workstations/dgx-spark/