knowledge-base/wiki/tools/perplexity-portable-computer.md

10 KiB

created updated sources tags
2026-08-26 2026-08-26
other/2026-08-26_perplexity-portable-computer-local-agent.md
blog/2026-08-26_perplexity-local-first-agent-blog.md
tool
perplexity
portable-computer
local-first
agents
orchestrator
nvidia
dgx-spark
privacy
on-device

Perplexity Portable Computer — vollständig lokaler Agent-Stack

Kern: Perplexity bringt mit Portable Computer den Agenten-Betrieb komplett auf die Hardware des Users: Orchestrator, Subagent-Modelle und Agent-Harness laufen on-device, sensible Daten verlassen das Gerät nicht. Cloud wird nur noch zur explizit freigegebenen Ausnahme. Damit zieht ein Big-Tech-Anbieter erstmals in dieser Konsequenz das lokale-first-Prinzip durch — inklusive User-Gate vor jeder Cloud-Eskalation.

Was ist passiert

Perplexity hat am Dienstag (2026-08-25) "Portable Computer" veröffentlicht: eine vollständig lokale Version seiner agentic-AI-Plattform. Die Ankündigung lief über X und Threads; die NVIDIA-Blog-Meldung begleitet die Partnerschaft.

Architektur: kompletter Agent-Stack on-device

Entwickelt in Partnerschaft mit NVIDIA. Der gesamte agentische Stack läuft auf dem Gerät:

Komponente Ausführung
Orchestrator lokal
Subagent-Modelle lokal
Agent-Harness lokal
Sensible Daten bleiben vom Gerät fern der Cloud

Modelle

  • Post-trainiertes 27B-Modell als lokaler Kern.
  • Zusätzlich verfügbar: Qwen 3.8 27B — siehe ../concepts/llm/qwen3.8-27b-alibaba.md.
  • Support für NVIDIA Nemotron 3.5 Lightning angekündigt (NVIDIA Blog) — offen, 30B-MoE.
  • Bring-your-own-Model/-Inference-Server wird unterstützt.

Cloud-Eskalation nur nach User-Freigabe

Für die meisten Tasks ist keine Cloud nötig. Braucht ein Task Frontier-Level-Reasoning, fragt der Orchestrator den User um explizite Genehmigung, bevor es an ein Cloud-Modell geroutet wird. Perplexity nennt das "user-gated, PII-flagged, and text guidance only":

  • User-gated — nichts geht ohne aktive Freigabe des Users in die Cloud
  • PII-flagged — personenbezogene Daten werden markiert/gefiltert
  • Text guidance only — nur Textanweisung, keine Rohdaten

Benchmarks & Token-Limits

Hardware & Verfügbarkeit

Aspekt Detail
Erste Verfügbarkeit NVIDIA DGX Spark (128 GB Unified Memory, bis zu 1 petaFLOP AI-Performance)
Weitere Systeme Linux mit NVIDIA RTX-GPUs ab 24 GB VRAM (DGX OS oder Ubuntu, ARM/x64; Installation via apt-Repo)
Windows erwartet im September
macOS laut MarkTechPost nicht auf der Roadmap
Auslieferung Qwen 3.8 27B 3-Bit-Quantisierung, 17,4 GB Download, benötigt 32 GB RAM
Nemotron 3.5 Lightning (angekündigt) offenes 30B-MoE, 4-Bit, 19 GB, benötigt 36 GB RAM
Cluster Launch unterstützt nur eine DGX Spark pro Setup; Clustering als Roadmap-Item
Lizenz ohne Zusatzkosten für Perplexity Pro/Max; auch Enterprise Pro/Max

DGX Spark ist im Wiki bereits als Prosumer-Einstieg der NVIDIA-Ladder dokumentiert (../concepts/hardware/nvidia-dgx-station-748gb.md, ~$4.700). Portable Computer gibt dieser Hardware-Klasse erstmals eine Agent-Plattform-Schicht obendrauf.

Kontext: die Computer-Plattform-Familie

Portable Computer erweitert Perplexitys "Computer"-Plattform:

  • Februar 2026: "Computer" startete als Cloud-basierter Multi-Model-Agent für Knowledge Work.
  • Juli 2026: "Personal Computer"-Software brachte die Plattform auf Windows-Desktops.
  • August 2026: "Portable Computer" dreht das Modell um — lokal zuerst, Datenschutz vor Cloud-Komfort, positioniert gegen das wachsende Feld lokaler First-AI-Agents.

Zitat aus dem Threads-Post: "Advances in models, chips, or devices will continually improve local-first" capabilities.

OME-Relevanz

Der für die OME-Community entscheidende Punkt ist nicht die Produktnews selbst, sondern das Muster:

  1. Vollständige lokale Agent-Stacks werden Mainstream: Orchestrator + Subagents + Harness on-device ist exakt die Topologie, die OpenClaw/Hermes-Setups in der Community seit Langem praktizieren — jetzt als Big-Tech-Produkt (siehe openclaw.md).
  2. Cloud-Eskalation nur nach User-Freigabe: Das "user-gated"-Modell formalisiert, was lokale Setups implizit tun — der Mensch bleibt Gatekeeper sensibler Daten. Ein Big-Tech-Produkt übernimmt dieses Prinzip als Feature.
  3. Lokale Workflows ohne Token-Limit: Das entkoppelt Agent-Arbeit vom Subscription-Token-Zähler — wirtschaftlich dieselbe Logik wie der Cloud-Exit (../concepts/hardware/cloud-exit-and-local-superiority.md), nur von der Anbieter-Seite her gedacht.

Einordnung & Verknüpfung

Tech-Blog: Architektur-Details (2026-08-25)

Aus dem offiziellen Tech-Blogpost (../../raw/blog/2026-08-26_perplexity-local-first-agent-blog.md):

  • Kernthese Co-Design: „Small models fail in harnesses built for frontier models." — Modell und Harness wurden gemeinsam entworfen, kein kleines Modell in ein Frontier-Harness gepresst.
  • Orchestrator = deterministischer Code, kein LLM: Er führt die Agent-Loop, baut Kontext zusammen und setzt Policy durch; das 27B-Modell schlägt nur Aktionen vor.
  • Vier Harness-Prinzipien:
    1. Minimales System-Prompt, Skills nur on-demand — Qwen 3.8 27B hat nominell 260K Fenster, degradiert aber empirisch ab ~100K Tokens.
    2. Connectors als kompakte CLI-Tools statt MCP-Server — MCP-Tooldefinitionen fressen zu viel Kontext.
    3. Self-Verification eingebaut (modell-getriggert oder über Health-Hooks).
    4. Always-on OS-Sandbox: ohne Sandbox verweigert der Harness sämtliche Tool-Calls.
  • Advisor-Eskalation: Lokales Modell entscheidet wann, PII-Klassifizierer flaggt, User gibt explizit frei. Der Advisor erhält nur den freigegebenen Kontext und liefert ausschließlich Text-Guidance zurück — kein Tool-, kein File-Zugriff.

Benchmarks (Herstellerangaben, vendor-self-run auf DGX Spark)

Als Gegner dienten öffentliche Open-Source-Harnesses mit demselben Qwen-3.8-27B-Basismodell — methodisch sauberer als übliches Vendor-Selfplay, aber weiterhin Eigenangabe. Der 53-Task-Eigenbench (Deep Research, Finanzanalyse, Dokumentenerstellung) soll open-sourced werden:

Benchmark Portable Computer Vergleich
Local Knowledge Work Bench (53 Tasks) 82,6 % (Qwen 3.8 27B) / 85,4 % (PPLX 27B) Pi 77,6 % / Hermes 74,0 % (je gleiches Basismodell)
BrowseComp 66,7 % — zugleich 51 % weniger Wall-Time und 70 % weniger Tokens als Pi Pi 50,2 % / Hermes 43,9 %
ParseBench-100 (visuelle Dokumente) 65,1 % Hermes 34,6 % / Pi 13,9 %
Terminal Bench 2.1 59,6 % rein lokal (~$0/Rollout) 73,0 % mit Advisor ($0,42/Rollout); Claude Opus 5 pur: 82,4 % ($0,65/Rollout)

Caveats: Der BrowseComp-Vorteil speist sich teils daraus, dass Computer Perplexitys eigene Suchinfrastruktur nutzt, während Pi/Hermes „nur" Brave anbinden. Informativster Datenpunkt ist die Hybrid-Rechnung aus Terminal Bench 2.1: Advisor-Eskalation verkürzt die Frontier-Lücke (59,6 → 73,0 % bei ~64 % der Kosten eines reinen Frontier-Runs), schließt sie aber nicht (Opus 5 pur: 82,4 %).

Verwandte Seiten

Quellen