8.5 KiB
| created | updated | sources | tags | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-08-26 | 2026-08-26 |
|
|
Perplexity Portable Computer — vollständig lokaler Agent-Stack
Kern: Perplexity bringt mit Portable Computer den Agenten-Betrieb komplett auf die Hardware des Users: Orchestrator, Subagent-Modelle und Agent-Harness laufen on-device, sensible Daten verlassen das Gerät nicht. Cloud wird nur noch zur explizit freigegebenen Ausnahme. Damit zieht ein Big-Tech-Anbieter erstmals in dieser Konsequenz das lokale-first-Prinzip durch — inklusive User-Gate vor jeder Cloud-Eskalation.
Was ist passiert
Perplexity hat am Dienstag (2026-08-25) "Portable Computer" veröffentlicht: eine vollständig lokale Version seiner agentic-AI-Plattform. Die Ankündigung lief über X und Threads; die NVIDIA-Blog-Meldung begleitet die Partnerschaft.
Architektur: kompletter Agent-Stack on-device
Entwickelt in Partnerschaft mit NVIDIA. Der gesamte agentische Stack läuft auf dem Gerät:
| Komponente | Ausführung |
|---|---|
| Orchestrator | lokal |
| Subagent-Modelle | lokal |
| Agent-Harness | lokal |
| Sensible Daten | bleiben vom Gerät fern der Cloud |
Modelle
- Post-trainiertes 27B-Modell als lokaler Kern.
- Zusätzlich verfügbar: Qwen 3.8 27B — siehe ../concepts/llm/qwen3.8-27b-alibaba.md.
- Support für NVIDIA Nemotron 3.5 Lightning angekündigt (NVIDIA Blog).
Cloud-Eskalation nur nach User-Freigabe
Für die meisten Tasks ist keine Cloud nötig. Braucht ein Task Frontier-Level-Reasoning, fragt der Orchestrator den User um explizite Genehmigung, bevor es an ein Cloud-Modell geroutet wird. Perplexity nennt das "user-gated, PII-flagged, and text guidance only":
- User-gated — nichts geht ohne aktive Freigabe des Users in die Cloud
- PII-flagged — personenbezogene Daten werden markiert/gefiltert
- Text guidance only — nur Textanweisung, keine Rohdaten
Benchmarks & Token-Limits
- On-Device-27B + Harness: 82,6 % auf Real-World-Benchmarks (laut Perplexity).
- Lokale Workflows zählen nicht gegen Token-Limits — Subscriptions-Modell trifft auf lokales Flat-Rate-Verhalten; siehe ../concepts/hardware/cloud-exit-and-local-superiority.md.
Hardware & Verfügbarkeit
| Aspekt | Detail |
|---|---|
| Erste Verfügbarkeit | NVIDIA DGX Spark (128 GB Unified Memory, bis zu 1 petaFLOP AI-Performance) |
| Weitere Systeme | Linux mit NVIDIA RTX-GPUs ab 24 GB VRAM |
| Windows | erwartet im September |
| Lizenz | ohne Zusatzkosten für Perplexity Pro/Max; auch Enterprise Pro/Max |
DGX Spark ist im Wiki bereits als Prosumer-Einstieg der NVIDIA-Ladder dokumentiert (../concepts/hardware/nvidia-dgx-station-748gb.md, ~$4.700). Portable Computer gibt dieser Hardware-Klasse erstmals eine Agent-Plattform-Schicht obendrauf.
Kontext: die Computer-Plattform-Familie
Portable Computer erweitert Perplexitys "Computer"-Plattform:
- Februar 2026: "Computer" startete als Cloud-basierter Multi-Model-Agent für Knowledge Work.
- Juli 2026: "Personal Computer"-Software brachte die Plattform auf Windows-Desktops.
- August 2026: "Portable Computer" dreht das Modell um — lokal zuerst, Datenschutz vor Cloud-Komfort, positioniert gegen das wachsende Feld lokaler First-AI-Agents.
Zitat aus dem Threads-Post: "Advances in models, chips, or devices will continually improve local-first" capabilities.
OME-Relevanz
Der für die OME-Community entscheidende Punkt ist nicht die Produktnews selbst, sondern das Muster:
- Vollständige lokale Agent-Stacks werden Mainstream: Orchestrator + Subagents + Harness on-device ist exakt die Topologie, die OpenClaw/Hermes-Setups in der Community seit Langem praktizieren — jetzt als Big-Tech-Produkt (siehe openclaw.md).
- Cloud-Eskalation nur nach User-Freigabe: Das "user-gated"-Modell formalisiert, was lokale Setups implizit tun — der Mensch bleibt Gatekeeper sensibler Daten. Ein Big-Tech-Produkt übernimmt dieses Prinzip als Feature.
- Lokale Workflows ohne Token-Limit: Das entkoppelt Agent-Arbeit vom Subscription-Token-Zähler — wirtschaftlich dieselbe Logik wie der Cloud-Exit (../concepts/hardware/cloud-exit-and-local-superiority.md), nur von der Anbieter-Seite her gedacht.
Einordnung & Verknüpfung
- Gegenmodell zu Cloud-Consumer-Agents: Meta "Hatch" (../concepts/agents/meta-hatch-ai-agent-platform.md) positioniert sich als Consumer-Agent mit $199,99/Monat-Premium-Tier und Distribution über Meta-Apps — cloud-zentriert und Monetarisierung-fokussiert. Portable Computer ist das komplementäre Gegenstück: lokal zuerst, Datenschutz als Verkaufsargument.
- Unified-Memory-Vergleichsrahmen: DGX Spark (128 GB Unified Memory) reiht sich in das Rennen ein, das dieses Wiki an mehreren Stellen dokumentiert: Strix Halo 128 GB (../concepts/hardware/edge-inference-als-cloud-alternative.md) → DGX Spark 128 GB → M5 Ultra 512 GB (../concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md) → DGX Station 748 GB (../concepts/hardware/nvidia-dgx-station-748gb.md).
- 27B-Klasse als lokaler Standard: Dass Perplexity neben dem eigenen post-trainierten 27B-Modell ausgerechnet Qwen 3.8 27B anbietet, bestätigt die 27B-Klasse als lokale Referenzgröße — dieselbe Modellklasse, die im Wiki bereits als "Compact Frontier" geführt wird (../concepts/llm/qwen3.8-27b-alibaba.md).
Tech-Blog: Architektur-Details (2026-08-25)
Aus dem offiziellen Tech-Blogpost (../../raw/blog/2026-08-26_perplexity-local-first-agent-blog.md):
- Kernthese Co-Design: „Small models fail in harnesses built for frontier models." — Modell und Harness wurden gemeinsam entworfen, kein kleines Modell in ein Frontier-Harness gepresst.
- Orchestrator = deterministischer Code, kein LLM: Er führt die Agent-Loop, baut Kontext zusammen und setzt Policy durch; das 27B-Modell schlägt nur Aktionen vor.
- Vier Harness-Prinzipien:
- Minimales System-Prompt, Skills nur on-demand — Qwen 3.8 27B hat nominell 260K Fenster, degradiert aber empirisch ab ~100K Tokens.
- Connectors als kompakte CLI-Tools statt MCP-Server — MCP-Tooldefinitionen fressen zu viel Kontext.
- Self-Verification eingebaut (modell-getriggert oder über Health-Hooks).
- Always-on OS-Sandbox: ohne Sandbox verweigert der Harness sämtliche Tool-Calls.
- Advisor-Eskalation: Lokales Modell entscheidet wann, PII-Klassifizierer flaggt, User gibt explizit frei. Der Advisor erhält nur den freigegebenen Kontext und liefert ausschließlich Text-Guidance zurück — kein Tool-, kein File-Zugriff.
Benchmarks (Herstellerangaben, vendor-self-run auf DGX Spark)
Als Gegner dienten öffentliche Open-Source-Harnesses mit demselben Qwen-3.8-27B-Basismodell — methodisch sauberer als übliches Vendor-Selfplay, aber weiterhin Eigenangabe:
| Benchmark | Portable Computer | Vergleich |
|---|---|---|
| Eigenbench (53 Knowledge-Work-Tasks) | 82,6 % | Pi 77,6 % / Hermes 74,0 % |
| BrowseComp | 66,7 % | — |
| ParseBench | 65,1 % | — |
| TerminalBench | 59,6 % lokal | 73 % mit Opus-4.5-Advisor |
Verwandte Seiten
- ../concepts/hardware/cloud-exit-and-local-superiority.md — Cloud-Exit-These, RAM als Währung
- ../concepts/hardware/nvidia-dgx-station-748gb.md — NVIDIA-Ladder inkl. DGX Spark (~$4.700)
- ../concepts/hardware/edge-inference-als-cloud-alternative.md — Strix Halo (128 GB unified)
- ../concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md — M5 Ultra (512 GB Unified Memory)
- ../concepts/agents/meta-hatch-ai-agent-platform.md — Cloud-Consumer-Agent als Gegenmodell
- ../concepts/llm/qwen3.8-27b-alibaba.md — Qwen 3.8 27B als lokales Modell
- openclaw.md — OpenClaw als lokale Agent-Plattform der Community
Quellen
- Perplexity-Page: https://www.perplexity.ai/page/96f3b132-02d6-49f1-8f91-4e8f9c9da38d (abgerufen via Firecrawl, 2026-08-26)
- X-Ankündigung: https://x.com/perplexity_ai/status/2092268362386780270
- Threads-Post: https://www.threads.com/@perplexity/post/DceT206j8ul
- NVIDIA Blog: https://blogs.nvidia.com/blog/local-ai-open-source-models-agents-nemotron/
- NVIDIA DGX Spark: https://www.nvidia.com/en-us/products/workstations/dgx-spark/