knowledge-base/raw/blog/2026-08-26_perplexity-local-first-agent-blog.md

2.9 KiB

type source_url retrieved title author posted_date tags
blog https://www.perplexity.ai/hub/blog/a-local-first-agent-for-private-and-cost-effective-knowledge-work 2026-08-26 A local-first agent for private and cost-effective knowledge work Perplexity AI 2026-08-25
perplexity
portable-computer
local-ai
agent-harness
benchmark
dgx-spark

A local-first agent for private and cost-effective knowledge work (Perplexity Tech-Blog)

Quelle: Offizieller Perplexity Tech-Blogpost zum Launch von Portable Computer (2026-08-25), abgerufen am 2026-08-26 via Firecrawl (direkter Abruf mit HTTP 403 blockiert). Ergänzt: den Raw-Eintrag raw/other/2026-08-26_perplexity-portable-computer-local-agent.md um die technischen Details aus dem Blogpost und dem Research-Thread.

Kernthese (Co-Design)

  • Zentrale Aussage des Blogposts: „Small models fail in harnesses built for frontier models." Modell und Harness wurden daher gemeinsam entworfen (Co-Design), nicht ein kleines Modell in ein Frontier-Harness gepresst.

Orchestrator

  • Der Orchestrator ist laut Blogpost deterministischer Code, kein LLM.
  • Er führt die Agent-Loop, baut Kontext zusammen und setzt Policy durch; das 27B-Modell schlägt Aktionen vor.

Vier Harness-Prinzipien

  1. Minimales System-Prompt + Skills on-demand: Das Modell (Qwen 3.8 27B) hat nominell 260K Fenster; empirisch degradiert es ab ~100K Tokens. Deshalb werden Skills nur bei Bedarf in den Kontext geladen.
  2. Connectors als kompakte CLI-Tools statt MCP-Server: MCP-Tooldefinitionen verbrauchen zu viel Kontext; Perplexity setzt stattdessen auf schlanke CLI-Tools.
  3. Self-Verification eingebaut: Verifikation ist modell-getriggert oder läuft über Health-Hooks.
  4. Always-on OS-Sandbox: Ohne aktive Sandbox verweigert der Harness sämtliche Tool-Calls.

Cloud-Eskalation über „Advisor"

  • Das lokale Modell entscheidet, wann eskaliert wird.
  • Ein PII-Klassifizierer flaggt sensible Inhalte.
  • Der Nutzer muss jede Eskalation explizit freigeben.
  • Der Advisor erhält nur den freigegebenen Kontext und liefert ausschließlich Text-Guidance zurück — kein Tool-Zugriff, kein File-Zugriff.

Benchmarks (laut Blogpost, vendor-self-run auf DGX Spark)

  • Eigenbenchmark (53 Knowledge-Work-Tasks): Portable Computer 82,6 % / Pi 77,6 % / Hermes 74,0 % — jeweils dasselbe Qwen-3.8-27B-Basismodell, unterschiedliche Harnesses.
  • BrowseComp: 66,7 %
  • ParseBench: 65,1 %
  • TerminalBench: 59,6 % rein lokal / 73 % mit Opus-4.5-Advisor-Eskalation
  • Hinweis: Alle Werte sind Herstellerangaben; als Gegner dienten öffentliche Open-Source-Harnesses.

Modelle & Roadmap

  • Verfügbar: Qwen 3.8 27B sowie das post-trainierte PPLX-27B-Modell von Perplexity.
  • Ankündigt: NVIDIA Nemotron 3.5 Lightning.

Verweise