knowledge-base/raw/blog/2026-08-26_perplexity-local-first-agent-blog.md

56 lines
2.9 KiB
Markdown
Raw Permalink Normal View History

---
type: blog
source_url: "https://www.perplexity.ai/hub/blog/a-local-first-agent-for-private-and-cost-effective-knowledge-work"
retrieved: 2026-08-26
title: "A local-first agent for private and cost-effective knowledge work"
author: "Perplexity AI"
posted_date: 2026-08-25
tags: [perplexity, portable-computer, local-ai, agent-harness, benchmark, dgx-spark]
---
# A local-first agent for private and cost-effective knowledge work (Perplexity Tech-Blog)
**Quelle:** Offizieller Perplexity Tech-Blogpost zum Launch von Portable Computer (2026-08-25), abgerufen am 2026-08-26 via Firecrawl (direkter Abruf mit HTTP 403 blockiert).
**Ergänzt:** den Raw-Eintrag `raw/other/2026-08-26_perplexity-portable-computer-local-agent.md` um die technischen Details aus dem Blogpost und dem Research-Thread.
## Kernthese (Co-Design)
- Zentrale Aussage des Blogposts: „Small models fail in harnesses built for frontier models." Modell und Harness wurden daher gemeinsam entworfen (Co-Design), nicht ein kleines Modell in ein Frontier-Harness gepresst.
## Orchestrator
- Der Orchestrator ist laut Blogpost deterministischer Code, kein LLM.
- Er führt die Agent-Loop, baut Kontext zusammen und setzt Policy durch; das 27B-Modell schlägt Aktionen vor.
## Vier Harness-Prinzipien
1. **Minimales System-Prompt + Skills on-demand:** Das Modell (Qwen 3.8 27B) hat nominell 260K Fenster; empirisch degradiert es ab ~100K Tokens. Deshalb werden Skills nur bei Bedarf in den Kontext geladen.
2. **Connectors als kompakte CLI-Tools statt MCP-Server:** MCP-Tooldefinitionen verbrauchen zu viel Kontext; Perplexity setzt stattdessen auf schlanke CLI-Tools.
3. **Self-Verification eingebaut:** Verifikation ist modell-getriggert oder läuft über Health-Hooks.
4. **Always-on OS-Sandbox:** Ohne aktive Sandbox verweigert der Harness sämtliche Tool-Calls.
## Cloud-Eskalation über „Advisor"
- Das lokale Modell entscheidet, wann eskaliert wird.
- Ein PII-Klassifizierer flaggt sensible Inhalte.
- Der Nutzer muss jede Eskalation explizit freigeben.
- Der Advisor erhält nur den freigegebenen Kontext und liefert ausschließlich Text-Guidance zurück — kein Tool-Zugriff, kein File-Zugriff.
## Benchmarks (laut Blogpost, vendor-self-run auf DGX Spark)
- Eigenbenchmark (53 Knowledge-Work-Tasks): Portable Computer 82,6 % / Pi 77,6 % / Hermes 74,0 % — jeweils dasselbe Qwen-3.8-27B-Basismodell, unterschiedliche Harnesses.
- BrowseComp: 66,7 %
- ParseBench: 65,1 %
- TerminalBench: 59,6 % rein lokal / 73 % mit Opus-4.5-Advisor-Eskalation
- Hinweis: Alle Werte sind Herstellerangaben; als Gegner dienten öffentliche Open-Source-Harnesses.
## Modelle & Roadmap
- Verfügbar: Qwen 3.8 27B sowie das post-trainierte PPLX-27B-Modell von Perplexity.
- Ankündigt: NVIDIA Nemotron 3.5 Lightning.
## Verweise
- Research-Thread auf X: https://x.com/perplexity_ai/status/2092321896721432824
- Launch-Ankündigung: https://x.com/perplexity_ai/status/2092268362386780270