56 lines
2.9 KiB
Markdown
56 lines
2.9 KiB
Markdown
|
|
---
|
||
|
|
type: blog
|
||
|
|
source_url: "https://www.perplexity.ai/hub/blog/a-local-first-agent-for-private-and-cost-effective-knowledge-work"
|
||
|
|
retrieved: 2026-08-26
|
||
|
|
title: "A local-first agent for private and cost-effective knowledge work"
|
||
|
|
author: "Perplexity AI"
|
||
|
|
posted_date: 2026-08-25
|
||
|
|
tags: [perplexity, portable-computer, local-ai, agent-harness, benchmark, dgx-spark]
|
||
|
|
---
|
||
|
|
|
||
|
|
# A local-first agent for private and cost-effective knowledge work (Perplexity Tech-Blog)
|
||
|
|
|
||
|
|
**Quelle:** Offizieller Perplexity Tech-Blogpost zum Launch von Portable Computer (2026-08-25), abgerufen am 2026-08-26 via Firecrawl (direkter Abruf mit HTTP 403 blockiert).
|
||
|
|
**Ergänzt:** den Raw-Eintrag `raw/other/2026-08-26_perplexity-portable-computer-local-agent.md` um die technischen Details aus dem Blogpost und dem Research-Thread.
|
||
|
|
|
||
|
|
## Kernthese (Co-Design)
|
||
|
|
|
||
|
|
- Zentrale Aussage des Blogposts: „Small models fail in harnesses built for frontier models." Modell und Harness wurden daher gemeinsam entworfen (Co-Design), nicht ein kleines Modell in ein Frontier-Harness gepresst.
|
||
|
|
|
||
|
|
## Orchestrator
|
||
|
|
|
||
|
|
- Der Orchestrator ist laut Blogpost deterministischer Code, kein LLM.
|
||
|
|
- Er führt die Agent-Loop, baut Kontext zusammen und setzt Policy durch; das 27B-Modell schlägt Aktionen vor.
|
||
|
|
|
||
|
|
## Vier Harness-Prinzipien
|
||
|
|
|
||
|
|
1. **Minimales System-Prompt + Skills on-demand:** Das Modell (Qwen 3.8 27B) hat nominell 260K Fenster; empirisch degradiert es ab ~100K Tokens. Deshalb werden Skills nur bei Bedarf in den Kontext geladen.
|
||
|
|
2. **Connectors als kompakte CLI-Tools statt MCP-Server:** MCP-Tooldefinitionen verbrauchen zu viel Kontext; Perplexity setzt stattdessen auf schlanke CLI-Tools.
|
||
|
|
3. **Self-Verification eingebaut:** Verifikation ist modell-getriggert oder läuft über Health-Hooks.
|
||
|
|
4. **Always-on OS-Sandbox:** Ohne aktive Sandbox verweigert der Harness sämtliche Tool-Calls.
|
||
|
|
|
||
|
|
## Cloud-Eskalation über „Advisor"
|
||
|
|
|
||
|
|
- Das lokale Modell entscheidet, wann eskaliert wird.
|
||
|
|
- Ein PII-Klassifizierer flaggt sensible Inhalte.
|
||
|
|
- Der Nutzer muss jede Eskalation explizit freigeben.
|
||
|
|
- Der Advisor erhält nur den freigegebenen Kontext und liefert ausschließlich Text-Guidance zurück — kein Tool-Zugriff, kein File-Zugriff.
|
||
|
|
|
||
|
|
## Benchmarks (laut Blogpost, vendor-self-run auf DGX Spark)
|
||
|
|
|
||
|
|
- Eigenbenchmark (53 Knowledge-Work-Tasks): Portable Computer 82,6 % / Pi 77,6 % / Hermes 74,0 % — jeweils dasselbe Qwen-3.8-27B-Basismodell, unterschiedliche Harnesses.
|
||
|
|
- BrowseComp: 66,7 %
|
||
|
|
- ParseBench: 65,1 %
|
||
|
|
- TerminalBench: 59,6 % rein lokal / 73 % mit Opus-4.5-Advisor-Eskalation
|
||
|
|
- Hinweis: Alle Werte sind Herstellerangaben; als Gegner dienten öffentliche Open-Source-Harnesses.
|
||
|
|
|
||
|
|
## Modelle & Roadmap
|
||
|
|
|
||
|
|
- Verfügbar: Qwen 3.8 27B sowie das post-trainierte PPLX-27B-Modell von Perplexity.
|
||
|
|
- Ankündigt: NVIDIA Nemotron 3.5 Lightning.
|
||
|
|
|
||
|
|
## Verweise
|
||
|
|
|
||
|
|
- Research-Thread auf X: https://x.com/perplexity_ai/status/2092321896721432824
|
||
|
|
- Launch-Ankündigung: https://x.com/perplexity_ai/status/2092268362386780270
|