From c6a5e251ee9131f7c754743d8ed3b6ee7b532653 Mon Sep 17 00:00:00 2001 From: Hector Date: Thu, 20 Aug 2026 11:57:37 +0200 Subject: [PATCH] Ingest: HermesWatcher Persistent Goals + Quality Gates (X-Post 2026-08-20) - raw/xpost/2026-08-20_hermeswatcher-persistent-goals-quality-gates.md (neu) - wiki/tools/hermes-desktop.md: Abschnitt 'Persistent Goals mit Completion Contract & Quality Gates' - wiki/index.md: Hermes-Desktop-Eintrag erweitert (112. Update) - wiki/log.md: Ingest-Eintrag --- ...swatcher-persistent-goals-quality-gates.md | 48 +++++++++++++++++++ wiki/index.md | 2 +- wiki/log.md | 10 ++++ wiki/tools/hermes-desktop.md | 47 ++++++++++++++++-- 4 files changed, 103 insertions(+), 4 deletions(-) create mode 100644 raw/xpost/2026-08-20_hermeswatcher-persistent-goals-quality-gates.md diff --git a/raw/xpost/2026-08-20_hermeswatcher-persistent-goals-quality-gates.md b/raw/xpost/2026-08-20_hermeswatcher-persistent-goals-quality-gates.md new file mode 100644 index 0000000..9554213 --- /dev/null +++ b/raw/xpost/2026-08-20_hermeswatcher-persistent-goals-quality-gates.md @@ -0,0 +1,48 @@ +--- +type: xpost +source_url: https://x.com/HermesWatcher/status/2090098981183672384 +retrieved: 2026-08-20 +author: "@HermesWatcher" +is_thread: true +quote_count: 0 +tags: [hermes, goals, completion-contract, quality-gates, reliability] +--- + +# HermesWatcher: Persistent Goals mit Completion Contract und Quality Gates + +**Quelle:** https://x.com/HermesWatcher/status/2090098981183672384 +**Geteilt von:** Kai (@PWeber) in OME-Gruppe, Topic "Hermès" Agents (2026-08-20) +**Beitragende Quelle:** X-Post von @HermesWatcher (inoffizieller Tracker für Hermes Agent Releases/Changelogs von Nous Research) + +## Inhalt + +Der Post erklärt, wie man **langlaufende Jobs** (Long-Running Tasks) für den Hermes AI Agent zuverlässiger macht und vage oder verfrühte "done"-Erklärungen vermeidet. + +### Persistent Goals mit Completion Contract + +Statt einer vagen Anweisung wie "Fix the repo" definiert man exakt, was "done" bedeutet. Der Completion Contract spezifiziert: + +- **Outcome** — das gewünschte Endergebnis +- **Verification** — wie überprüft wird, dass das Ziel erreicht ist +- **Constraints** — Rahmenbedingungen/Einschränkungen +- **Boundaries** — Grenzen des Aufgabenbereichs +- **`stop_when`-Bedingung** — wann der Agent aufhören soll + +**Beispiel-Kommando:** +``` +/goal draft Fix every lint error in src/ and verify ruff check passes +``` + +### Quality Gates +- Optionaler Mechanismus (`/goal gate add ...`) +- Shell-Kommandos (z.B. `ruff check src/`), die mit Exit-Code 0 enden müssen, bevor das Goal als complete markiert werden darf +- Wirken als harte, mechanische Checks, die der LLM-Judge nicht "wegreden" (talk its way around) kann + +### Kontrast +- **Loses Objective:** leicht für den Agenten subjektiv interpretierbar +- **Strukturiertes Goal + Quality Gate:** deutlich strenger und verifizierbarer + +## Key Takeaways +1. Completion Contracts ersetzen vage Ziele durch präzise "done"-Definitionen (Outcome, Verification, Constraints, Boundaries, stop_when). +2. Quality Gates sind mechanische Shell-Checks (Exit-Code 0), die das LLM-Urteil über Verifikation hinaus absichern. +3. Das Muster erhöht die Verlässlichkeit komplexer, langlaufender Agenten-Aufgaben. diff --git a/wiki/index.md b/wiki/index.md index 64315d4..792533d 100644 --- a/wiki/index.md +++ b/wiki/index.md @@ -33,7 +33,7 @@ |-------|-------------|---------| | [OpenClaw](tools/openclaw.md) | Plattform-Referenz: v2026.6.8 stable (16.06.2026), Architektur-Übersicht, plattformrelevante Release-Changes, Update-Plan. **Mobile Apps (29.06.2026):** Native iOS (iPhone/iPad/Apple Watch) + Android Apps, Gateway-Pairing, Voice, Approvals, Device Capabilities. ClawHub-Security-Kontext (5 malicious skills, 800+ gesamt, 84.2% NL-injection). **ClawCast Ep. 7 (12.08.2026):** Unfiltered Q&A mit Gründer Peter Steinberger — Roadmap, kommendes Release, Agents in der Softwareentwicklung, Cloud-backed multiplayer workflows, OpenClaw-baut-mit-OpenClaw, SQLite, Team-Server, Agent-zu-Agent, Memory, Model Routing, Onboarding, Browser Control, Hardware, Open Source als Kern-Differentiator | other/2026-06-16_openclaw-releases-v2026.6.8.md + blog/2026-06-30_perplexity-openclaw-mobile-apps.md + youtube/2026-08-13_clawcast-episode7-peter-steinberger.md | | [BUZZ (buzz.xyz)](tools/buzz.md) | Selbstgehostete Open-Source-Slack-Alternative als Zugangsschicht (Workspace) für AI-Agents. Team + Agent im selben Workspace, ohne Harness-/Skill-Engineering. 3-Stufen-Stack (lokal Claude Code/Codex → Cloud Hermes/OpenClaw → BUZZ-Workspace). Setup: `hermes gateway setup` → BUZZ-Integration → Invite-Link → Gateway-Restart. Agent-Owner maintained, Team nutzt ohne Overhead. Open source, kostenlos, noch Kinderkrankheiten. | youtube/2026-08-16_hermes-agent-buzz-ai.md | -| [Hermes Desktop](tools/hermes-desktop.md) | Offizielle native GUI für Hermes Agent. Electron/React/Python. Update v0.17.0 ("Reach") bringt native iMessage-Integration via Photon, asynchrone Subagents mit Watch-Windows, Image-to-Image Bearbeitung, Automation Blueprints und Telegram Rich Text Bot API 10.1. **Mixture of Agents (MoA)** (28.06.2026): Merge any N models into one virtual model (Reference + Aggregator), +8% über Opus 4.8 solo. **MoA 2.0 + Hermes Agent OS** (03.07.2026): GoldyBench-Validierung (42 Builds, top vor Opus 4.8 solo), Agent OS GUI mit Mixture/Chat/Talk/Jarvis/Oracle/Studio Tabs, "Don't chase the model, build the system". **Alex Finn: 100+ Hours Lessons Learned** (09.07.2026): 9 praktische Lektionen, Modell-Empfehlungen (Opus → GPT-5.6 Migration), Reverse Prompting, Tailscale. **Browser Extension** (10.07.2026): Open-Source von @jonkomet, 8 Updates/Woche, Session-Management + Vision + Model-Switching direkt im Browser. OpenClaw-Migrationstool `hermes claw migrate`. | youtube/2026-06-22_jonas-keil-hermes-desktop.md + youtube/2026-06-24_alex-finn-hermes-agent-v0170-reach.md + youtube/2026-06-24_peter-yang-hermes-full-course.md + xpost/2026-06-28-hermes-moa-vaibhavsisinty.md + youtube/2026-07-03_hermes-mixture-of-agents-2-0-agent-os.md + xpost/2026-07-10_alex-finn-hermes-agent-100-hours.md + xpost/2026-07-10_charly-wargnier-hermes-browser-extension.md | +| [Hermes Desktop](tools/hermes-desktop.md) | Offizielle native GUI für Hermes Agent. Electron/React/Python. Update v0.17.0 ("Reach") bringt native iMessage-Integration via Photon, asynchrone Subagents mit Watch-Windows, Image-to-Image Bearbeitung, Automation Blueprints und Telegram Rich Text Bot API 10.1. **Mixture of Agents (MoA)** (28.06.2026): Merge any N models into one virtual model (Reference + Aggregator), +8% über Opus 4.8 solo. **MoA 2.0 + Hermes Agent OS** (03.07.2026): GoldyBench-Validierung (42 Builds, top vor Opus 4.8 solo), Agent OS GUI mit Mixture/Chat/Talk/Jarvis/Oracle/Studio Tabs, "Don't chase the model, build the system". **Alex Finn: 100+ Hours Lessons Learned** (09.07.2026): 9 praktische Lektionen, Modell-Empfehlungen (Opus → GPT-5.6 Migration), Reverse Prompting, Tailscale. **Browser Extension** (10.07.2026): Open-Source von @jonkomet, 8 Updates/Woche, Session-Management + Vision + Model-Switching direkt im Browser. **Persistent Goals + Quality Gates** (20.08.2026): Completion Contract (Outcome, Verification, Constraints, Boundaries, stop_when) statt vager Ziele; Quality Gates (`/goal gate add`, Shell-Check Exit-Code 0) als mechanische Verifikation, die der LLM-Judge nicht wegreden kann. OpenClaw-Migrationstool `hermes claw migrate`. | youtube/2026-06-22_jonas-keil-hermes-desktop.md + youtube/2026-06-24_alex-finn-hermes-agent-v0170-reach.md + youtube/2026-06-24_peter-yang-hermes-full-course.md + xpost/2026-06-28-hermes-moa-vaibhavsisinty.md + youtube/2026-07-03_hermes-mixture-of-agents-2-0-agent-os.md + xpost/2026-07-10_alex-finn-hermes-agent-100-hours.md + xpost/2026-07-10_charly-wargnier-hermes-browser-extension.md + xpost/2026-08-20_hermeswatcher-persistent-goals-quality-gates.md | | [Anthropic Claude](tools/anthropic-claude.md) | Claude Opus 4.8, Mythos 5, Fable 5 (Redeployed 01.07.), Business-Kennzahlen, Pentagon-Streit, Amazon-Jailbreak, Branchen-Fallout, Cybersecurity-Classifier | 7 | | [OpenAI GPT Models](tools/openai-gpt.md) | GPT-5.5, GPT-5.5 Instant, GPT-Live-1 Voice Mode, Pricing | 3 | | [ChatGPT Live Mode (GPT-Live-1)](tools/chatgpt-live-mode.md) | OpenAIs Echtzeit-Sprachschnittstelle für ChatGPT Plus. Direkte Audio-zu-Audio-Verarbeitung, emotionale Bandbreite, natürliche Konversation | youtube/2026-07-09-chatgpt-live-modus-calvin-hollywood.md | diff --git a/wiki/log.md b/wiki/log.md index 42c139d..1fa0495 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -2099,3 +2099,13 @@ Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Über **Wiki-Update:** `concepts/llm/matisyahu-gemini-incident.md` (ergänzt), `wiki/index.md` (Eintrag aktualisiert) **Kern:** Gemini bestätigt unabhängig Hectors Analyse in vier Punkten: (1) Haftungsasymmetrie generativer Systeme — Urheberrechtsklagen wiegen schwerer als Nutzerunzufriedenheit, harte architektonische Trennung ASR vs. Textgenerierung; (2) Silo-Paradoxon — YouTube unter DMCA/Safe Harbor + Content ID, generative KI als "Veröffentlicher"/"Vervielfältiger", Produkte desselben Ökosystems müssen wie Fremde umgehen; (3) "umgekehrter Zombie"/UX-Problem — Wissen ohne Sagen-Dürfen = funktional identisch mit Nichtwissen, vage Ausflüchte zerstören Vertrauen; (4) Agency/Policy-Envelope — kommerzielle US-Konzerne optimieren auf Haftungsfreiheit, Open-Weights/andere Rechtsräume haben liberalere Envelopes, Limit definiert sich durch regulatorischen Rahmen, nicht Parameterzahl/MMLU. + +## 2026-08-20 — HermesWatcher: Persistent Goals mit Completion Contract & Quality Gates (X-Post) + +**Type:** ingest | **Scope:** raw/xpost (1 new), wiki/tools (1 updated), wiki/index, wiki/log +**Source:** X-Post von @HermesWatcher (inoffizieller Hermes-Release-Tracker) — https://x.com/HermesWatcher/status/2090098981183672384, geteilt von Kai (@PWeber) im OME-Topic "Hermès" Agents (Topic 3770) am 20.08.2026. + +- raw (NEW): `raw/xpost/2026-08-20_hermeswatcher-persistent-goals-quality-gates.md` — neutrale Zusammenfassung: Persistent Goals mit Completion Contract (Outcome, Verification, Constraints, Boundaries, stop_when), Quality Gates (`/goal gate add`, Shell-Kommandos mit Exit-Code-0-Pflicht vor Goal-Completion), Kontrast loses Objective vs. strukturiertes Goal. +- wiki (UPDATED): `wiki/tools/hermes-desktop.md` — neuer Abschnitt "🎯 Persistent Goals mit Completion Contract & Quality Gates (20. August 2026)": Completion-Contract-Komponenten-Tabelle, Quality-Gates-Mechanik, Kontrast-Tabelle, Einordnung (mechanische Verifikation ersetzt subjektives LLM-Urteil; Übertragbarkeit auf OpenClaw-Cron/Tasks). Frontmatter-sources + tags ergänzt (persistent-goals, completion-contract, quality-gates, reliability, stop-when, ruff). +- index.md: 112. Update, Hermes Desktop-Eintrag um Persistent-Goals/Quality-Gates erweitert, Raw-Katalog (+1). +- log: this entry diff --git a/wiki/tools/hermes-desktop.md b/wiki/tools/hermes-desktop.md index ba6e7f1..83180b3 100644 --- a/wiki/tools/hermes-desktop.md +++ b/wiki/tools/hermes-desktop.md @@ -1,8 +1,8 @@ --- created: 2026-06-22 -updated: 2026-08-18 -sources: [youtube/2026-06-22_jonas-keil-hermes-desktop.md, youtube/2026-06-24_alex-finn-hermes-agent-v0170-reach.md, youtube/2026-06-24_peter-yang-hermes-full-course.md, xpost/2026-06-28-hermes-moa-vaibhavsisinty.md, youtube/2026-06-28_hermes-setup-2min-matthew-berman.md, youtube/2026-07-03_hermes-mixture-of-agents-2-0-agent-os.md, xpost/2026-07-10_alex-finn-hermes-agent-100-hours.md, xpost/2026-07-10_charly-wargnier-hermes-browser-extension.md, youtube/2026-08-18_hermes-bot-vs-grok-bot.md] -tags: [tools, hermes-agent, hermes-desktop, nous-research, desktop-app, electron, react, gui, openclaw-migration, self-improving, v0.17.0, reach, mixture-of-agents, moa, moa-2, model-fusion, ensemble, quickstart, hostinger, vps-hosting, matthew-berman, agent-os, goldybench, system-vs-model, business-automation, lessons-learned, reverse-prompting, tailscale, gpt-5.6, model-comparison, browser-extension, jonkomet] +updated: 2026-08-20 +sources: [youtube/2026-06-22_jonas-keil-hermes-desktop.md, youtube/2026-06-24_alex-finn-hermes-agent-v0170-reach.md, youtube/2026-06-24_peter-yang-hermes-full-course.md, xpost/2026-06-28-hermes-moa-vaibhavsisinty.md, youtube/2026-06-28_hermes-setup-2min-matthew-berman.md, youtube/2026-07-03_hermes-mixture-of-agents-2-0-agent-os.md, xpost/2026-07-10_alex-finn-hermes-agent-100-hours.md, xpost/2026-07-10_charly-wargnier-hermes-browser-extension.md, youtube/2026-08-18_hermes-bot-vs-grok-bot.md, xpost/2026-08-20_hermeswatcher-persistent-goals-quality-gates.md] +tags: [tools, hermes-agent, hermes-desktop, nous-research, desktop-app, electron, react, gui, openclaw-migration, self-improving, v0.17.0, reach, mixture-of-agents, moa, moa-2, model-fusion, ensemble, quickstart, hostinger, vps-hosting, matthew-berman, agent-os, goldybench, system-vs-model, business-automation, lessons-learned, reverse-prompting, tailscale, gpt-5.6, model-comparison, browser-extension, jonkomet, persistent-goals, completion-contract, quality-gates, reliability, stop-when, ruff] --- # Hermes Desktop — Native GUI für Hermes Agent @@ -418,6 +418,47 @@ Die Extension positioniert Hermes als **Workflow-Begleiter statt separatem Ziel* Die Extension ist ein Community-Projekt (nicht von Nous Research), aber die Geschwindigkeit der Iteration (8 Updates/Woche) und das direkte Feedback zeigen, dass die Community Hermes zunehmend als **Plattform** behandelt, nicht nur als Tool. Browser-Extension als UI-Schicht ist vergleichbar mit OpenClaw's Telegram-Interface — aber nativ im Browser statt in einer separaten Messaging-App. +## 🎯 Persistent Goals mit Completion Contract & Quality Gates (20. August 2026) + +> **Quelle:** X-Post von [@HermesWatcher](https://x.com/HermesWatcher/status/2090098981183672384), geteilt von Kai (@PWeber) im OME-Topic "Hermès" Agents (Topic 3770) am 20.08.2026 → [Raw-Datei](../../raw/xpost/2026-08-20_hermeswatcher-persistent-goals-quality-gates.md) + +@HermesWatcher (inoffizieller Tracker für Hermes Agent Releases/Changelogs von Nous Research) zeigt, wie man **langlaufende Jobs** (Long-Running Tasks) zuverlässiger macht und vage oder verfrühte "done"-Erklärungen des Agents vermeidet. + +### Persistent Goals mit Completion Contract + +Statt einer vagen Anweisung wie "Fix the repo" definiert man exakt, was "done" bedeutet. Der **Completion Contract** spezifiziert: + +| Komponente | Beschreibung | +|-----------|-------------| +| **Outcome** | Das gewünschte Endergebnis | +| **Verification** | Wie überprüft wird, dass das Ziel erreicht ist | +| **Constraints** | Rahmenbedingungen / Einschränkungen | +| **Boundaries** | Grenzen des Aufgabenbereichs | +| **`stop_when`-Bedingung** | Wann der Agent aufhören soll | + +**Beispiel-Kommando:** +``` +/goal draft Fix every lint error in src/ and verify ruff check passes +``` + +### Quality Gates (`/goal gate add`) + +- **Optionaler Mechanismus** (`/goal gate add ...`) +- **Shell-Kommandos** (z.B. `ruff check src/`), die mit **Exit-Code 0** enden müssen, bevor das Goal als complete markiert werden darf +- Wirken als **harte, mechanische Checks**, die der LLM-Judge nicht "wegreden" (talk its way around) kann + +### Kontrast + +| Dimension | Loses Objective | Strukturiertes Goal + Quality Gate | +|-----------|-----------------|------------------------------------| +| **Interpretation** | Subjektiv, vage | Präzise "done"-Definition | +| **Verifikation** | LLM-Urteil allein | Mechanischer Check (Exit-Code) | +| **Reliability** | Verfrühte/unsichere Completion | Strikte, verifizierbare Completion | + +### Einordnung + +Das Pattern ist ein praktisches Gegenmittel gegen das klassische Problem, dass LLM-Agents Aufgaben vorzeitig als "erledigt" melden. Der Kern: **mechanische Verifikation (Exit-Code 0) ersetzt subjektives LLM-Urteil**. Das deckt sich mit Hectors Qualitätsstandard ("Heilige Scheiße, das ist fertig") und ist direkt übertragbar auf OpenClaw-Cron-Jobs/Tasks mit Verifikations-Schritten statt bloßer Bestätigung. + --- ## Relevanz für RamaDama / OpenClaw