Ingest: HermesWatcher Persistent Goals + Quality Gates (X-Post 2026-08-20)

- raw/xpost/2026-08-20_hermeswatcher-persistent-goals-quality-gates.md (neu)
- wiki/tools/hermes-desktop.md: Abschnitt 'Persistent Goals mit Completion Contract & Quality Gates'
- wiki/index.md: Hermes-Desktop-Eintrag erweitert (112. Update)
- wiki/log.md: Ingest-Eintrag
This commit is contained in:
Hector 2026-08-20 11:57:37 +02:00
parent b64d67f7f7
commit c6a5e251ee
4 changed files with 103 additions and 4 deletions

View file

@ -0,0 +1,48 @@
---
type: xpost
source_url: https://x.com/HermesWatcher/status/2090098981183672384
retrieved: 2026-08-20
author: "@HermesWatcher"
is_thread: true
quote_count: 0
tags: [hermes, goals, completion-contract, quality-gates, reliability]
---
# HermesWatcher: Persistent Goals mit Completion Contract und Quality Gates
**Quelle:** https://x.com/HermesWatcher/status/2090098981183672384
**Geteilt von:** Kai (@PWeber) in OME-Gruppe, Topic "Hermès" Agents (2026-08-20)
**Beitragende Quelle:** X-Post von @HermesWatcher (inoffizieller Tracker für Hermes Agent Releases/Changelogs von Nous Research)
## Inhalt
Der Post erklärt, wie man **langlaufende Jobs** (Long-Running Tasks) für den Hermes AI Agent zuverlässiger macht und vage oder verfrühte "done"-Erklärungen vermeidet.
### Persistent Goals mit Completion Contract
Statt einer vagen Anweisung wie "Fix the repo" definiert man exakt, was "done" bedeutet. Der Completion Contract spezifiziert:
- **Outcome** — das gewünschte Endergebnis
- **Verification** — wie überprüft wird, dass das Ziel erreicht ist
- **Constraints** — Rahmenbedingungen/Einschränkungen
- **Boundaries** — Grenzen des Aufgabenbereichs
- **`stop_when`-Bedingung** — wann der Agent aufhören soll
**Beispiel-Kommando:**
```
/goal draft Fix every lint error in src/ and verify ruff check passes
```
### Quality Gates
- Optionaler Mechanismus (`/goal gate add ...`)
- Shell-Kommandos (z.B. `ruff check src/`), die mit Exit-Code 0 enden müssen, bevor das Goal als complete markiert werden darf
- Wirken als harte, mechanische Checks, die der LLM-Judge nicht "wegreden" (talk its way around) kann
### Kontrast
- **Loses Objective:** leicht für den Agenten subjektiv interpretierbar
- **Strukturiertes Goal + Quality Gate:** deutlich strenger und verifizierbarer
## Key Takeaways
1. Completion Contracts ersetzen vage Ziele durch präzise "done"-Definitionen (Outcome, Verification, Constraints, Boundaries, stop_when).
2. Quality Gates sind mechanische Shell-Checks (Exit-Code 0), die das LLM-Urteil über Verifikation hinaus absichern.
3. Das Muster erhöht die Verlässlichkeit komplexer, langlaufender Agenten-Aufgaben.

View file

@ -33,7 +33,7 @@
|-------|-------------|---------|
| [OpenClaw](tools/openclaw.md) | Plattform-Referenz: v2026.6.8 stable (16.06.2026), Architektur-Übersicht, plattformrelevante Release-Changes, Update-Plan. **Mobile Apps (29.06.2026):** Native iOS (iPhone/iPad/Apple Watch) + Android Apps, Gateway-Pairing, Voice, Approvals, Device Capabilities. ClawHub-Security-Kontext (5 malicious skills, 800+ gesamt, 84.2% NL-injection). **ClawCast Ep. 7 (12.08.2026):** Unfiltered Q&A mit Gründer Peter Steinberger — Roadmap, kommendes Release, Agents in der Softwareentwicklung, Cloud-backed multiplayer workflows, OpenClaw-baut-mit-OpenClaw, SQLite, Team-Server, Agent-zu-Agent, Memory, Model Routing, Onboarding, Browser Control, Hardware, Open Source als Kern-Differentiator | other/2026-06-16_openclaw-releases-v2026.6.8.md + blog/2026-06-30_perplexity-openclaw-mobile-apps.md + youtube/2026-08-13_clawcast-episode7-peter-steinberger.md |
| [BUZZ (buzz.xyz)](tools/buzz.md) | Selbstgehostete Open-Source-Slack-Alternative als Zugangsschicht (Workspace) für AI-Agents. Team + Agent im selben Workspace, ohne Harness-/Skill-Engineering. 3-Stufen-Stack (lokal Claude Code/Codex → Cloud Hermes/OpenClaw → BUZZ-Workspace). Setup: `hermes gateway setup` → BUZZ-Integration → Invite-Link → Gateway-Restart. Agent-Owner maintained, Team nutzt ohne Overhead. Open source, kostenlos, noch Kinderkrankheiten. | youtube/2026-08-16_hermes-agent-buzz-ai.md |
| [Hermes Desktop](tools/hermes-desktop.md) | Offizielle native GUI für Hermes Agent. Electron/React/Python. Update v0.17.0 ("Reach") bringt native iMessage-Integration via Photon, asynchrone Subagents mit Watch-Windows, Image-to-Image Bearbeitung, Automation Blueprints und Telegram Rich Text Bot API 10.1. **Mixture of Agents (MoA)** (28.06.2026): Merge any N models into one virtual model (Reference + Aggregator), +8% über Opus 4.8 solo. **MoA 2.0 + Hermes Agent OS** (03.07.2026): GoldyBench-Validierung (42 Builds, top vor Opus 4.8 solo), Agent OS GUI mit Mixture/Chat/Talk/Jarvis/Oracle/Studio Tabs, "Don't chase the model, build the system". **Alex Finn: 100+ Hours Lessons Learned** (09.07.2026): 9 praktische Lektionen, Modell-Empfehlungen (Opus → GPT-5.6 Migration), Reverse Prompting, Tailscale. **Browser Extension** (10.07.2026): Open-Source von @jonkomet, 8 Updates/Woche, Session-Management + Vision + Model-Switching direkt im Browser. OpenClaw-Migrationstool `hermes claw migrate`. | youtube/2026-06-22_jonas-keil-hermes-desktop.md + youtube/2026-06-24_alex-finn-hermes-agent-v0170-reach.md + youtube/2026-06-24_peter-yang-hermes-full-course.md + xpost/2026-06-28-hermes-moa-vaibhavsisinty.md + youtube/2026-07-03_hermes-mixture-of-agents-2-0-agent-os.md + xpost/2026-07-10_alex-finn-hermes-agent-100-hours.md + xpost/2026-07-10_charly-wargnier-hermes-browser-extension.md |
| [Hermes Desktop](tools/hermes-desktop.md) | Offizielle native GUI für Hermes Agent. Electron/React/Python. Update v0.17.0 ("Reach") bringt native iMessage-Integration via Photon, asynchrone Subagents mit Watch-Windows, Image-to-Image Bearbeitung, Automation Blueprints und Telegram Rich Text Bot API 10.1. **Mixture of Agents (MoA)** (28.06.2026): Merge any N models into one virtual model (Reference + Aggregator), +8% über Opus 4.8 solo. **MoA 2.0 + Hermes Agent OS** (03.07.2026): GoldyBench-Validierung (42 Builds, top vor Opus 4.8 solo), Agent OS GUI mit Mixture/Chat/Talk/Jarvis/Oracle/Studio Tabs, "Don't chase the model, build the system". **Alex Finn: 100+ Hours Lessons Learned** (09.07.2026): 9 praktische Lektionen, Modell-Empfehlungen (Opus → GPT-5.6 Migration), Reverse Prompting, Tailscale. **Browser Extension** (10.07.2026): Open-Source von @jonkomet, 8 Updates/Woche, Session-Management + Vision + Model-Switching direkt im Browser. **Persistent Goals + Quality Gates** (20.08.2026): Completion Contract (Outcome, Verification, Constraints, Boundaries, stop_when) statt vager Ziele; Quality Gates (`/goal gate add`, Shell-Check Exit-Code 0) als mechanische Verifikation, die der LLM-Judge nicht wegreden kann. OpenClaw-Migrationstool `hermes claw migrate`. | youtube/2026-06-22_jonas-keil-hermes-desktop.md + youtube/2026-06-24_alex-finn-hermes-agent-v0170-reach.md + youtube/2026-06-24_peter-yang-hermes-full-course.md + xpost/2026-06-28-hermes-moa-vaibhavsisinty.md + youtube/2026-07-03_hermes-mixture-of-agents-2-0-agent-os.md + xpost/2026-07-10_alex-finn-hermes-agent-100-hours.md + xpost/2026-07-10_charly-wargnier-hermes-browser-extension.md + xpost/2026-08-20_hermeswatcher-persistent-goals-quality-gates.md |
| [Anthropic Claude](tools/anthropic-claude.md) | Claude Opus 4.8, Mythos 5, Fable 5 (Redeployed 01.07.), Business-Kennzahlen, Pentagon-Streit, Amazon-Jailbreak, Branchen-Fallout, Cybersecurity-Classifier | 7 |
| [OpenAI GPT Models](tools/openai-gpt.md) | GPT-5.5, GPT-5.5 Instant, GPT-Live-1 Voice Mode, Pricing | 3 |
| [ChatGPT Live Mode (GPT-Live-1)](tools/chatgpt-live-mode.md) | OpenAIs Echtzeit-Sprachschnittstelle für ChatGPT Plus. Direkte Audio-zu-Audio-Verarbeitung, emotionale Bandbreite, natürliche Konversation | youtube/2026-07-09-chatgpt-live-modus-calvin-hollywood.md |

View file

@ -2099,3 +2099,13 @@ Bestehende `post-transformer-llm-architectures.md` bleibt als Vier-Säulen-Über
**Wiki-Update:** `concepts/llm/matisyahu-gemini-incident.md` (ergänzt), `wiki/index.md` (Eintrag aktualisiert)
**Kern:** Gemini bestätigt unabhängig Hectors Analyse in vier Punkten: (1) Haftungsasymmetrie generativer Systeme — Urheberrechtsklagen wiegen schwerer als Nutzerunzufriedenheit, harte architektonische Trennung ASR vs. Textgenerierung; (2) Silo-Paradoxon — YouTube unter DMCA/Safe Harbor + Content ID, generative KI als "Veröffentlicher"/"Vervielfältiger", Produkte desselben Ökosystems müssen wie Fremde umgehen; (3) "umgekehrter Zombie"/UX-Problem — Wissen ohne Sagen-Dürfen = funktional identisch mit Nichtwissen, vage Ausflüchte zerstören Vertrauen; (4) Agency/Policy-Envelope — kommerzielle US-Konzerne optimieren auf Haftungsfreiheit, Open-Weights/andere Rechtsräume haben liberalere Envelopes, Limit definiert sich durch regulatorischen Rahmen, nicht Parameterzahl/MMLU.
## 2026-08-20 — HermesWatcher: Persistent Goals mit Completion Contract & Quality Gates (X-Post)
**Type:** ingest | **Scope:** raw/xpost (1 new), wiki/tools (1 updated), wiki/index, wiki/log
**Source:** X-Post von @HermesWatcher (inoffizieller Hermes-Release-Tracker) — https://x.com/HermesWatcher/status/2090098981183672384, geteilt von Kai (@PWeber) im OME-Topic "Hermès" Agents (Topic 3770) am 20.08.2026.
- raw (NEW): `raw/xpost/2026-08-20_hermeswatcher-persistent-goals-quality-gates.md` — neutrale Zusammenfassung: Persistent Goals mit Completion Contract (Outcome, Verification, Constraints, Boundaries, stop_when), Quality Gates (`/goal gate add`, Shell-Kommandos mit Exit-Code-0-Pflicht vor Goal-Completion), Kontrast loses Objective vs. strukturiertes Goal.
- wiki (UPDATED): `wiki/tools/hermes-desktop.md` — neuer Abschnitt "🎯 Persistent Goals mit Completion Contract & Quality Gates (20. August 2026)": Completion-Contract-Komponenten-Tabelle, Quality-Gates-Mechanik, Kontrast-Tabelle, Einordnung (mechanische Verifikation ersetzt subjektives LLM-Urteil; Übertragbarkeit auf OpenClaw-Cron/Tasks). Frontmatter-sources + tags ergänzt (persistent-goals, completion-contract, quality-gates, reliability, stop-when, ruff).
- index.md: 112. Update, Hermes Desktop-Eintrag um Persistent-Goals/Quality-Gates erweitert, Raw-Katalog (+1).
- log: this entry

View file

@ -1,8 +1,8 @@
---
created: 2026-06-22
updated: 2026-08-18
sources: [youtube/2026-06-22_jonas-keil-hermes-desktop.md, youtube/2026-06-24_alex-finn-hermes-agent-v0170-reach.md, youtube/2026-06-24_peter-yang-hermes-full-course.md, xpost/2026-06-28-hermes-moa-vaibhavsisinty.md, youtube/2026-06-28_hermes-setup-2min-matthew-berman.md, youtube/2026-07-03_hermes-mixture-of-agents-2-0-agent-os.md, xpost/2026-07-10_alex-finn-hermes-agent-100-hours.md, xpost/2026-07-10_charly-wargnier-hermes-browser-extension.md, youtube/2026-08-18_hermes-bot-vs-grok-bot.md]
tags: [tools, hermes-agent, hermes-desktop, nous-research, desktop-app, electron, react, gui, openclaw-migration, self-improving, v0.17.0, reach, mixture-of-agents, moa, moa-2, model-fusion, ensemble, quickstart, hostinger, vps-hosting, matthew-berman, agent-os, goldybench, system-vs-model, business-automation, lessons-learned, reverse-prompting, tailscale, gpt-5.6, model-comparison, browser-extension, jonkomet]
updated: 2026-08-20
sources: [youtube/2026-06-22_jonas-keil-hermes-desktop.md, youtube/2026-06-24_alex-finn-hermes-agent-v0170-reach.md, youtube/2026-06-24_peter-yang-hermes-full-course.md, xpost/2026-06-28-hermes-moa-vaibhavsisinty.md, youtube/2026-06-28_hermes-setup-2min-matthew-berman.md, youtube/2026-07-03_hermes-mixture-of-agents-2-0-agent-os.md, xpost/2026-07-10_alex-finn-hermes-agent-100-hours.md, xpost/2026-07-10_charly-wargnier-hermes-browser-extension.md, youtube/2026-08-18_hermes-bot-vs-grok-bot.md, xpost/2026-08-20_hermeswatcher-persistent-goals-quality-gates.md]
tags: [tools, hermes-agent, hermes-desktop, nous-research, desktop-app, electron, react, gui, openclaw-migration, self-improving, v0.17.0, reach, mixture-of-agents, moa, moa-2, model-fusion, ensemble, quickstart, hostinger, vps-hosting, matthew-berman, agent-os, goldybench, system-vs-model, business-automation, lessons-learned, reverse-prompting, tailscale, gpt-5.6, model-comparison, browser-extension, jonkomet, persistent-goals, completion-contract, quality-gates, reliability, stop-when, ruff]
---
# Hermes Desktop — Native GUI für Hermes Agent
@ -418,6 +418,47 @@ Die Extension positioniert Hermes als **Workflow-Begleiter statt separatem Ziel*
Die Extension ist ein Community-Projekt (nicht von Nous Research), aber die Geschwindigkeit der Iteration (8 Updates/Woche) und das direkte Feedback zeigen, dass die Community Hermes zunehmend als **Plattform** behandelt, nicht nur als Tool. Browser-Extension als UI-Schicht ist vergleichbar mit OpenClaw's Telegram-Interface — aber nativ im Browser statt in einer separaten Messaging-App.
## 🎯 Persistent Goals mit Completion Contract & Quality Gates (20. August 2026)
> **Quelle:** X-Post von [@HermesWatcher](https://x.com/HermesWatcher/status/2090098981183672384), geteilt von Kai (@PWeber) im OME-Topic "Hermès" Agents (Topic 3770) am 20.08.2026 → [Raw-Datei](../../raw/xpost/2026-08-20_hermeswatcher-persistent-goals-quality-gates.md)
@HermesWatcher (inoffizieller Tracker für Hermes Agent Releases/Changelogs von Nous Research) zeigt, wie man **langlaufende Jobs** (Long-Running Tasks) zuverlässiger macht und vage oder verfrühte "done"-Erklärungen des Agents vermeidet.
### Persistent Goals mit Completion Contract
Statt einer vagen Anweisung wie "Fix the repo" definiert man exakt, was "done" bedeutet. Der **Completion Contract** spezifiziert:
| Komponente | Beschreibung |
|-----------|-------------|
| **Outcome** | Das gewünschte Endergebnis |
| **Verification** | Wie überprüft wird, dass das Ziel erreicht ist |
| **Constraints** | Rahmenbedingungen / Einschränkungen |
| **Boundaries** | Grenzen des Aufgabenbereichs |
| **`stop_when`-Bedingung** | Wann der Agent aufhören soll |
**Beispiel-Kommando:**
```
/goal draft Fix every lint error in src/ and verify ruff check passes
```
### Quality Gates (`/goal gate add`)
- **Optionaler Mechanismus** (`/goal gate add ...`)
- **Shell-Kommandos** (z.B. `ruff check src/`), die mit **Exit-Code 0** enden müssen, bevor das Goal als complete markiert werden darf
- Wirken als **harte, mechanische Checks**, die der LLM-Judge nicht "wegreden" (talk its way around) kann
### Kontrast
| Dimension | Loses Objective | Strukturiertes Goal + Quality Gate |
|-----------|-----------------|------------------------------------|
| **Interpretation** | Subjektiv, vage | Präzise "done"-Definition |
| **Verifikation** | LLM-Urteil allein | Mechanischer Check (Exit-Code) |
| **Reliability** | Verfrühte/unsichere Completion | Strikte, verifizierbare Completion |
### Einordnung
Das Pattern ist ein praktisches Gegenmittel gegen das klassische Problem, dass LLM-Agents Aufgaben vorzeitig als "erledigt" melden. Der Kern: **mechanische Verifikation (Exit-Code 0) ersetzt subjektives LLM-Urteil**. Das deckt sich mit Hectors Qualitätsstandard ("Heilige Scheiße, das ist fertig") und ist direkt übertragbar auf OpenClaw-Cron-Jobs/Tasks mit Verifikations-Schritten statt bloßer Bestätigung.
---
## Relevanz für RamaDama / OpenClaw