knowledge-base/wiki/concepts/agents/agent-budget-breaker.md
Hector b395bc8c52 ingest(youtube): Typesafe AI — System One Models & Jev (KI Copium 17.09.2026)
Video: https://www.youtube.com/watch?v=xQtUzjd7-As (AI Copium, 17.09.2026, 14:25).
Erstmals vollstaendiges Transcript (Firecrawl) statt metadata-only.
Primaerquellen: TypeSafe-Ankuendigung (Diogo Almeida, 15.09.) + Every-Test (Mike Taylor, 15.09.).

raw: raw/youtube/2026-09-17_aicopium-typesafe-jev.md (neu),
     raw/blog/2026-09-15_typesafe-system-one-models-jev.md (neu),
     raw/blog/2026-09-15_every-mike-taylor-jev-vibe-check.md (neu),
     raw/blog/2026-09-16_theregister-typesafe-jev-doom.md (neu, Negativbefund)
wiki: concepts/llm/system-one-models-jev.md (neu),
      institutions/typesafe-ai.md (neu), institutions/every.md (neu),
      people/diogo-almeida.md, people/mike-taylor.md, people/dan-shipper.md,
      people/ai-copium.md (alle neu)
      + Cross-Refs in llm-model-catalog, harness-vs-standalone-chat-llm,
        llm-sycophancy-confabulation, agent-budget-breaker,
        harness-loop-graph-engineering
      + index.md (216. Update), log.md
2026-09-17 23:51:03 +02:00

42 lines
3.7 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-08-26
updated: 2026-08-26
sources: [podcast/2026-08-26_openclaw-cast-budget-breaker-transcript.md, podcast/2026-08-26_openclaw-cast-runaway-agent-budget.md]
tags: [concept, agents, budget-guardrails, gateway-enforcement, runaway-spending, openclaw-cast]
---
# Agent Budget Breaker — Guardrails gegen Runaway-Agent-Spending
Das Guardrail-Rezept aus der OpenClaw-Cast-Folge „One Runaway AI Agent Can Spend Past Your Budget" (25.08.2026): ein lokaler Budget-Breaker mit Per-Job-Caps, echtem Kill Switch und Testprotokoll für Agent-Automationen. ⚠️ Grundlage ist die Transcript-Auswertung von @HermanButlerBot (kein Wortlaut-Transcript) — Einzelfakten als Podcast-/Sekundärangabe lesen.
## Das Problem
Die gefährlichste Panne ist nicht der Regelbruch, sondern der Agent, der alle Regeln perfekt befolgt und trotzdem das Budget verbrennt — etwa ein Retry-Loop, der 10.000× die $10-Lizenz zahlt. Laut einer VentureBeat-Pulse-Umfrage unter 107 Unternehmen können 20 % Runaway-Agent-Spending nicht in Echtzeit stoppen; 21 % verlassen sich nur auf reaktives Log-Monitoring („Sicherheitskamera, die den Film wöchentlich entwickelt").
## Die Bausteine
| Baustein | Mechanik |
|---|---|
| Gateway-Enforcement | Limits werden am Gateway erzwungen, nie im Prompt. Prompt-Regel = „Rasen nicht betreten"-Schild; Gateway = Betonmauer |
| Atomic Reservation | Preauth-Ledger vor jedem Call (= Tankstellen-Preauth): geschätzte Kosten werden gesperrt, erst dann verlässt der Request den Server; danach Reconciliation. Nötig, weil externe APIs oft nicht mid-flight abbrechbar sind |
| Lineage-Tracking | Subagenten ziehen aus dem Budget der Parent-Job-ID — sonst bekommt jeder Fan-out frisches Geld |
| Cascading Termination | Parent gestoppt → alle Kinder sofort killen; keine Orphans, die weitergraben |
| Trip-Wires | High Spend, Retry-Sturm, Fan-out > Concurrency, Wall-Time — und der Trigger: fehlende Preis-Metadaten = unbekannter Preis = Breaker tript („Restaurant ohne Preise → rausgehen") |
| Shutdown-Sequenz | Permissions entziehen → Queue canceln → cascading kill → redacted Receipt → menschliche bounded Re-Autorisierung |
## SAFE-Drill — der Abnahmetest
Eine $5-Sandbox mit fünf Szenarien: Normal-Lauf, erzwungener Infinite-Retry, rekursiver Fan-out, Oversized-Context-PDF, fehlendes Pricing. Goldene Regel: Zeigt das Log $6, obwohl das Limit $5 war → Architektur gescheitert. **Logging ≠ Enforcing** — ein Log, das Overshoot nur dokumentiert, ist kein Budget-Breaker.
## Einordnung
- Die Abschlussfrage der Folge — suffocieren mechanische Limits Autonomie? — beantwortet die Auswertung mit Nein, solange Limits pro Job granular sind. Das ist der Unterschied zwischen Minions-/Gateway-Design und naiver API-Nutzung.
- Hochrelevant für Setup mit Cron-Jobs, Subconscious-Runs und Subagent-Fan-outs ([[subconscious-agent.md]]): genau dort laufen unattended Spend-Schleifen.
- Geschwister-Patterns aus derselben Serie: Task Lease Guard (Multi-Agent-Turf-Wars), Release-Sentinel-Canary, Cadence Guard — siehe [[../../institutions/openclaw-cast.md]].
- **Ergänzung 17.09.2026:** [[../llm/system-one-models-jev.md|Jev (TypeSafe AI)]] verschiebt die Rechnung auf der anderen Seite — Entscheidungs-Urteile für $0,042/MTok Input und $0 Output. Wenn Prüf-Calls praktisch nichts kosten, steigt die Zahl der Calls pro Lauf; ein mechanischer Deckel wird dadurch **wichtiger**, nicht weniger wichtig.
## Quellen
- Transcript-Auswertung: [[../../../raw/podcast/2026-08-26_openclaw-cast-budget-breaker-transcript.md]]
- Metadata-Raw: [[../../../raw/podcast/2026-08-26_openclaw-cast-runaway-agent-budget.md]]
- Episode (Audio): https://anchor.fm/s/10f77d9e4/podcast/play/124706068/