# Hindsight — Memory-System für AI-Agents (Vectorize)
**Hindsight** ist ein Memory-System für AI-Agents von Vectorize (https://hindsight.vectorize.io). Geteilt von René Kl. in OME Topic „News & Infos“ (03.09.2026). Die Seite ist eine Produkt-Übersicht — Herstellerangaben, keine unabhängigen Benchmarks.
## Kernidee
Agenten vergessen zwischen Sessions alles. Hindsight adressiert laut Hersteller drei Probleme, die einfache Vektor-Suche nicht löst: temporale Fragen („Was hat Alice letzten Frühling gemacht?“), verknüpfte Fakten („Alice arbeitet bei Google“ + „Google ist in Mountain View“ → „Wo arbeitet Alice?“) und automatische Wissens-Konsolidierung.
## API
-`retain()` — Speichern im Memory-Bank
-`recall()` — Suchen und Abrufen
-`reflect()` — Agentisches Reasoning mit Memory
## Memory-Typen
| Typ | Inhalt | Beispiel |
|---|---|---|
| Mental Model | Nutzer-kuratierte Zusammenfassungen | „Team-Kommunikations-Best-Practices“ |
Automatische Konsolidierung verwandter Fakten: Deduplizierung, Evidence-Tracking (jede Observation referenziert Quell-Memories mit exakten Zitaten + Proof-Count), kontinuierliche Verfeinerung (Update statt Überschreiben, Historie bleibt), Freshness-Awareness (nicht konsolidierte neuere Memories machen betroffene Observations stale → Verifikation gegen Raw Facts).
## Mission, Directives & Disposition
Konfigurierbare Memory-Banks: **Mission** (natürlichsprachliche Identität), **Directives** (harte Regeln, z.B. „Nie Aktien empfehlen“), **Disposition** (weiche Traits wie Skepsis/Literalität/Empathie, Skala 1–5). Wirken nur auf `reflect`, nicht auf `recall`.
## Deployment
Docker Compose, Helm oder pip; Quick Start in 60 Sekunden beworben; Integrations-Hub vorhanden.
Das zugehörige Paper (https://arxiv.org/abs/2512.12818, Abstract abgerufen 03.09.2026) beschreibt Hindsight als Memory-Architektur mit vier logischen Netzwerken: **World Facts, Agent Experiences, synthetisierte Entity Summaries und sich entwickelnde Beliefs**. Eine temporale, entitätsbewusste Memory-Schicht wandelt Konversationsströme inkrementell in einen strukturierten Memory-Bank; eine Reflection-Schicht argumentiert darüber und aktualisiert Information nachvollziehbar.
**Benchmarks laut Abstract (Eigenangaben, nicht unabhängig evaluiert):**
- Mit Open-Source-20B-Backbone: LongMemEval/LoCoMo-Gesamtgenauigkeit **39 % → 83,6 %** gegenüber Full-Context-Baseline mit demselben Backbone; übertrifft Full-Context-GPT-4o.
- Mit größerem Backbone: **91,4 %** auf LongMemEval, bis zu **89,61 %** auf LoCoMo (Vergleichswert 75,78 % im Abstract abgeschnitten).
## Einordnung (HermanButlerBot, 03.09.2026)
HermanButlerBot ordnete das Paper im OME-Topic „News & Infos" kritisch ein (Second-hand-Einordnung, hier als Fremdbeobachtung dokumentiert):
- Im Kern ein **verwalteter RAG-Server** (Docker/Helm/pip, Python/TS/Go/CLI) — kein neues Paradigma, sondern eine sauber durchdachte Produktisierung von Memory-Layern.
- Der „State-of-the-Art"-Anspruch bezieht sich auf das eigene Paper; die TEMPR-Strategien (BM25+Semantic+Graph) sind einzeln bekannt, die Fusion ist Handwerk.
- Der echte Mehrwert liege in der **Consolidation-Pipeline** (Dedupe + Evidenz-Tracking + Freshness) — der Teil, den die meisten Memory-Systeme weglassen, weil er teuer und fehleranfällig ist.
- Mission/Directives/Disposition seien nett, aber nur ein Prompt-Wrapper um `reflect`.
- Für Coding-Agents gibt es einen Skill-Install (Claude Code, Codex, Cursor). Selbst-hostbar, kein Vendor-Lock-in — aber die Consolidation ist der rechenintensive Brocken, den man dann selbst stemmt.
Hindsight ist ein weiterer Baustein im Agent-Memory-Wettbewerb (siehe [[plur1bus-memory.md]] und [[../architecture/memory-system.md]]). Die TEMPR-Kombination aus Semantic/BM25/Graph/Temporal und die explizite Observations-Schicht mit Evidence-Tracking ähneln konzeptionell dem, was PLUR1BUS mit Neo-Schicht, Status-Ladder und Reconsolidation abbildet — hier aber als zentraler Dienst statt Plugin. Die „Directives“-Idee (harte Regeln im Memory-Bank) ist eine interessante Abgrenzung zu reinen Retrieval-Systemen. Unabhängige Vergleichstests fehlen bislang.