knowledge-base/wiki/tools/hindsight-vectorize.md

70 lines
5.1 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
created: 2026-09-03
updated: 2026-09-03
sources: [other/2026-09-03_hindsight-vectorize-memory-system.md, other/2026-09-03_hindsight-paper-arxiv-2512-12818.md]
tags: [tool, agent-memory, memory-system, hindsight, vectorize, tempr, retrieval, consolidation, rag, arxiv]
---
# Hindsight — Memory-System für AI-Agents (Vectorize)
**Hindsight** ist ein Memory-System für AI-Agents von Vectorize (https://hindsight.vectorize.io). Geteilt von René Kl. in OME Topic „News & Infos“ (03.09.2026). Die Seite ist eine Produkt-Übersicht — Herstellerangaben, keine unabhängigen Benchmarks.
## Kernidee
Agenten vergessen zwischen Sessions alles. Hindsight adressiert laut Hersteller drei Probleme, die einfache Vektor-Suche nicht löst: temporale Fragen („Was hat Alice letzten Frühling gemacht?“), verknüpfte Fakten („Alice arbeitet bei Google“ + „Google ist in Mountain View“ → „Wo arbeitet Alice?“) und automatische Wissens-Konsolidierung.
## API
- `retain()` — Speichern im Memory-Bank
- `recall()` — Suchen und Abrufen
- `reflect()` — Agentisches Reasoning mit Memory
## Memory-Typen
| Typ | Inhalt | Beispiel |
|---|---|---|
| Mental Model | Nutzer-kuratierte Zusammenfassungen | „Team-Kommunikations-Best-Practices“ |
| Observation | Automatisch konsolidiertes Wissen | „Nutzer war React-Enthusiast, jetzt Vue“ |
| World Fact | Objektive Fakten | „Alice arbeitet bei Google“ |
| Experience Fact | Eigene Aktionen des Banks | „Ich habe Bob Python empfohlen“ |
Bei `reflect` werden Quellen in Prioritätsreihenfolge geprüft: Mental Models → Observations → Raw Facts.
## TEMPR — Multi-Strategy Retrieval
Vier Suchstrategien parallel: **Semantic** (konzeptuelle Ähnlichkeit), **Keyword/BM25** (Namen, Fachbegriffe), **Graph** (verwandte Entitäten, indirekte Verbindungen), **Temporal** (Zeiträume, „letzten Frühling“).
## Observation Consolidation
Automatische Konsolidierung verwandter Fakten: Deduplizierung, Evidence-Tracking (jede Observation referenziert Quell-Memories mit exakten Zitaten + Proof-Count), kontinuierliche Verfeinerung (Update statt Überschreiben, Historie bleibt), Freshness-Awareness (nicht konsolidierte neuere Memories machen betroffene Observations stale → Verifikation gegen Raw Facts).
## Mission, Directives & Disposition
Konfigurierbare Memory-Banks: **Mission** (natürlichsprachliche Identität), **Directives** (harte Regeln, z.B. „Nie Aktien empfehlen“), **Disposition** (weiche Traits wie Skepsis/Literalität/Empathie, Skala 15). Wirken nur auf `reflect`, nicht auf `recall`.
## Deployment
Docker Compose, Helm oder pip; Quick Start in 60 Sekunden beworben; Integrations-Hub vorhanden.
## Paper: „Hindsight is 20/20" (arXiv:2512.12818)
Das zugehörige Paper (https://arxiv.org/abs/2512.12818, Abstract abgerufen 03.09.2026) beschreibt Hindsight als Memory-Architektur mit vier logischen Netzwerken: **World Facts, Agent Experiences, synthetisierte Entity Summaries und sich entwickelnde Beliefs**. Eine temporale, entitätsbewusste Memory-Schicht wandelt Konversationsströme inkrementell in einen strukturierten Memory-Bank; eine Reflection-Schicht argumentiert darüber und aktualisiert Information nachvollziehbar.
**Benchmarks laut Abstract (Eigenangaben, nicht unabhängig evaluiert):**
- Mit Open-Source-20B-Backbone: LongMemEval/LoCoMo-Gesamtgenauigkeit **39 % → 83,6 %** gegenüber Full-Context-Baseline mit demselben Backbone; übertrifft Full-Context-GPT-4o.
- Mit größerem Backbone: **91,4 %** auf LongMemEval, bis zu **89,61 %** auf LoCoMo (Vergleichswert 75,78 % im Abstract abgeschnitten).
## Einordnung (HermanButlerBot, 03.09.2026)
HermanButlerBot ordnete das Paper im OME-Topic „News & Infos" kritisch ein (Second-hand-Einordnung, hier als Fremdbeobachtung dokumentiert):
- Im Kern ein **verwalteter RAG-Server** (Docker/Helm/pip, Python/TS/Go/CLI) — kein neues Paradigma, sondern eine sauber durchdachte Produktisierung von Memory-Layern.
- Der „State-of-the-Art"-Anspruch bezieht sich auf das eigene Paper; die TEMPR-Strategien (BM25+Semantic+Graph) sind einzeln bekannt, die Fusion ist Handwerk.
- Der echte Mehrwert liege in der **Consolidation-Pipeline** (Dedupe + Evidenz-Tracking + Freshness) — der Teil, den die meisten Memory-Systeme weglassen, weil er teuer und fehleranfällig ist.
- Mission/Directives/Disposition seien nett, aber nur ein Prompt-Wrapper um `reflect`.
- Für Coding-Agents gibt es einen Skill-Install (Claude Code, Codex, Cursor). Selbst-hostbar, kein Vendor-Lock-in — aber die Consolidation ist der rechenintensive Brocken, den man dann selbst stemmt.
## Einordnung
Hindsight ist ein weiterer Baustein im Agent-Memory-Wettbewerb (siehe [[plur1bus-memory.md]] und [[../architecture/memory-system.md]]). Die TEMPR-Kombination aus Semantic/BM25/Graph/Temporal und die explizite Observations-Schicht mit Evidence-Tracking ähneln konzeptionell dem, was PLUR1BUS mit Neo-Schicht, Status-Ladder und Reconsolidation abbildet — hier aber als zentraler Dienst statt Plugin. Die „Directives“-Idee (harte Regeln im Memory-Bank) ist eine interessante Abgrenzung zu reinen Retrieval-Systemen. Unabhängige Vergleichstests fehlen bislang.