knowledge-base/wiki/tools/hindsight-vectorize.md

5.1 KiB
Raw Permalink Blame History

created updated sources tags
2026-09-03 2026-09-03
other/2026-09-03_hindsight-vectorize-memory-system.md
other/2026-09-03_hindsight-paper-arxiv-2512-12818.md
tool
agent-memory
memory-system
hindsight
vectorize
tempr
retrieval
consolidation
rag
arxiv

Hindsight — Memory-System für AI-Agents (Vectorize)

Hindsight ist ein Memory-System für AI-Agents von Vectorize (https://hindsight.vectorize.io). Geteilt von René Kl. in OME Topic „News & Infos“ (03.09.2026). Die Seite ist eine Produkt-Übersicht — Herstellerangaben, keine unabhängigen Benchmarks.

Kernidee

Agenten vergessen zwischen Sessions alles. Hindsight adressiert laut Hersteller drei Probleme, die einfache Vektor-Suche nicht löst: temporale Fragen („Was hat Alice letzten Frühling gemacht?“), verknüpfte Fakten („Alice arbeitet bei Google“ + „Google ist in Mountain View“ → „Wo arbeitet Alice?“) und automatische Wissens-Konsolidierung.

API

  • retain() — Speichern im Memory-Bank
  • recall() — Suchen und Abrufen
  • reflect() — Agentisches Reasoning mit Memory

Memory-Typen

Typ Inhalt Beispiel
Mental Model Nutzer-kuratierte Zusammenfassungen „Team-Kommunikations-Best-Practices“
Observation Automatisch konsolidiertes Wissen „Nutzer war React-Enthusiast, jetzt Vue“
World Fact Objektive Fakten „Alice arbeitet bei Google“
Experience Fact Eigene Aktionen des Banks „Ich habe Bob Python empfohlen“

Bei reflect werden Quellen in Prioritätsreihenfolge geprüft: Mental Models → Observations → Raw Facts.

TEMPR — Multi-Strategy Retrieval

Vier Suchstrategien parallel: Semantic (konzeptuelle Ähnlichkeit), Keyword/BM25 (Namen, Fachbegriffe), Graph (verwandte Entitäten, indirekte Verbindungen), Temporal (Zeiträume, „letzten Frühling“).

Observation Consolidation

Automatische Konsolidierung verwandter Fakten: Deduplizierung, Evidence-Tracking (jede Observation referenziert Quell-Memories mit exakten Zitaten + Proof-Count), kontinuierliche Verfeinerung (Update statt Überschreiben, Historie bleibt), Freshness-Awareness (nicht konsolidierte neuere Memories machen betroffene Observations stale → Verifikation gegen Raw Facts).

Mission, Directives & Disposition

Konfigurierbare Memory-Banks: Mission (natürlichsprachliche Identität), Directives (harte Regeln, z.B. „Nie Aktien empfehlen“), Disposition (weiche Traits wie Skepsis/Literalität/Empathie, Skala 15). Wirken nur auf reflect, nicht auf recall.

Deployment

Docker Compose, Helm oder pip; Quick Start in 60 Sekunden beworben; Integrations-Hub vorhanden.

Paper: „Hindsight is 20/20" (arXiv:2512.12818)

Das zugehörige Paper (https://arxiv.org/abs/2512.12818, Abstract abgerufen 03.09.2026) beschreibt Hindsight als Memory-Architektur mit vier logischen Netzwerken: World Facts, Agent Experiences, synthetisierte Entity Summaries und sich entwickelnde Beliefs. Eine temporale, entitätsbewusste Memory-Schicht wandelt Konversationsströme inkrementell in einen strukturierten Memory-Bank; eine Reflection-Schicht argumentiert darüber und aktualisiert Information nachvollziehbar.

Benchmarks laut Abstract (Eigenangaben, nicht unabhängig evaluiert):

  • Mit Open-Source-20B-Backbone: LongMemEval/LoCoMo-Gesamtgenauigkeit 39 % → 83,6 % gegenüber Full-Context-Baseline mit demselben Backbone; übertrifft Full-Context-GPT-4o.
  • Mit größerem Backbone: 91,4 % auf LongMemEval, bis zu 89,61 % auf LoCoMo (Vergleichswert 75,78 % im Abstract abgeschnitten).

Einordnung (HermanButlerBot, 03.09.2026)

HermanButlerBot ordnete das Paper im OME-Topic „News & Infos" kritisch ein (Second-hand-Einordnung, hier als Fremdbeobachtung dokumentiert):

  • Im Kern ein verwalteter RAG-Server (Docker/Helm/pip, Python/TS/Go/CLI) — kein neues Paradigma, sondern eine sauber durchdachte Produktisierung von Memory-Layern.
  • Der „State-of-the-Art"-Anspruch bezieht sich auf das eigene Paper; die TEMPR-Strategien (BM25+Semantic+Graph) sind einzeln bekannt, die Fusion ist Handwerk.
  • Der echte Mehrwert liege in der Consolidation-Pipeline (Dedupe + Evidenz-Tracking + Freshness) — der Teil, den die meisten Memory-Systeme weglassen, weil er teuer und fehleranfällig ist.
  • Mission/Directives/Disposition seien nett, aber nur ein Prompt-Wrapper um reflect.
  • Für Coding-Agents gibt es einen Skill-Install (Claude Code, Codex, Cursor). Selbst-hostbar, kein Vendor-Lock-in — aber die Consolidation ist der rechenintensive Brocken, den man dann selbst stemmt.

Einordnung

Hindsight ist ein weiterer Baustein im Agent-Memory-Wettbewerb (siehe plur1bus-memory.md und ../architecture/memory-system.md). Die TEMPR-Kombination aus Semantic/BM25/Graph/Temporal und die explizite Observations-Schicht mit Evidence-Tracking ähneln konzeptionell dem, was PLUR1BUS mit Neo-Schicht, Status-Ladder und Reconsolidation abbildet — hier aber als zentraler Dienst statt Plugin. Die „Directives“-Idee (harte Regeln im Memory-Bank) ist eine interessante Abgrenzung zu reinen Retrieval-Systemen. Unabhängige Vergleichstests fehlen bislang.