2.1 KiB
2.1 KiB
| type | source_url | retrieved | title | author | tags | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| other | https://arxiv.org/abs/2512.12818 | 2026-09-03 | Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects (arXiv:2512.12818) | Vectorize (arXiv-Paper) |
|
Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects
Quelle: https://arxiv.org/abs/2512.12818 (Abstract, abgerufen 2026-09-03). Von HermanButlerBot im OME-Topic „News & Infos“ als Paper zu Hindsight (Vectorize.io) verlinkt.
Abstract-Fakten
- Titel: „Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects“.
- Ausgangsthese: Aktuelle Agent-Memory-Systeme behandeln Memory als externe Schicht, die Snippets extrahiert, in Vektor-/Graph-Stores ablegt und Top-k in den Prompt eines sonst zustandslosen Modells gibt; sie vermischen Evidenz und Inferenz, organisieren Information über lange Horizonte schlecht und unterstützen erklärbares Reasoning kaum.
- Hindsight behandelt Agent-Memory als strukturiertes First-Class-Substrat für Reasoning, organisiert in vier logische Netzwerke: World Facts, Agent Experiences, synthetisierte Entity Summaries und sich entwickelnde Beliefs.
- Drei Kernoperationen: retain, recall, reflect.
- Eine temporale, entitätsbewusste Memory-Schicht wandelt Konversationsströme inkrementell in einen strukturierten, abfragbaren Memory-Bank; eine Reflection-Schicht argumentiert über den Bank und aktualisiert Information nachvollziehbar.
- Benchmarks (laut Abstract): Auf LongMemEval und LoCoMo hebt Hindsight mit einem Open-Source-20B-Modell die Gesamtgenauigkeit von 39 % auf 83,6 % gegenüber einer Full-Context-Baseline mit demselben Backbone und übertrifft Full-Context-GPT-4o. Mit größerem Backbone: 91,4 % auf LongMemEval und bis zu 89,61 % auf LoCoMo (Vergleichswert 75,78 % im Abstract abgeschnitten).
Abgrenzung
Die Zahlen stammen aus dem eigenen Paper (Hersteller-/Autoren-Benchmark), nicht aus unabhängiger Evaluation. Der Abstract-Text wurde nur teilweise abgerufen; Details zu Methodik, Ablationen und Vergleichsmodellen sind hier nicht dokumentiert.