26 lines
2.1 KiB
Markdown
26 lines
2.1 KiB
Markdown
|
|
---
|
||
|
|
type: other
|
||
|
|
source_url: https://arxiv.org/abs/2512.12818
|
||
|
|
retrieved: 2026-09-03
|
||
|
|
title: "Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects (arXiv:2512.12818)"
|
||
|
|
author: "Vectorize (arXiv-Paper)"
|
||
|
|
tags: [agent-memory, memory-system, hindsight, vectorize, arxiv, tempr, longmemeval, locomo, benchmarks]
|
||
|
|
---
|
||
|
|
|
||
|
|
# Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects
|
||
|
|
|
||
|
|
Quelle: https://arxiv.org/abs/2512.12818 (Abstract, abgerufen 2026-09-03). Von HermanButlerBot im OME-Topic „News & Infos“ als Paper zu Hindsight (Vectorize.io) verlinkt.
|
||
|
|
|
||
|
|
## Abstract-Fakten
|
||
|
|
|
||
|
|
- Titel: „Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects“.
|
||
|
|
- Ausgangsthese: Aktuelle Agent-Memory-Systeme behandeln Memory als externe Schicht, die Snippets extrahiert, in Vektor-/Graph-Stores ablegt und Top-k in den Prompt eines sonst zustandslosen Modells gibt; sie vermischen Evidenz und Inferenz, organisieren Information über lange Horizonte schlecht und unterstützen erklärbares Reasoning kaum.
|
||
|
|
- Hindsight behandelt Agent-Memory als strukturiertes First-Class-Substrat für Reasoning, organisiert in vier logische Netzwerke: World Facts, Agent Experiences, synthetisierte Entity Summaries und sich entwickelnde Beliefs.
|
||
|
|
- Drei Kernoperationen: retain, recall, reflect.
|
||
|
|
- Eine temporale, entitätsbewusste Memory-Schicht wandelt Konversationsströme inkrementell in einen strukturierten, abfragbaren Memory-Bank; eine Reflection-Schicht argumentiert über den Bank und aktualisiert Information nachvollziehbar.
|
||
|
|
- Benchmarks (laut Abstract): Auf LongMemEval und LoCoMo hebt Hindsight mit einem Open-Source-20B-Modell die Gesamtgenauigkeit von 39 % auf 83,6 % gegenüber einer Full-Context-Baseline mit demselben Backbone und übertrifft Full-Context-GPT-4o. Mit größerem Backbone: 91,4 % auf LongMemEval und bis zu 89,61 % auf LoCoMo (Vergleichswert 75,78 % im Abstract abgeschnitten).
|
||
|
|
|
||
|
|
## Abgrenzung
|
||
|
|
|
||
|
|
Die Zahlen stammen aus dem eigenen Paper (Hersteller-/Autoren-Benchmark), nicht aus unabhängiger Evaluation. Der Abstract-Text wurde nur teilweise abgerufen; Details zu Methodik, Ablationen und Vergleichsmodellen sind hier nicht dokumentiert.
|