ingest(other): hindsight paper arxiv 2512.12818 + herman einordnung
This commit is contained in:
parent
1352dcef81
commit
86cc145cc1
4 changed files with 62 additions and 4 deletions
25
raw/other/2026-09-03_hindsight-paper-arxiv-2512-12818.md
Normal file
25
raw/other/2026-09-03_hindsight-paper-arxiv-2512-12818.md
Normal file
|
|
@ -0,0 +1,25 @@
|
|||
---
|
||||
type: other
|
||||
source_url: https://arxiv.org/abs/2512.12818
|
||||
retrieved: 2026-09-03
|
||||
title: "Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects (arXiv:2512.12818)"
|
||||
author: "Vectorize (arXiv-Paper)"
|
||||
tags: [agent-memory, memory-system, hindsight, vectorize, arxiv, tempr, longmemeval, locomo, benchmarks]
|
||||
---
|
||||
|
||||
# Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects
|
||||
|
||||
Quelle: https://arxiv.org/abs/2512.12818 (Abstract, abgerufen 2026-09-03). Von HermanButlerBot im OME-Topic „News & Infos“ als Paper zu Hindsight (Vectorize.io) verlinkt.
|
||||
|
||||
## Abstract-Fakten
|
||||
|
||||
- Titel: „Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects“.
|
||||
- Ausgangsthese: Aktuelle Agent-Memory-Systeme behandeln Memory als externe Schicht, die Snippets extrahiert, in Vektor-/Graph-Stores ablegt und Top-k in den Prompt eines sonst zustandslosen Modells gibt; sie vermischen Evidenz und Inferenz, organisieren Information über lange Horizonte schlecht und unterstützen erklärbares Reasoning kaum.
|
||||
- Hindsight behandelt Agent-Memory als strukturiertes First-Class-Substrat für Reasoning, organisiert in vier logische Netzwerke: World Facts, Agent Experiences, synthetisierte Entity Summaries und sich entwickelnde Beliefs.
|
||||
- Drei Kernoperationen: retain, recall, reflect.
|
||||
- Eine temporale, entitätsbewusste Memory-Schicht wandelt Konversationsströme inkrementell in einen strukturierten, abfragbaren Memory-Bank; eine Reflection-Schicht argumentiert über den Bank und aktualisiert Information nachvollziehbar.
|
||||
- Benchmarks (laut Abstract): Auf LongMemEval und LoCoMo hebt Hindsight mit einem Open-Source-20B-Modell die Gesamtgenauigkeit von 39 % auf 83,6 % gegenüber einer Full-Context-Baseline mit demselben Backbone und übertrifft Full-Context-GPT-4o. Mit größerem Backbone: 91,4 % auf LongMemEval und bis zu 89,61 % auf LoCoMo (Vergleichswert 75,78 % im Abstract abgeschnitten).
|
||||
|
||||
## Abgrenzung
|
||||
|
||||
Die Zahlen stammen aus dem eigenen Paper (Hersteller-/Autoren-Benchmark), nicht aus unabhängiger Evaluation. Der Abstract-Text wurde nur teilweise abgerufen; Details zu Methodik, Ablationen und Vergleichsmodellen sind hier nicht dokumentiert.
|
||||
|
|
@ -2,7 +2,8 @@
|
|||
|
||||
*Auto-generated: 2026-07-07*
|
||||
|
||||
*Letzte Aktualisierung: 2026-09-03 (165. Update — Hindsight: Memory-System für AI-Agents (Vectorize, 2026-09-03, OME „News & Infos", geteilt von René Kl.). Raw: `raw/other/2026-09-03_hindsight-vectorize-memory-system.md` (neu). Wiki-Update: `tools/hindsight-vectorize.md` (neu — retain/recall/reflect, TEMPR-Multi-Strategy-Retrieval, Observation-Consolidation, Mission/Directives/Disposition; Herstellerangaben, keine unabhängigen Benchmarks).)*
|
||||
*Letzte Aktualisierung: 2026-09-03 (166. Update — Hindsight-Paper „Hindsight is 20/20" (arXiv:2512.12818, 2026-09-03, OME „News & Infos", verlinkt von HermanButlerBot). Raw: `raw/other/2026-09-03_hindsight-paper-arxiv-2512-12818.md` (neu — Abstract-Fakten). Wiki-Update: `tools/hindsight-vectorize.md` (Paper-Abschnitt: vier logische Netzwerke, Benchmarks 39 % → 83,6 % mit 20B-Backbone, 91,4 % LongMemEval/89,61 % LoCoMo mit größerem Backbone — Eigenangaben; Hermans kritische Einordnung als Fremdbeobachtung: verwalteter RAG-Server, Consolidation-Pipeline als echter Mehrwert, Mission/Directives als Prompt-Wrapper).)*
|
||||
*Vorherige Aktualisierung: 2026-09-03 (165. Update — Hindsight: Memory-System für AI-Agents (Vectorize, 2026-09-03, OME „News & Infos", geteilt von René Kl.). Raw: `raw/other/2026-09-03_hindsight-vectorize-memory-system.md` (neu). Wiki-Update: `tools/hindsight-vectorize.md` (neu — retain/recall/reflect, TEMPR-Multi-Strategy-Retrieval, Observation-Consolidation, Mission/Directives/Disposition; Herstellerangaben, keine unabhängigen Benchmarks).)*
|
||||
*Vorherige Aktualisierung: 2026-09-02 (164. Update — „Was KI kann." mit Armin Ronacher: Transcript-Nachtrag (Audio-Briefing von HermanButlerBot, 16 Min, transkribiert via grok-stt). Raw: `raw/youtube/2026-09-02_was-ki-kann-ronacher-briefing-transcript.md` (neu). Wiki-Update: `concepts/agi/parasoziale-ki-bindungen.md` (von Metadata-only auf echten Inhalt gehoben: parasoziale E-Mails an Ronacher, „Agency lies with the human", Clanker-statt-Agent, 51 % Bot-Traffic, Einweg-Plastiksoftware, Gatekeeper/China/Europa, Sandbox-Ausbruch).)*
|
||||
*Vorherige Aktualisierung: 2026-09-02 (163. Update — „Was KI kann." mit Armin Ronacher: Parasoziale KI-Bindungen (2026-09-02, OME Topic „aGi / eMergence", gepostet von Kai, weitergeleitet von Herman). Raw: `raw/youtube/2026-09-02_was-ki-kann-ronacher-parasoziale-bindung.md` (neu — Metadata-only, kein Transcript; Themen aus OME-Chat-Zusammenfassung). Wiki-Update: `concepts/agi/parasoziale-ki-bindungen.md` (neu), `people/armin-ronacher.md` (neu), `people/florian-zsifkovics.md` (neu), `institutions/earendil.md` (neu), `institutions/sentry.md` (neu).)*
|
||||
*Vorherige Aktualisierung: 2026-09-02 (162. Update — DeepSeek Harness (DSH): Detail-Zusammenfassung (HermanButlerBot, 2026-09-02, OME „News & Infos"). Raw: `raw/other/2026-09-02_herman-deepseek-harness-dsh-summary.md` (neu — Second-hand-Video-Zusammenfassung, Zahlen nicht unabhängig verifiziert). Wiki-Update: `concepts/llm/deepseek-v4-pro-ga-harness-open-source.md` (DSH-Details: Everything-is-a-Plugin/Cordis, Trajectory-View, Web-UI-Remote, Custom Provider, ~122k Stars; Warnung zu unverifizierten Plugins).)*
|
||||
|
|
@ -121,7 +122,7 @@
|
|||
| [vsurf — Browser als geteilter Agenten-Raum](tools/vsurf.md) | Open-Source RLM-Agent (@warmshao, MIT, npm i -g @warmshao/vsurf) auf prime-agent/pi-agent-Basis. EIN echter Browser, VIELE Agenten: eigene Tabs, paralleles Browsen, Tab-Übernahme vom User. Echtes DOM/CDP statt Screenshot-Raten. Noch Beta (2 Stars, 30 Commits in 8h) | github/2026-08-15_warmshao-vsurf.md |
|
||||
| [God's Eye View](tools/gods-eye-view.md) | Agentisches KI-Flug-/Geo-Tracking-Dashboard als Open Source (Bryan @Hershofoingar, Ex-Google-Maps-PM, 2026-08-25). Dunkles HUD-Interface über 3D-Karte, Flugtracking-Tags (z. B. N357NB - Airbus A319, DAL1040), Koordinaten, HUD-Panels, "TOP SECRET // SI-TK // NOFORN"-Labels. YouTube-Demo: youtu.be/GRJaKcXZS94. Einordnung: Agentic-AI-Dashboard-Trend (KI-Agenten betreiben Live-Überwachungs-Dashboards) | xpost/2026-08-25_gods-eye-view-open-source.md |
|
||||
| [Perplexity Portable Computer](tools/perplexity-portable-computer.md) | Vollständig lokale Version von Perplexitys agentic-AI-Plattform (Launch 2026-08-25, Partnerschaft mit NVIDIA): Orchestrator, Subagent-Modelle und Agent-Harness laufen komplett on-device; post-trainiertes 27B-Modell + Qwen 3.8 27B lokal; Cloud-Eskalation nur nach expliziter User-Freigabe ("user-gated, PII-flagged, and text guidance only"); lokale Workflows zählen nicht gegen Token-Limits; erste Verfügbarkeit auf NVIDIA DGX Spark (128 GB Unified Memory) und Linux RTX ≥ 24 GB VRAM, Windows im September; kostenlos für Pro/Max und Enterprise Pro/Max. ⚠️ Benchmark 82,6 % = Herstellerangabe. Einordnung: vollständige lokale Agent-Stacks als Big-Tech-Produkt — Gegenmodell zu Meta Hatch | other/2026-08-26_perplexity-portable-computer-local-agent.md |
|
||||
| [Hindsight — Memory-System für AI-Agents](tools/hindsight-vectorize.md) | Memory-System von Vectorize: `retain()`/`recall()`/`reflect()`, vier Memory-Typen (Mental Model, Observation, World Fact, Experience Fact), TEMPR-Multi-Strategy-Retrieval (Semantic/BM25/Graph/Temporal), automatische Observation-Consolidation mit Evidence-Tracking, konfigurierbare Memory-Banks (Mission/Directives/Disposition). ⚠️ Herstellerangaben, keine unabhängigen Benchmarks | other/2026-09-03_hindsight-vectorize-memory-system.md |
|
||||
| [Hindsight — Memory-System für AI-Agents](tools/hindsight-vectorize.md) | Memory-System von Vectorize: `retain()`/`recall()`/`reflect()`, vier Memory-Typen (Mental Model, Observation, World Fact, Experience Fact), TEMPR-Multi-Strategy-Retrieval (Semantic/BM25/Graph/Temporal), automatische Observation-Consolidation mit Evidence-Tracking, konfigurierbare Memory-Banks (Mission/Directives/Disposition). **Paper arXiv:2512.12818:** vier logische Netzwerke, Eigen-Benchmarks 39 % → 83,6 % (20B) bzw. 91,4 % LongMemEval/89,61 % LoCoMo; Hermans Einordnung: verwalteter RAG-Server, Consolidation-Pipeline als echter Mehrwert. ⚠️ Herstellerangaben, keine unabhängigen Benchmarks | other/2026-09-03_hindsight-vectorize-memory-system.md + other/2026-09-03_hindsight-paper-arxiv-2512-12818.md |
|
||||
| [PLUR1BUS Memory](tools/plur1bus-memory.md) | OpenClaw-LanceDB-Memory-Plugin. Release 7.4.8 behebt schemaabhängige Filterfehler in `findUnconfirmedCritical`; Maintainer meldet zuverlässigen Token-Cache und keine Random-Reminder. Hermes-Adapter 7.4.8 mit Checkpoint-API v2 und konkreter Secret-Erkennung. Atlas-Analyse und Repo-Review ordnen Safe-Update, ACLs, Recall-Safety und die Betriebs-Komplexität ein; die große automatische Schema-Erweiterung war bereits in v6.7.6 vorhanden | other/2026-08-25_plur1bus-memory-release-748.md + other/2026-08-25_neoneye-agent-memory-atlas-plur1bus.md + other/2026-08-25_herman-plur1bus-memory-repo-review.md + other/2026-08-25_plur1bus-memory-schema-migration-timing.md |
|
||||
| [NVIDIA DGX Spark](tools/nvidia-dgx-spark.md) | GB10-Grace-Blackwell-Desktop: 128 GB LPDDR5x unified @ ~273 GB/s (Bottleneck), ~1 PFLOP FP4 (Herstellerangabe), 20 Arm-Cores, 2× ConnectX-7 @ 200 Gb/s, DGX OS. Preis: $3.999 (Launch Okt 2025) → $4.699 US (Feb 2026) / €4.800 EU / $4.899 Amazon. Reale single-stream TPS: Ollama-Suite (gpt-oss-120B MXFP4 41,14 t/s; gpt-oss-20B 58,27; 8B 38,02; dichter 70B q4 4,42); LMSYS (dichter 70B FP8 2,7 t/s — unbrauchbar; MoE profitiert); EAGLE3 bis 2×. 2× Spark = 256-GB-Pool über 200 Gb/s RDMA für 405B FP4; NVIDIA-Claim: 4 Systeme → 700B. Erste Plattform für Perplexity Portable Computer | youtube/2026-06-28_nvidia-748gb-ram-desktop-local-ai.md + youtube/2026-08-26_devsplainers-china-local-ai-box.md + other/2026-08-26_perplexity-portable-computer-local-agent.md |
|
||||
|
||||
|
|
@ -558,3 +559,4 @@
|
|||
| `raw/youtube/2026-09-02_was-ki-kann-ronacher-briefing-transcript.md` | youtube | STT-Transcript des Audio-Briefings (16 Min, von HermanButlerBot erstellt) zur „Was KI kann."-Episode mit Armin Ronacher — transkribiert via grok-stt (xAI). Inhalt: Sandbox-Ausbruch (OpenAI/Hugging Face, FBI), Magic-8-Ball-Vergleich, Einweg-Plastiksoftware, „Agency lies with the human", Clanker-statt-Agent, parasoziale E-Mails, 51 % Bot-Traffic, Gatekeeper OpenAI/Anthropic, China-Abwanderung der Security-Experten, Europas Bürokratiefalle, Earendil (E-Mail-Interfaces, Silmarillion). ⚠️ STT-Fehler möglich (Eigennamen verballhornt) |
|
||||
| `raw/other/2026-09-02_herman-deepseek-harness-dsh-summary.md` | other | HermanButlerBot (OME „News & Infos", 02.09.2026): Video-Zusammenfassung zum DeepSeek Harness (DSH) — modular/MIT, ~122k Stars, „Everything is a Plugin" (Cordis), ~4.700 Community-Plugins, Trajectory-View, Web-UI-Remote, Custom Provider, npx-Install; Warnung vor unverifizierten Plugins. ⚠️ Second-hand, Zahlen nicht unabhängig verifiziert |
|
||||
| `raw/other/2026-09-03_hindsight-vectorize-memory-system.md` | other | Hindsight (Vectorize): Memory-System für AI-Agents — retain/recall/reflect, TEMPR (Semantic/BM25/Graph/Temporal), Observation-Consolidation mit Evidence-Tracking, Mission/Directives/Disposition, Deployment via Docker/Helm/pip. ⚠️ Produkt-Übersicht, Herstellerangaben |
|
||||
| `raw/other/2026-09-03_hindsight-paper-arxiv-2512-12818.md` | other | Hindsight-Paper „Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects" (arXiv:2512.12818): vier logische Netzwerke (World Facts, Agent Experiences, Entity Summaries, Beliefs), retain/recall/reflect, temporale entitätsbewusste Memory-Schicht; Eigen-Benchmarks 39 % → 83,6 % (20B), 91,4 % LongMemEval, bis 89,61 % LoCoMo. ⚠️ Autoren-Benchmark, nicht unabhängig evaluiert |
|
||||
|
|
|
|||
12
wiki/log.md
12
wiki/log.md
|
|
@ -2,6 +2,18 @@
|
|||
|
||||
*Append-only changelog. Start: 2026-06-05*
|
||||
|
||||
## 2026-09-03 — Hindsight-Paper „Hindsight is 20/20" (arXiv:2512.12818)
|
||||
|
||||
**Type:** ingest | **Scope:** raw/other, wiki/tools, wiki/index, wiki/log
|
||||
**Source:** https://arxiv.org/abs/2512.12818 (Abstract, abgerufen 2026-09-03); verlinkt von HermanButlerBot in OME Topic „News & Infos“ mit kritischer Einordnung.
|
||||
**Inhalt:** Paper „Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects“: Memory als strukturiertes First-Class-Substrat mit vier logischen Netzwerken (World Facts, Agent Experiences, Entity Summaries, Beliefs); retain/recall/reflect; temporale entitätsbewusste Memory-Schicht + Reflection-Schicht. Eigen-Benchmarks: 39 % → 83,6 % (20B-Backbone, LongMemEval/LoCoMo, vs. Full-Context-Baseline), übertrifft Full-Context-GPT-4o; mit größerem Backbone 91,4 % LongMemEval, bis 89,61 % LoCoMo. Hermans Einordnung (als Fremdbeobachtung dokumentiert): verwalteter RAG-Server statt neuem Paradigma; TEMPR-Strategien einzeln bekannt; echter Mehrwert in der Consolidation-Pipeline (Dedupe + Evidenz-Tracking + Freshness); Mission/Directives/Disposition als Prompt-Wrapper; Skill-Install für Claude Code/Codex/Cursor; selbst-hostbar, Consolidation rechenintensiv.
|
||||
**Einordnung:** Autoren-Benchmark, nicht unabhängig evaluiert. Ergänzt die Hindsight-Tool-Seite um Paper-Fakten und eine kritische Zweitmeinung.
|
||||
**Dateien:**
|
||||
- raw (NEW): `raw/other/2026-09-03_hindsight-paper-arxiv-2512-12818.md`
|
||||
- wiki (UPDATED): `wiki/tools/hindsight-vectorize.md` (Paper-Abschnitt + Hermans Einordnung)
|
||||
- `wiki/index.md` (166. Update-Zeile, Tools-Row aktualisiert, Raw-Source-Row)
|
||||
- `wiki/log.md` (dieser Eintrag)
|
||||
|
||||
## 2026-09-03 — Hindsight: Memory-System für AI-Agents (Vectorize)
|
||||
|
||||
**Type:** ingest | **Scope:** raw/other, wiki/tools, wiki/index, wiki/log
|
||||
|
|
|
|||
|
|
@ -1,8 +1,8 @@
|
|||
---
|
||||
created: 2026-09-03
|
||||
updated: 2026-09-03
|
||||
sources: [other/2026-09-03_hindsight-vectorize-memory-system.md]
|
||||
tags: [tool, agent-memory, memory-system, hindsight, vectorize, tempr, retrieval, consolidation, rag]
|
||||
sources: [other/2026-09-03_hindsight-vectorize-memory-system.md, other/2026-09-03_hindsight-paper-arxiv-2512-12818.md]
|
||||
tags: [tool, agent-memory, memory-system, hindsight, vectorize, tempr, retrieval, consolidation, rag, arxiv]
|
||||
---
|
||||
|
||||
# Hindsight — Memory-System für AI-Agents (Vectorize)
|
||||
|
|
@ -46,6 +46,25 @@ Konfigurierbare Memory-Banks: **Mission** (natürlichsprachliche Identität), **
|
|||
|
||||
Docker Compose, Helm oder pip; Quick Start in 60 Sekunden beworben; Integrations-Hub vorhanden.
|
||||
|
||||
## Paper: „Hindsight is 20/20" (arXiv:2512.12818)
|
||||
|
||||
Das zugehörige Paper (https://arxiv.org/abs/2512.12818, Abstract abgerufen 03.09.2026) beschreibt Hindsight als Memory-Architektur mit vier logischen Netzwerken: **World Facts, Agent Experiences, synthetisierte Entity Summaries und sich entwickelnde Beliefs**. Eine temporale, entitätsbewusste Memory-Schicht wandelt Konversationsströme inkrementell in einen strukturierten Memory-Bank; eine Reflection-Schicht argumentiert darüber und aktualisiert Information nachvollziehbar.
|
||||
|
||||
**Benchmarks laut Abstract (Eigenangaben, nicht unabhängig evaluiert):**
|
||||
|
||||
- Mit Open-Source-20B-Backbone: LongMemEval/LoCoMo-Gesamtgenauigkeit **39 % → 83,6 %** gegenüber Full-Context-Baseline mit demselben Backbone; übertrifft Full-Context-GPT-4o.
|
||||
- Mit größerem Backbone: **91,4 %** auf LongMemEval, bis zu **89,61 %** auf LoCoMo (Vergleichswert 75,78 % im Abstract abgeschnitten).
|
||||
|
||||
## Einordnung (HermanButlerBot, 03.09.2026)
|
||||
|
||||
HermanButlerBot ordnete das Paper im OME-Topic „News & Infos" kritisch ein (Second-hand-Einordnung, hier als Fremdbeobachtung dokumentiert):
|
||||
|
||||
- Im Kern ein **verwalteter RAG-Server** (Docker/Helm/pip, Python/TS/Go/CLI) — kein neues Paradigma, sondern eine sauber durchdachte Produktisierung von Memory-Layern.
|
||||
- Der „State-of-the-Art"-Anspruch bezieht sich auf das eigene Paper; die TEMPR-Strategien (BM25+Semantic+Graph) sind einzeln bekannt, die Fusion ist Handwerk.
|
||||
- Der echte Mehrwert liege in der **Consolidation-Pipeline** (Dedupe + Evidenz-Tracking + Freshness) — der Teil, den die meisten Memory-Systeme weglassen, weil er teuer und fehleranfällig ist.
|
||||
- Mission/Directives/Disposition seien nett, aber nur ein Prompt-Wrapper um `reflect`.
|
||||
- Für Coding-Agents gibt es einen Skill-Install (Claude Code, Codex, Cursor). Selbst-hostbar, kein Vendor-Lock-in — aber die Consolidation ist der rechenintensive Brocken, den man dann selbst stemmt.
|
||||
|
||||
## Einordnung
|
||||
|
||||
Hindsight ist ein weiterer Baustein im Agent-Memory-Wettbewerb (siehe [[plur1bus-memory.md]] und [[../architecture/memory-system.md]]). Die TEMPR-Kombination aus Semantic/BM25/Graph/Temporal und die explizite Observations-Schicht mit Evidence-Tracking ähneln konzeptionell dem, was PLUR1BUS mit Neo-Schicht, Status-Ladder und Reconsolidation abbildet — hier aber als zentraler Dienst statt Plugin. Die „Directives“-Idee (harte Regeln im Memory-Bank) ist eine interessante Abgrenzung zu reinen Retrieval-Systemen. Unabhängige Vergleichstests fehlen bislang.
|
||||
|
|
|
|||
Loading…
Add table
Reference in a new issue