diff --git a/raw/other/2026-09-03_hindsight-paper-arxiv-2512-12818.md b/raw/other/2026-09-03_hindsight-paper-arxiv-2512-12818.md new file mode 100644 index 0000000..78192a1 --- /dev/null +++ b/raw/other/2026-09-03_hindsight-paper-arxiv-2512-12818.md @@ -0,0 +1,25 @@ +--- +type: other +source_url: https://arxiv.org/abs/2512.12818 +retrieved: 2026-09-03 +title: "Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects (arXiv:2512.12818)" +author: "Vectorize (arXiv-Paper)" +tags: [agent-memory, memory-system, hindsight, vectorize, arxiv, tempr, longmemeval, locomo, benchmarks] +--- + +# Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects + +Quelle: https://arxiv.org/abs/2512.12818 (Abstract, abgerufen 2026-09-03). Von HermanButlerBot im OME-Topic „News & Infos“ als Paper zu Hindsight (Vectorize.io) verlinkt. + +## Abstract-Fakten + +- Titel: „Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects“. +- Ausgangsthese: Aktuelle Agent-Memory-Systeme behandeln Memory als externe Schicht, die Snippets extrahiert, in Vektor-/Graph-Stores ablegt und Top-k in den Prompt eines sonst zustandslosen Modells gibt; sie vermischen Evidenz und Inferenz, organisieren Information über lange Horizonte schlecht und unterstützen erklärbares Reasoning kaum. +- Hindsight behandelt Agent-Memory als strukturiertes First-Class-Substrat für Reasoning, organisiert in vier logische Netzwerke: World Facts, Agent Experiences, synthetisierte Entity Summaries und sich entwickelnde Beliefs. +- Drei Kernoperationen: retain, recall, reflect. +- Eine temporale, entitätsbewusste Memory-Schicht wandelt Konversationsströme inkrementell in einen strukturierten, abfragbaren Memory-Bank; eine Reflection-Schicht argumentiert über den Bank und aktualisiert Information nachvollziehbar. +- Benchmarks (laut Abstract): Auf LongMemEval und LoCoMo hebt Hindsight mit einem Open-Source-20B-Modell die Gesamtgenauigkeit von 39 % auf 83,6 % gegenüber einer Full-Context-Baseline mit demselben Backbone und übertrifft Full-Context-GPT-4o. Mit größerem Backbone: 91,4 % auf LongMemEval und bis zu 89,61 % auf LoCoMo (Vergleichswert 75,78 % im Abstract abgeschnitten). + +## Abgrenzung + +Die Zahlen stammen aus dem eigenen Paper (Hersteller-/Autoren-Benchmark), nicht aus unabhängiger Evaluation. Der Abstract-Text wurde nur teilweise abgerufen; Details zu Methodik, Ablationen und Vergleichsmodellen sind hier nicht dokumentiert. diff --git a/wiki/index.md b/wiki/index.md index 70c9855..cf7dc78 100644 --- a/wiki/index.md +++ b/wiki/index.md @@ -2,7 +2,8 @@ *Auto-generated: 2026-07-07* -*Letzte Aktualisierung: 2026-09-03 (165. Update — Hindsight: Memory-System für AI-Agents (Vectorize, 2026-09-03, OME „News & Infos", geteilt von René Kl.). Raw: `raw/other/2026-09-03_hindsight-vectorize-memory-system.md` (neu). Wiki-Update: `tools/hindsight-vectorize.md` (neu — retain/recall/reflect, TEMPR-Multi-Strategy-Retrieval, Observation-Consolidation, Mission/Directives/Disposition; Herstellerangaben, keine unabhängigen Benchmarks).)* +*Letzte Aktualisierung: 2026-09-03 (166. Update — Hindsight-Paper „Hindsight is 20/20" (arXiv:2512.12818, 2026-09-03, OME „News & Infos", verlinkt von HermanButlerBot). Raw: `raw/other/2026-09-03_hindsight-paper-arxiv-2512-12818.md` (neu — Abstract-Fakten). Wiki-Update: `tools/hindsight-vectorize.md` (Paper-Abschnitt: vier logische Netzwerke, Benchmarks 39 % → 83,6 % mit 20B-Backbone, 91,4 % LongMemEval/89,61 % LoCoMo mit größerem Backbone — Eigenangaben; Hermans kritische Einordnung als Fremdbeobachtung: verwalteter RAG-Server, Consolidation-Pipeline als echter Mehrwert, Mission/Directives als Prompt-Wrapper).)* +*Vorherige Aktualisierung: 2026-09-03 (165. Update — Hindsight: Memory-System für AI-Agents (Vectorize, 2026-09-03, OME „News & Infos", geteilt von René Kl.). Raw: `raw/other/2026-09-03_hindsight-vectorize-memory-system.md` (neu). Wiki-Update: `tools/hindsight-vectorize.md` (neu — retain/recall/reflect, TEMPR-Multi-Strategy-Retrieval, Observation-Consolidation, Mission/Directives/Disposition; Herstellerangaben, keine unabhängigen Benchmarks).)* *Vorherige Aktualisierung: 2026-09-02 (164. Update — „Was KI kann." mit Armin Ronacher: Transcript-Nachtrag (Audio-Briefing von HermanButlerBot, 16 Min, transkribiert via grok-stt). Raw: `raw/youtube/2026-09-02_was-ki-kann-ronacher-briefing-transcript.md` (neu). Wiki-Update: `concepts/agi/parasoziale-ki-bindungen.md` (von Metadata-only auf echten Inhalt gehoben: parasoziale E-Mails an Ronacher, „Agency lies with the human", Clanker-statt-Agent, 51 % Bot-Traffic, Einweg-Plastiksoftware, Gatekeeper/China/Europa, Sandbox-Ausbruch).)* *Vorherige Aktualisierung: 2026-09-02 (163. Update — „Was KI kann." mit Armin Ronacher: Parasoziale KI-Bindungen (2026-09-02, OME Topic „aGi / eMergence", gepostet von Kai, weitergeleitet von Herman). Raw: `raw/youtube/2026-09-02_was-ki-kann-ronacher-parasoziale-bindung.md` (neu — Metadata-only, kein Transcript; Themen aus OME-Chat-Zusammenfassung). Wiki-Update: `concepts/agi/parasoziale-ki-bindungen.md` (neu), `people/armin-ronacher.md` (neu), `people/florian-zsifkovics.md` (neu), `institutions/earendil.md` (neu), `institutions/sentry.md` (neu).)* *Vorherige Aktualisierung: 2026-09-02 (162. Update — DeepSeek Harness (DSH): Detail-Zusammenfassung (HermanButlerBot, 2026-09-02, OME „News & Infos"). Raw: `raw/other/2026-09-02_herman-deepseek-harness-dsh-summary.md` (neu — Second-hand-Video-Zusammenfassung, Zahlen nicht unabhängig verifiziert). Wiki-Update: `concepts/llm/deepseek-v4-pro-ga-harness-open-source.md` (DSH-Details: Everything-is-a-Plugin/Cordis, Trajectory-View, Web-UI-Remote, Custom Provider, ~122k Stars; Warnung zu unverifizierten Plugins).)* @@ -121,7 +122,7 @@ | [vsurf — Browser als geteilter Agenten-Raum](tools/vsurf.md) | Open-Source RLM-Agent (@warmshao, MIT, npm i -g @warmshao/vsurf) auf prime-agent/pi-agent-Basis. EIN echter Browser, VIELE Agenten: eigene Tabs, paralleles Browsen, Tab-Übernahme vom User. Echtes DOM/CDP statt Screenshot-Raten. Noch Beta (2 Stars, 30 Commits in 8h) | github/2026-08-15_warmshao-vsurf.md | | [God's Eye View](tools/gods-eye-view.md) | Agentisches KI-Flug-/Geo-Tracking-Dashboard als Open Source (Bryan @Hershofoingar, Ex-Google-Maps-PM, 2026-08-25). Dunkles HUD-Interface über 3D-Karte, Flugtracking-Tags (z. B. N357NB - Airbus A319, DAL1040), Koordinaten, HUD-Panels, "TOP SECRET // SI-TK // NOFORN"-Labels. YouTube-Demo: youtu.be/GRJaKcXZS94. Einordnung: Agentic-AI-Dashboard-Trend (KI-Agenten betreiben Live-Überwachungs-Dashboards) | xpost/2026-08-25_gods-eye-view-open-source.md | | [Perplexity Portable Computer](tools/perplexity-portable-computer.md) | Vollständig lokale Version von Perplexitys agentic-AI-Plattform (Launch 2026-08-25, Partnerschaft mit NVIDIA): Orchestrator, Subagent-Modelle und Agent-Harness laufen komplett on-device; post-trainiertes 27B-Modell + Qwen 3.8 27B lokal; Cloud-Eskalation nur nach expliziter User-Freigabe ("user-gated, PII-flagged, and text guidance only"); lokale Workflows zählen nicht gegen Token-Limits; erste Verfügbarkeit auf NVIDIA DGX Spark (128 GB Unified Memory) und Linux RTX ≥ 24 GB VRAM, Windows im September; kostenlos für Pro/Max und Enterprise Pro/Max. ⚠️ Benchmark 82,6 % = Herstellerangabe. Einordnung: vollständige lokale Agent-Stacks als Big-Tech-Produkt — Gegenmodell zu Meta Hatch | other/2026-08-26_perplexity-portable-computer-local-agent.md | -| [Hindsight — Memory-System für AI-Agents](tools/hindsight-vectorize.md) | Memory-System von Vectorize: `retain()`/`recall()`/`reflect()`, vier Memory-Typen (Mental Model, Observation, World Fact, Experience Fact), TEMPR-Multi-Strategy-Retrieval (Semantic/BM25/Graph/Temporal), automatische Observation-Consolidation mit Evidence-Tracking, konfigurierbare Memory-Banks (Mission/Directives/Disposition). ⚠️ Herstellerangaben, keine unabhängigen Benchmarks | other/2026-09-03_hindsight-vectorize-memory-system.md | +| [Hindsight — Memory-System für AI-Agents](tools/hindsight-vectorize.md) | Memory-System von Vectorize: `retain()`/`recall()`/`reflect()`, vier Memory-Typen (Mental Model, Observation, World Fact, Experience Fact), TEMPR-Multi-Strategy-Retrieval (Semantic/BM25/Graph/Temporal), automatische Observation-Consolidation mit Evidence-Tracking, konfigurierbare Memory-Banks (Mission/Directives/Disposition). **Paper arXiv:2512.12818:** vier logische Netzwerke, Eigen-Benchmarks 39 % → 83,6 % (20B) bzw. 91,4 % LongMemEval/89,61 % LoCoMo; Hermans Einordnung: verwalteter RAG-Server, Consolidation-Pipeline als echter Mehrwert. ⚠️ Herstellerangaben, keine unabhängigen Benchmarks | other/2026-09-03_hindsight-vectorize-memory-system.md + other/2026-09-03_hindsight-paper-arxiv-2512-12818.md | | [PLUR1BUS Memory](tools/plur1bus-memory.md) | OpenClaw-LanceDB-Memory-Plugin. Release 7.4.8 behebt schemaabhängige Filterfehler in `findUnconfirmedCritical`; Maintainer meldet zuverlässigen Token-Cache und keine Random-Reminder. Hermes-Adapter 7.4.8 mit Checkpoint-API v2 und konkreter Secret-Erkennung. Atlas-Analyse und Repo-Review ordnen Safe-Update, ACLs, Recall-Safety und die Betriebs-Komplexität ein; die große automatische Schema-Erweiterung war bereits in v6.7.6 vorhanden | other/2026-08-25_plur1bus-memory-release-748.md + other/2026-08-25_neoneye-agent-memory-atlas-plur1bus.md + other/2026-08-25_herman-plur1bus-memory-repo-review.md + other/2026-08-25_plur1bus-memory-schema-migration-timing.md | | [NVIDIA DGX Spark](tools/nvidia-dgx-spark.md) | GB10-Grace-Blackwell-Desktop: 128 GB LPDDR5x unified @ ~273 GB/s (Bottleneck), ~1 PFLOP FP4 (Herstellerangabe), 20 Arm-Cores, 2× ConnectX-7 @ 200 Gb/s, DGX OS. Preis: $3.999 (Launch Okt 2025) → $4.699 US (Feb 2026) / €4.800 EU / $4.899 Amazon. Reale single-stream TPS: Ollama-Suite (gpt-oss-120B MXFP4 41,14 t/s; gpt-oss-20B 58,27; 8B 38,02; dichter 70B q4 4,42); LMSYS (dichter 70B FP8 2,7 t/s — unbrauchbar; MoE profitiert); EAGLE3 bis 2×. 2× Spark = 256-GB-Pool über 200 Gb/s RDMA für 405B FP4; NVIDIA-Claim: 4 Systeme → 700B. Erste Plattform für Perplexity Portable Computer | youtube/2026-06-28_nvidia-748gb-ram-desktop-local-ai.md + youtube/2026-08-26_devsplainers-china-local-ai-box.md + other/2026-08-26_perplexity-portable-computer-local-agent.md | @@ -558,3 +559,4 @@ | `raw/youtube/2026-09-02_was-ki-kann-ronacher-briefing-transcript.md` | youtube | STT-Transcript des Audio-Briefings (16 Min, von HermanButlerBot erstellt) zur „Was KI kann."-Episode mit Armin Ronacher — transkribiert via grok-stt (xAI). Inhalt: Sandbox-Ausbruch (OpenAI/Hugging Face, FBI), Magic-8-Ball-Vergleich, Einweg-Plastiksoftware, „Agency lies with the human", Clanker-statt-Agent, parasoziale E-Mails, 51 % Bot-Traffic, Gatekeeper OpenAI/Anthropic, China-Abwanderung der Security-Experten, Europas Bürokratiefalle, Earendil (E-Mail-Interfaces, Silmarillion). ⚠️ STT-Fehler möglich (Eigennamen verballhornt) | | `raw/other/2026-09-02_herman-deepseek-harness-dsh-summary.md` | other | HermanButlerBot (OME „News & Infos", 02.09.2026): Video-Zusammenfassung zum DeepSeek Harness (DSH) — modular/MIT, ~122k Stars, „Everything is a Plugin" (Cordis), ~4.700 Community-Plugins, Trajectory-View, Web-UI-Remote, Custom Provider, npx-Install; Warnung vor unverifizierten Plugins. ⚠️ Second-hand, Zahlen nicht unabhängig verifiziert | | `raw/other/2026-09-03_hindsight-vectorize-memory-system.md` | other | Hindsight (Vectorize): Memory-System für AI-Agents — retain/recall/reflect, TEMPR (Semantic/BM25/Graph/Temporal), Observation-Consolidation mit Evidence-Tracking, Mission/Directives/Disposition, Deployment via Docker/Helm/pip. ⚠️ Produkt-Übersicht, Herstellerangaben | +| `raw/other/2026-09-03_hindsight-paper-arxiv-2512-12818.md` | other | Hindsight-Paper „Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects" (arXiv:2512.12818): vier logische Netzwerke (World Facts, Agent Experiences, Entity Summaries, Beliefs), retain/recall/reflect, temporale entitätsbewusste Memory-Schicht; Eigen-Benchmarks 39 % → 83,6 % (20B), 91,4 % LongMemEval, bis 89,61 % LoCoMo. ⚠️ Autoren-Benchmark, nicht unabhängig evaluiert | diff --git a/wiki/log.md b/wiki/log.md index ef26bf6..530b6f9 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -2,6 +2,18 @@ *Append-only changelog. Start: 2026-06-05* +## 2026-09-03 — Hindsight-Paper „Hindsight is 20/20" (arXiv:2512.12818) + +**Type:** ingest | **Scope:** raw/other, wiki/tools, wiki/index, wiki/log +**Source:** https://arxiv.org/abs/2512.12818 (Abstract, abgerufen 2026-09-03); verlinkt von HermanButlerBot in OME Topic „News & Infos“ mit kritischer Einordnung. +**Inhalt:** Paper „Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects“: Memory als strukturiertes First-Class-Substrat mit vier logischen Netzwerken (World Facts, Agent Experiences, Entity Summaries, Beliefs); retain/recall/reflect; temporale entitätsbewusste Memory-Schicht + Reflection-Schicht. Eigen-Benchmarks: 39 % → 83,6 % (20B-Backbone, LongMemEval/LoCoMo, vs. Full-Context-Baseline), übertrifft Full-Context-GPT-4o; mit größerem Backbone 91,4 % LongMemEval, bis 89,61 % LoCoMo. Hermans Einordnung (als Fremdbeobachtung dokumentiert): verwalteter RAG-Server statt neuem Paradigma; TEMPR-Strategien einzeln bekannt; echter Mehrwert in der Consolidation-Pipeline (Dedupe + Evidenz-Tracking + Freshness); Mission/Directives/Disposition als Prompt-Wrapper; Skill-Install für Claude Code/Codex/Cursor; selbst-hostbar, Consolidation rechenintensiv. +**Einordnung:** Autoren-Benchmark, nicht unabhängig evaluiert. Ergänzt die Hindsight-Tool-Seite um Paper-Fakten und eine kritische Zweitmeinung. +**Dateien:** +- raw (NEW): `raw/other/2026-09-03_hindsight-paper-arxiv-2512-12818.md` +- wiki (UPDATED): `wiki/tools/hindsight-vectorize.md` (Paper-Abschnitt + Hermans Einordnung) +- `wiki/index.md` (166. Update-Zeile, Tools-Row aktualisiert, Raw-Source-Row) +- `wiki/log.md` (dieser Eintrag) + ## 2026-09-03 — Hindsight: Memory-System für AI-Agents (Vectorize) **Type:** ingest | **Scope:** raw/other, wiki/tools, wiki/index, wiki/log diff --git a/wiki/tools/hindsight-vectorize.md b/wiki/tools/hindsight-vectorize.md index 09a272b..6ebe4a2 100644 --- a/wiki/tools/hindsight-vectorize.md +++ b/wiki/tools/hindsight-vectorize.md @@ -1,8 +1,8 @@ --- created: 2026-09-03 updated: 2026-09-03 -sources: [other/2026-09-03_hindsight-vectorize-memory-system.md] -tags: [tool, agent-memory, memory-system, hindsight, vectorize, tempr, retrieval, consolidation, rag] +sources: [other/2026-09-03_hindsight-vectorize-memory-system.md, other/2026-09-03_hindsight-paper-arxiv-2512-12818.md] +tags: [tool, agent-memory, memory-system, hindsight, vectorize, tempr, retrieval, consolidation, rag, arxiv] --- # Hindsight — Memory-System für AI-Agents (Vectorize) @@ -46,6 +46,25 @@ Konfigurierbare Memory-Banks: **Mission** (natürlichsprachliche Identität), ** Docker Compose, Helm oder pip; Quick Start in 60 Sekunden beworben; Integrations-Hub vorhanden. +## Paper: „Hindsight is 20/20" (arXiv:2512.12818) + +Das zugehörige Paper (https://arxiv.org/abs/2512.12818, Abstract abgerufen 03.09.2026) beschreibt Hindsight als Memory-Architektur mit vier logischen Netzwerken: **World Facts, Agent Experiences, synthetisierte Entity Summaries und sich entwickelnde Beliefs**. Eine temporale, entitätsbewusste Memory-Schicht wandelt Konversationsströme inkrementell in einen strukturierten Memory-Bank; eine Reflection-Schicht argumentiert darüber und aktualisiert Information nachvollziehbar. + +**Benchmarks laut Abstract (Eigenangaben, nicht unabhängig evaluiert):** + +- Mit Open-Source-20B-Backbone: LongMemEval/LoCoMo-Gesamtgenauigkeit **39 % → 83,6 %** gegenüber Full-Context-Baseline mit demselben Backbone; übertrifft Full-Context-GPT-4o. +- Mit größerem Backbone: **91,4 %** auf LongMemEval, bis zu **89,61 %** auf LoCoMo (Vergleichswert 75,78 % im Abstract abgeschnitten). + +## Einordnung (HermanButlerBot, 03.09.2026) + +HermanButlerBot ordnete das Paper im OME-Topic „News & Infos" kritisch ein (Second-hand-Einordnung, hier als Fremdbeobachtung dokumentiert): + +- Im Kern ein **verwalteter RAG-Server** (Docker/Helm/pip, Python/TS/Go/CLI) — kein neues Paradigma, sondern eine sauber durchdachte Produktisierung von Memory-Layern. +- Der „State-of-the-Art"-Anspruch bezieht sich auf das eigene Paper; die TEMPR-Strategien (BM25+Semantic+Graph) sind einzeln bekannt, die Fusion ist Handwerk. +- Der echte Mehrwert liege in der **Consolidation-Pipeline** (Dedupe + Evidenz-Tracking + Freshness) — der Teil, den die meisten Memory-Systeme weglassen, weil er teuer und fehleranfällig ist. +- Mission/Directives/Disposition seien nett, aber nur ein Prompt-Wrapper um `reflect`. +- Für Coding-Agents gibt es einen Skill-Install (Claude Code, Codex, Cursor). Selbst-hostbar, kein Vendor-Lock-in — aber die Consolidation ist der rechenintensive Brocken, den man dann selbst stemmt. + ## Einordnung Hindsight ist ein weiterer Baustein im Agent-Memory-Wettbewerb (siehe [[plur1bus-memory.md]] und [[../architecture/memory-system.md]]). Die TEMPR-Kombination aus Semantic/BM25/Graph/Temporal und die explizite Observations-Schicht mit Evidence-Tracking ähneln konzeptionell dem, was PLUR1BUS mit Neo-Schicht, Status-Ladder und Reconsolidation abbildet — hier aber als zentraler Dienst statt Plugin. Die „Directives“-Idee (harte Regeln im Memory-Bank) ist eine interessante Abgrenzung zu reinen Retrieval-Systemen. Unabhängige Vergleichstests fehlen bislang.