跳到正文
RESEARCHRADAR

研究报告 · agent-memory · 2026-07-13

ResearchRadar 日报:agent-memory

今天精读了 2 篇新论文,并保留其他新增来源供后续跟进。

精读论文 2核验证据 22相关来源 19
目录
  1. 今日摘要
  2. 今日精读
  3. 其他新增 / 更新来源
  4. 已读过的相关来源
  5. 参考资料

今日摘要

今天精读了 2 篇新论文,并保留其他新增来源供后续跟进。

已核验证据点:22 条。

今日精读

Mandol: An Agglomerative Agent Memory System for Long-Term Conversations

基准/评测论文 · 新来源 · 2026-06-29T04:43:29Z · v1

Mandol提出凝聚式记忆系统,统一碎片化记忆表示,减少延迟并提高检索效率。

机制速览

问题长期对话智能体需要记住和查询跨会话、多类型且具有复杂关联的信息。方法Mandol引入了一个层次化记忆模型,将记忆组织为基本层(原始信息)和高级抽象层(可追溯的抽象记忆),两者统一表示为结构化语义图。实验Mandol在两个长期对话基准上进行了评估:LoCoMo和LongMemEval。

背景知识速读

基于 LLM 的对话代理在跨多天或多会话运行时,必须记住对话、用户偏好、事件和实体更新的复杂混合。要检索正确的一段过去信息来回答新的查询具有挑战性,因为相关记忆可能分散在许多轮次中,甚至可能与后续更新冲突。当前的记忆系统通常将不同类型的记忆存储在不同的数据库中——向量存储用于相似性搜索,图数据库用于关系——迫使检索过程在不同系统之间跳跃,并从嘈杂、冗余且可能过时的片段中组装视图,同时无法控制检索到的记忆消耗多少 token。

核心判断

Mandol 认为,通过构建一个单一的、内存中的聚集式数据结构,融合 key-value、vector 和 graph 能力,可以消除由独立数据库引起的碎片化。然后,它用定量流水线取代了自由形式的 RAG 检索,该流水线显式路由查询、过滤噪声、解决冲突,并将结果打包到 token 预算中,在检索过程中从不调用 LLM。

问题与动机

设想一个客户服务代理与用户交谈了数天。用户先预订了一家酒店,然后更改了预订,接着询问原始确认信息。标准检索系统可能会检索到旧的预订记录,因为它在文本上与查询相似,从许多轮次中引入冗余文本,并且未能注意到新预订覆盖了旧预订。然后,代理浪费 token 并给出过时的答案。根本问题在于,记忆系统没有统一的用户所知或所做内容的模型,并且缺乏确定性方法来解决冲突的证据。

方法与机制

Mandol 将记忆组织为两层。基本层存储原始对话轮次作为记忆单元,每个单元带有语义向量和元数据。单元通过显式结构边(时间顺序、引用)和隐式语义相似度边相连。在顶层,高级抽象层使用 LLM 创建情节链、语义实体图和情感偏好,所有这些都指向基本单元。物理上,它们存储在内存中的 SemanticMap(key-value + 稠密/稀疏/倒排索引)和 SemanticGraph(共享相同 ID 的邻接列表)中。当查询到来时,一个轻量级分类器决定哪些记忆源(基本、情节、语义、情感)相关,并分配每个源的候选预算。在每个源内,并行运行 BM25、SPLADE 和密集向量搜索,通过倒数排名融合(RRF)融合,并通过有限图扩展丰富以恢复多跳证据。一个交叉编码器对候选进行语义评分。检索输出随后通过一个基于中位数绝对偏差(MAD)的过滤器,该过滤器根据分数分布自适应调整,丢弃弱相关的项目。跨源时,冲突项目(相同实体、不一致的描述)通过平衡语义相关性、时间新鲜度(指数衰减)和源置信度(基本 > 情节 > 语义)的仲裁分数来解决。最后,保留的项目被组装成一个符合预定义 token 限制的上下文文本。在此检索链中不调用 LLM;LLM 仅根据清洗后的上下文生成最终答案。存储持久化通过异步分页后端到 DuckDB。

实验解读

Mandol 在两个标准的长对话基准 LoCoMo 和 LongMemEval 上进行了测试。准确率通过自动 LLM 评判器将生成的答案与真实答案进行比较来衡量。使用 GPT-4o-mini 作为回答模型,Mandol 在 LoCoMo 上达到 89.48%,在 LongMemEval 上达到 85.00%,均为 Mem0、MemU、Zep、MemOS 和 EverMemOS 中的最高值。在需要追踪助手提供的信息和更新知识的任务上,提升尤为明显——LongMemEval 的 SS-Asst 列从 19.60%(MemU)跃升至 98.21%(Mandol)。报告的 token 使用量(约 2k)处于比较系统的中等水平,表明定量检索成功地将所需证据打包到紧凑的上下文中。在服务器级 GPU 上的系统延迟实验显示,在 10 查询/秒并发负载下,检索速度是其他系统的 5.4 倍,插入速度是 4.8 倍。在消费级笔记本电脑上,Mandol 仍然适用并保持低延迟,尽管未给出具体数据。LoCoMo 基准的总处理时间为 86 秒,比任何其他系统快数倍,这是因为避免了外部数据库写入。

相关工作

该论文定义了其对几个开源代理记忆系统的贡献:Mem0(向量 DB,可选图)、Zep(带 Lucene 的时间知识图谱)、MemOS(向量+图,带摘要)和 EverMemOS(多数据库栈,带 Markdown 摘要)。所有这些系统都混合了存储引擎,并且在查询时需要跨系统协调。Mandol 是第一个提出单一内存数据结构,原生处理 key-value、vector 和 graph 操作而无需离开进程的工作。其他关于 Zettelkasten 网络和用于长上下文问答的天际线检索的工作被引用但未直接比较。

局限与未来工作

该论文集中于系统设计及其经验性能,但没有讨论固有的局限性。可以推断出几点。高层抽象步骤依赖于 LLM,其成本和失败模式未分析;错误的抽象可能会传播到所有后续查询。定量检索流水线有几个手动设置的超参数(用于 MAD 的 κ、新鲜度衰减、每个源的置信度权重),未在不同条件下进行验证。两个基准均为英文,因此跨语言行为未知。报告的加速是在 10 QPS 下测量的,属于中等水平,未测试数百个并发会话的可扩展性。最重要的是,没有消融研究分离出分层模型、聚集式数据结构或定量检索阶段的各自价值;读者无法判断提升来自于更好的检索、更好的去噪还是最终的 token 预算截断。

通俗例子

将 Mandol 想象成一个非常有条理的私人日记,它不仅记录了之前每一次对话的内容,还自动编写关键事实和关系的摘要,全部在一个带有彩色标签的笔记本里。当你问问题时,笔记本的索引快速找到相关页面,丢弃任何过时或离题的页面,通过信任最新和最直接的笔记来解决矛盾,然后为你提供一个整齐的摘要,刚好一页——无需计算机搜索。

读者 takeaway

Mandol 展示了可以将对话代理记忆的存储和检索统一到单个、快速的内存系统中,提供准确且 token 高效的上下文。该方法消除了传统栈的跨数据库 I/O 开销,并用结构化、定量的流水线取代了嘈杂的相似性搜索。这项工作指向了一个未来,代理记忆由原生管理,而不是由通用数据库拼凑而成。

Mandol 层次化记忆模型概览
Mandol 层次化记忆模型概览

针对本验证点的可视化上下文:Solution: Mandol 引入了一个层次化记忆模型,将记忆组织为基本层(原始信息)和高级抽象层(可追溯的抽象记忆),两者统一表示为结构化语义图。

Mandol 中的语义数据结构和定量检索机制
Mandol 中的语义数据结构和定量检索机制

针对本验证点的可视化上下文:Solution: Mandol 提供了一种凝聚式语义数据结构,结合 SemanticMap 和 SemanticGraph,原生融合了键值、向量和图结构,并提供统一的混合检索算子以消除跨数据库 I/O。

端到端工作负载期间的资源使用情况
端到端工作负载期间的资源使用情况

针对本验证点的可视化上下文:Experiment: Mandol 在 86.18 秒内完成了 LoCoMo 工作负载,在相同检索后端(Qwen3-Embedding-0.6B, bge-reranker-v2-m3)下比对比系统快 4.2–9.9 倍。

关键证据
  • 问题:长期对话智能体需要记住和查询跨会话、多类型且具有复杂关联的信息。
  • 问题:现有的智能体记忆系统依赖异构的向量和图数据库,这碎片化了记忆信息并导致跨数据库I/O延迟高。
  • 问题:常见的RAG风格检索方法引入噪声、遗漏关联线索且缺乏token预算控制,降低了LLM的准确性和效率。
  • 方法:Mandol引入了一个层次化记忆模型,将记忆组织为基本层(原始信息)和高级抽象层(可追溯的抽象记忆),两者统一表示为结构化语义图。
  • 方法:Mandol提供了一种凝聚式语义数据结构,结合SemanticMap和SemanticGraph,原生融合了键值、向量和图结构,并提供统一的混合检索算子以消除跨数据库I/O。
  • 方法:Mandol的定量查询机制具有查询自适应路由、定量去噪与冲突解决以及token约束上下文生成的特点,且在检索过程中无需LLM参与。
  • 实验:Mandol在两个长期对话基准上进行了评估:LoCoMo和LongMemEval。
  • 实验:评估使用了GPT-4o-mini和GPT-4.1-mini作为答案生成主干,以及来自EverMemOS的基于LLM的答案正确性脚本。

A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory

基准/评测论文 · 新来源 · 2026-07-02T09:28:29Z · v2

A-TMA通过状态感知覆盖层解决幽灵记忆问题,分离新旧事实。

机制速览

问题长期智能体记忆中的用户事实可能会发生变化,从而产生状态协调问题。方法A-TMA是一种针对现有记忆系统的状态感知覆层,不替换宿主存储或检索。实验LTP(LoCoMo Temporal Plus)是一个用于ghost memory的基准,包含10个配置文件和800个探测。局限完整的LoCoMo结果因宿主和指标而异,因此该方法在全部设置下并未产生一致的改进。要点A-TMA是一种状态感知覆层,为现有记忆系统添加明确的状态标签和证据包构建,以便在事实变化时对记忆库、检索和问答进行解耦评估。

背景知识速读

当AI助手跨会话记住你的偏好时,它需要一个长期记忆。但人们会换工作、搬家或改变计划,因此记忆系统必须处理演化的事实。大多数记忆系统会混淆新旧事实,尤其当两者都仍被存储时。本文解决了一个微妙的问题:不仅仅是记住事实,还要知道哪些事实适用于现在与过去。

核心判断

作者识别出'ghost memory'——一种过时事实、当前事实和过渡事实共存并混淆助手的失败。他们提出了A-TMA,一种轻量级覆盖层,不替换现有记忆系统,而是在三个层面增加状态感知:事实如何存储(bank)、如何检索以及如何呈现给回答模型(QA)。他们的关键洞察是必须为事实标记时间状态(active, superseded, transition)并构建匹配查询请求状态视图的证据包。

问题与动机

假设一个代理存储了用户的旧工作和新工作。没有显式状态标签,像'我的工作是什么?'这样的问题可能会检索到两条记录,回答者可能选错——即使两者在不同时间都是真的。仅靠时间戳不能解决这个问题,因为相关性评分仍然会混合它们。A-TMA的解决方案是为记录分配角色:旧工作被标记为'superseded'并通过'superseded by'关系链接到新工作。这使得检索阶段能够根据查询是关于过去还是现在来过滤或排序证据。

方法与机制

A-TMA包装现有记忆系统(如Graphiti/Zep或A-Mem),而不改变其核心存储或检索器。它有三个主要阶段。首先,在仓库维护期间,当新事实到达时,A-TMA分析现有记录并将任何较旧的关联事实标记为'superseded',并添加类型化链接(例如,'supersedes','evolves from')。每条记录现在携带状态(active, superseded, transition, or unknown)。其次,当用户查询到达时,A-TMA推断查询的状态视图——用户是在询问当前状态、历史状态还是过渡状态?然后它通过用状态元数据和关系链接扩展宿主的检索结果来构建证据包。对于'current'查询,它将突出显示active记录并抑制superseded记录。对于'historical'查询,它做相反操作。第三,QA模块接收带有显式标签(如'current memory','historical memory','transition linked memory')的证据,提示模型根据请求的状态视图回答。这种解耦的流水线允许在每个阶段进行评估:旧事实是否用正确标签正确存储?检索是否包含了适当的证据?最终答案是否尊重了状态视图?

实验解读

该方法在一个新基准LTP(LoCoMo Temporal Plus)上进行了测试,该基准专门为压力测试ghost memory而构建。它包含10个配置文件,每个有40个状态变化事实(例如,工作、位置)和800个问题探针,一半询问当前状态,一半询问历史状态。在LTP上,将A-TMA添加到Graphiti/Zep记忆系统中,冲突准确率从0.480提升到0.720——提高了24个百分点。在更大、更通用的LoCoMo基准(来自长对话的1,986个QA对)上,时间F1分数从0.0295上升到0.1705。这些数字表明A-TMA有帮助,但较低的绝对F1(17%)表明许多时间问题仍然困难。增益并不均匀:不同的宿主系统和不同的指标显示出混合的改进,因此该方法不是万能的,但在基础系统已存储正确证据时是一种有用的增强。

相关工作

现有记忆系统如Mem0、A-Mem、Zep和Graphiti专注于存储、检索或知识图谱集成,但没有任何一个在所有三个处理阶段显式处理旧事实与当前事实的协调。像LoCoMo这样的基准评估长对话上的通用QA,但不隔离状态变化故障;其他诊断工具(MemTrace, DynamicMem)检查流水线的一部分,但不提供状态角色覆盖层。A-TMA的贡献正是这个覆盖层,它可以添加到多个宿主系统中。

局限与未来工作

该论文诚实地阐述了其局限性。覆盖层只在底层宿主同时存储了新旧事实时才有帮助;如果宿主遗漏了一些,A-TMA无法创造它们。在LoCoMo上的改进虽然统计显著,但时间F1仍处于低水平,意味着许多问题仍未正确回答。此外,实验依赖于特定的70B LLM作为评判者,这可能会引入噪音。没有消融研究显示bank标记、检索对齐和QA条件的各自贡献。该方法还要求推断查询的状态视图,这一步在实践中可能会失败。

通俗例子

想象一个记录你生活的数字笔记本。你写下你的工作为'工程师',然后后来更新为'经理'。一个简单的助手可能看到两条记录,并在你问'我的工作是什么?'时感到困惑。它可能说'工程师'因为那是第一个。A-TMA就像一个图书管理员,不仅归档新笔记,还在旧笔记上盖章'已归档'并画一个箭头指向更新版本。当你问'我现在的工作是什么?'时,图书管理员只给你带有'当前'标签的当前笔记,助手终于知道忽略旧笔记。当你问'我去年是什么工作?'时,图书管理员可以找到归档的笔记并将其标记为'历史'。

读者 takeaway

A-TMA表明,添加显式状态标签并将记忆操作分离为bank、retrieval和QA阶段可以显著减少ghost memory故障。收益是真实但有限的;真正的价值可能在于诊断框架,它能告诉你记忆系统为何失败,而不仅仅是它失败了。未来的记忆系统应采用类似的解耦评估。

框架。Ghost memory 在记忆库、检索通道和生成器中混合了 active、transition 和 superseded 事实。我们将该流水线分离为记忆库状态维护、状态对齐检索和带有显式状态角色的问答,从而每个阶段都可以在最终答案产生前被诊断和优化。
框架。Ghost memory 在记忆库、检索通道和生成器中混合了 active、transition 和 superseded 事实。我们将该流水线分离为记忆库状态维护、状态对齐检索和带有显式状态角色的问答,从而每个阶段都可以在最终答案产生前被诊断和优化。

针对本验证点的可视化上下文:Solution: A-TMA 在三个层面添加状态语义:记忆库维护(标记被取代的事实和链接)、检索(状态对齐的证据包)和问答(标记为当前、历史、过渡的证据)。

检索和问答状态对齐。历史查询可以同时检索旧值和当前值,但不受控制的包可能会突出错误状态。即使存在正确证据,未标记的上下文也可能使问答跟随当前值。使用有界检索控制和显式状态标签来从请求状态进行回答。
检索和问答状态对齐。历史查询可以同时检索旧值和当前值,但不受控制的包可能会突出错误状态。即使存在正确证据,未标记的上下文也可能使问答跟随当前值。使用有界检索控制和显式状态标签来从请求状态进行回答。

针对本验证点的可视化上下文:Solution: A-TMA 在三个层面添加状态语义:记忆库维护(标记被取代的事实和链接)、检索(状态对齐的证据包)和问答(标记为当前、历史、过渡的证据)。

关键证据
  • 问题:长期智能体记忆中的用户事实可能会发生变化,从而产生状态协调问题。
  • 问题:Ghost memory是一种故障,其中旧事实、当前事实和过渡事实并存于记忆库中,在检索时混合并误导答案模型。
  • 方法:A-TMA是一种针对现有记忆系统的状态感知覆层,不替换宿主存储或检索。
  • 方法:A-TMA在三个层面添加状态语义:记忆库维护(标记被取代的事实和链接)、检索(状态对齐的证据包)和问答(标记为当前、历史、过渡的证据)。
  • 方法:记忆记录使用状态(active、superseded、transition、unknown)和指向相关记录的类型化链接来表示。
  • 实验:LTP(LoCoMo Temporal Plus)是一个用于ghost memory的基准,包含10个配置文件和800个探测。
  • 实验:在LTP上,Graphiti/Zep +A-TMA将冲突准确率绝对值提升0.240,从0.480提高到0.720。
  • 实验:在LoCoMo上,Graphiti/Zep +A-TMA将时序F1从0.0295提高到0.1705,平均F1从0.0809提高到0.1556。

其他新增 / 更新来源

研究论文

基准 / 评测

实现 / 代码仓库

网页 / 博客背景

已读过的相关来源

没有可展示的历史来源。

参考资料

研究论文

基准 / 评测

实现 / 代码仓库

网页 / 博客背景

证据: 问题:长期对话智能体需要记住和查询跨会话、多类型且具有复杂关联的信息。
Mandol: An Agglomerative Agent Memory System for Long-Term Conversations (abstract)

Long-term conversational agents need to remember and query cross-session, multi-typed information with complex correlations.

原文链接

证据: 问题:现有的智能体记忆系统依赖异构的向量和图数据库,这碎片化了记忆信息并导致跨数据库I/O延迟高。
Mandol: An Agglomerative Agent Memory System for Long-Term Conversations (abstract)

Existing agent memory systems rely on heterogeneous vector and graph databases, which fragment memory information and cause high cross-database I/O latency.

原文链接

证据: 问题:常见的RAG风格检索方法引入噪声、遗漏关联线索且缺乏token预算控制,降低了LLM的准确性和效率。
Mandol: An Agglomerative Agent Memory System for Long-Term Conversations (abstract)

For retrieval, common RAG-style methods tend to introduce noise, miss correlated clues, and lack token budget control, degrading LLM accuracy and efficiency.

原文链接

证据: 方法:Mandol引入了一个层次化记忆模型,将记忆组织为基本层(原始信息)和高级抽象层(可追溯的抽象记忆),两者统一表示为结构化语义图。
Mandol: An Agglomerative Agent Memory System for Long-Term Conversations (abstract)

a hierarchical memory model that organizes memory into a basic layer representing raw memory information and a high-level abstract layer that agglomerates basic memories into traceable abstract memories, both uniformly represented as structured semantic graphs

原文链接

证据: 方法:Mandol提供了一种凝聚式语义数据结构,结合SemanticMap和SemanticGraph,原生融合了键值、向量和图结构,并提供统一的混合检索算子以消除跨数据库I/O。
Mandol: An Agglomerative Agent Memory System for Long-Term Conversations (abstract)

an agglomerative semantic data structure combining SemanticMap and SemanticGraph, which natively fuses key-value, vector, and graph structures and provides unified hybrid retrieval operators to eliminate cross-database I/O

原文链接

证据: 方法:Mandol的定量查询机制具有查询自适应路由、定量去噪与冲突解决以及token约束上下文生成的特点,且在检索过程中无需LLM参与。
Mandol: An Agglomerative Agent Memory System for Long-Term Conversations (abstract)

a quantitative query mechanism with query-adaptive routing, quantitative denoising and conflict resolution, and token-constrained context generation, all without involving LLMs during retrieval

原文链接

证据: 实验:Mandol在两个长期对话基准上进行了评估:LoCoMo和LongMemEval。
Mandol: An Agglomerative Agent Memory System for Long-Term Conversations (abstract)

Experiments on two widely used long-term conversation benchmarks, LoCoMo and LongMemEval

原文链接

证据: 实验:评估使用了GPT-4o-mini和GPT-4.1-mini作为答案生成主干,以及来自EverMemOS的基于LLM的答案正确性脚本。
Mandol: An Agglomerative Agent Memory System for Long-Term Conversations (page 7, experiments setup)

we use GPT-4o-mini and GPT-4.1-mini as the answer-generation backbones and adopt the LLM-based answer correctness evaluation script from EverMemOS [14].

原文链接