不建任何记忆结构,智能体直接搜原始聊天记录,准确率反超知识图谱方案

When Your Agent Opens the Chat App: Agent-Controlled Search over Raw Chat Logs Rivals Structured Memory

Ruizhe Li, Licheng Zhang, Benfeng Xu, Mingxuan Du, Zheren Fu, Weidong Chen

cs.CL

2026-08-13

ReFind 不预先把对话加工成图或树,只用 BM25 按轮次索引原始记录,让智能体多轮检索加四个聊天原生控制。MemoryAgentBench 上平均 58.2,超过图记忆 HippoRAG 2 的 53.2。

这篇在解决什么

智能体的记忆系统越来越重。GraphRAG、HippoRAG、RAPTOR 这些方案,都在问题到来之前就把原始对话加工成图、树、摘要或向量库。这是在问题还没出现时下注:决定抽象什么、丢掉什么,预处理时漏掉的细节后面很难找回来,而且建索引本身要花真金白银。作者问了一个被各种花哨架构绕开的问题:这些收益里,到底有多少来自结构本身,又有多少只是来自对原始记录做了还过得去的检索?他们用最极端的反例来回答:什么结构都不建。

方法

ReFind 的设计原则是把智能从提前建好的语义索引搬到查询时的自适应检索。原始聊天记录一字不改地留着,只在 turn(一轮对话)粒度上建 BM25 倒排索引,加新消息就是 append,零模型调用。

系统分两段。第一段是 ReAct 风格的检索循环,模型自己决定关键词和参数,多轮搜索、看结果、存证据、改写查询;第二段单独做推理,把收集到的证据按会话分组、按时间排序,再回答。这种切分让检索循环和答案生成不抢上下文窗口。

四个聊天原生的控制项,每一个对应聊天记录的一个特性:会话感知的 RRF 重排(同一会话里多轮命中就把整段提权)、局部上下文扩展(命中那一轮前后各取 2 轮)、时间收窄、跳过已查过的会话。默认每次返回 top-5 轮。

结果

MemoryAgentBench 的六项任务、约 2800 道题,GPT-4o-mini 同一骨干:

系统平均准确率
单次 BM25-RAG48.8
HippoRAG 2(图记忆)53.2
ReFind58.2

ReFind 在六项里五项第一。相对单次 BM25-RAG,单跳问答高 17 分、多跳高 13 分。在更难的 LongMemEval-S/M 上换 GPT-5-mini 跑五次,ReFind 拿到 93.2 / 89.3,超过 STITCH(86.0 / 80.0)、GraphRAG(84.0 / 66.7)、HippoRAG 2(80.0 / 66.7),对 HippoRAG 2 的领先从 GPT-4o-mini 的 0.6 分拉大到 13.2 和 22.6。

消融说明功劳归谁:去掉四个聊天原生控制只剩通用 agentic BM25,S 掛掉 14.5 分;只搜一次不改写,M 掉 20.4 分;换成稠密或混合检索后端都不如 BM25。每次查询平均只跑 2.5 到 2.6 次搜索、5 次 LLM 调用。对比之下,GraphRAG 在约百万 token 的语料上要抽 8564 个实体、20691 条关系,烧 281 分钟 GPT-4-turbo。

为什么重要

这篇把存储保真和访问智能拆开了。保留原始记录意味着每个细节都在、更新是 append-only,而让智能体自己控制搜索决定了哪些细节对当前问题重要。对做智能体记忆的人来说,这是一个务实的默认起点:先用忠实存储加可控搜索,再针对需要低延迟或抽象层的工作负载补结构。另一个实在的好处是成本和可审计性:没有任何离线索引要建要维护,搜索过程是透明的词面匹配,出错能看出来。

局限与存疑

作者自己划了边界:这套方法擅长精确检索和事实更新跟踪,跟语义、低延迟的记忆机制是互补不是替代。多跳事实整合(FC-MH)即便第一也只有 8.8,绝对值很低。LongMemEval-S/M 子集很小,分别只有 50 和 15 题,五次跑的方差虽小但样本本身有限。多数基线数据是从前人论文里复用的,不是本地重跑。更根本的一点是,这套结果建立在问题偏精确取证的前提下,那些需要语义抽象、词面根本对不上的问题,BM25 本就是短板,论文没有正面检验这种场景。

术语

原文与代码

社区讨论

相关论文

全部论文解读