能答对 78.8% 的旧对话事实,自然回复里只用上 7.9%

MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation

Ryuichi Sumida, Koji Inoue, Tatsuya Kawahara

EMNLP 2026 (Main Conference)

cs.CL, cs.HC

2026-08-25

京都大学把日记机器人的记忆从摘要扩到全文,Direct QA 从 19.7% 升到 70.1%,用户满意度几乎不动;能答对的事实在自然回复里只出现 7.9%。

这篇在解决什么

长期陪伴型对话默认「记得住过去」会让用户更满意。评测却几乎都走同一条路:把历史对话改写成事实问答,问模型上次推荐了哪位歌手。LoCoMo、LUFY、RealTalk 都是这个 Direct QA 格式。

没人验证过问答分更高,真人会不会打更高分。被问到时能召回,并不自动等于对话里会把旧事织进回复。这个假设一直没被实地打过。

方法

京都大学做了 4 个月实地部署。40 名英语流利用户每天跟日记机器人 Luke(GPT-4.1-mini)聊天,共 1,872 场、21,575 轮。每场随机分到 7 种记忆条件,全部都带着同一份历史摘要,区别只在摘要之上再加多少容量:

重要性由 LUFY 数据上微调的 RoBERTa 打分。用户每场打 1–7 分。分析时去掉评分几乎不变(标准差 ≤0.5)和内容质量有问题的 11 人,剩 29 人、1,270 场,满意度做成用户内 z 分数。

再用 GPT-5.4 扫全部场次,抓用户真正提起记忆的时刻,人工复核得到 147 个真阳性,精确率 95.5%。这类时刻很稀:大约 3.5% 的场次、1.4% 的用户轮次,平均每 73 轮才出现一次。其中用户主动提起的 72 条(62 条自己补述 + 10 条「你还记得吗」)做成 MemUse,每条拆成 3–5 道事实题,共 316 题。同一份重构上下文上打三个分:

人工对照 56 条 Natural Integration,人与人 Cohen's κ=0.57,模型阳性率和人接近(51.8% 对 51.8%/55.4%)。

结果

容量把现有基准 Direct QA 从 Summary 的 19.7% 拉到 LC-100% 的 70.1%。满意度跟不上。每个条件相对 Summary 的均值差都不到 0.06 个用户内标准差,Summary 还略高(+0.02 对 LC-100% 的 -0.04)。回复长度、专有名词密度、跨会话连续性各自能预测满意度,记忆条件不能。延迟也对不上:Summary 均延迟 1.93 秒,LC-100% 要 3.27 秒,延迟与评分 |ρ|<0.06。

条件现有基准 QAMemUse Direct QA自然引用自然融入满意度 z
Summary19.7%44.9%7.9%23.6%+0.02
LC-100%70.1%78.8%7.9%22.2%-0.04
RAG-100%63.7%62.2%7.3%26.4%-0.02

限制到用户主动提起记忆的 48 场,故事反过来。Natural Integration 与满意度相关(ρ=+0.29, p=.046),成功融入的场次高 0.56 个用户内标准差;Direct QA 几乎无关(ρ=+0.03)。LC-100% 在 Direct QA 上最高(78.8%),在 Natural Integration 上最低(22.2%)。用户被迫把系统忘掉的上下文再讲一遍时,话越长分越低。

同一模型、同一上下文,MemUse Direct QA 78.8%,自然回复里只引用 7.9%,差 71 分。两条指标的 Spearman 相关 ρ=-0.009。72 条 LC-100% 回复里,38.9% 是无视线索的共情套话,23.6% 编造回忆,26.4% 只抓住大意,真正把细节织进去的只有 8.3%。

GPT-5.5 和 Gemini 3.1 Pro 形状一样:Direct QA 随容量升 32–34 分,Natural Integration 在同一模型内最多摆 8.2 分。更强模型只抬高融入底板(Summary 上分别 23.6%、32.9%、53.4%),容量换不来融入。Mem0 和 Letta 把 Natural Integration 抬到 58.3% 和 56.9%,事实缺口还在:41.5% 对 7.3%,61.4% 对 10.8%。两步「先抽出再生成」里,抽对细节的 48 条中有 37 条生成时仍没用上,占 77%。瓶颈在对话生成,不在检索。

系统主动提起旧事没有对称回报(ρ=-0.05)。64 场里用户顺着旧话题往下聊的只有 30%。8 次时机不对的回调,满意度低 0.48 个标准差。

为什么重要

给做长期记忆的人一个测量学警告:Direct QA 在测「问了能不能找回」,用户在意的是「提了一嘴,系统有没有接上」。

加上下文、加 RAG、加容量,问答分很好看,对话行为几乎不动。LC-100% 相对 Summary 输入 token 到 22 倍,延迟从 1.93 秒到 3.27 秒,满意度还略低。钱花在容量上,可能买错了东西。

Mem0 和 Letta 说明换记忆架构能抬融入率,仍关不上事实缺口,而且这次是离线评测,没有部署满意度。下一步更该打生成侧:什么时候该点名细节,什么时候闭嘴。

局限与存疑

七个条件都带着同一份摘要,空结果说的是「摘要之上再加容量」,不是「记忆毫无用处」。MemUse 只抓显式语言信号,3.5% 的场次是下界,隐性该用记忆的时刻被漏掉了。融入与满意度的关联来自 16 个用户的 48 场,观察性不是随机干预,线性混合模型的 p=.082,Spearman 过不了 Bonferroni。样本 92.5% 女性,场景是日记,任务型助手不一定成立。Natural Integration 是二分判定。

术语

原文与代码

相关论文

全部论文解读