又一个反例:图记忆在 LongMemEval 上输给平面向量基线

CShorten30 · x · 2026-09-06

一项针对「图记忆是否真的优于平面向量检索」的受控实验给出否定答案:研究者把每轮对话抽取为带类型的节点和属性边,从两跳子图回答问题,并将候选生成预算固定为 5 个检索根节点,保证公平对比。

在 LongMemEval 上,图方案 token F1 仅 0.42,平面向量基线为 0.47;对 500 个问题做配对 bootstrap 检验,差距为 -0.050(95% CI -0.085 至 -0.016),统计显著。

损失集中在需要回忆某条具体助手回复的问题上:判定正确率从 0.911 跌至 0.607——把一轮对话拆成实体节点时丢失了原文表面形式,而这恰是此类问题所需。这是图记忆近期又一个负面结果。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →