Graph 记忆反不如平铺检索?LongMemEval 实测 F1 低 0.05

omarsar0 · x · 2026-09-02

一项研究对比了图记忆与平铺向量检索在长期智能体中的表现。在 LongMemEval 上,图记忆方法的 Token F1 为 0.42,低于平铺向量基线的 0.47。统计检验显示差距显著(95% CI -0.085 至 -0.016)。问题在于图结构将对话轮次拆分为实体节点,丢弃了表面形式,导致在回忆特定助手轮次时正确率从 0.911 跌至 0.607。不过,其遗忘模块表现较好,能基于时效性和访问频率有效剪枝。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →