LoCoMo 等记忆基准被指存在严重缺陷,有更好替代吗?

LowDistribution3995 · reddit · 2026-08-25

作者批评现有的 AI 记忆基准测试(如 LoCoMo 和 LongMemEval)存在严重缺陷:LoCoMo 的答案键质量差、题目限制主观且格式不一致,导致不可复现的高分;LongMemEval 则只是简单的“大海捞针”重复测试。作者指出用简单的 FAISS 甚至 Ctrl+F 就能击败这些测试,且它们使用的第三方对话数据不符合实际 Agent 运行模式。作者寻求能真正衡量召回准确性的替代基准。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →