LoCoMo 等记忆基准被指存在严重缺陷,有更好替代吗?
LowDistribution3995 · reddit · 2026-08-25
作者批评现有的 AI 记忆基准测试(如 LoCoMo 和 LongMemEval)存在严重缺陷:LoCoMo 的答案键质量差、题目限制主观且格式不一致,导致不可复现的高分;LongMemEval 则只是简单的“大海捞针”重复测试。作者指出用简单的 FAISS 甚至 Ctrl+F 就能击败这些测试,且它们使用的第三方对话数据不符合实际 Agent 运行模式。作者寻求能真正衡量召回准确性的替代基准。
「研究」频道最新
- Pew 分析近 50 万网页:ChatGPT 发布后超三分之一页面现 AI 生成痕迹 — The Decoder · 2026-08-25
- 微软发布 Skala 1.1,提升计算化学预测精度 — vdbergrianne · 2026-08-25
- 研究发现 RL 强提示词无需更多细节,精简反而更优 — xeophon · 2026-08-25
- 研究案例:两个 LLM 编写与审查代码均未发现“未来数据”漏洞 — niacolhealth · 2026-08-25
- UIUC 教授:可靠性是 AI 系统的功能基石 — tianyin_xu · 2026-08-25
- 如何避免 AI 聊天机器人产生幻觉 — henkvaness · 2026-08-25