预注册研究:Agent 记忆中「选择」可替代「抽取」,成本降 3000 倍
Rishabh Sharma · hf · 2026-10-07
这篇 Hugging Face 论文提出核心问题:对话式记忆是否需要 LLM 抽取的事实条目,还是只需选择合适的原始对话轮次?已有研究结论相互矛盾。
研究在 LoCoMo 与 LongMemEval 上做了预注册实验,关键发现:
- 紧预算下,用类型化决策模型 Jev 单次调用选出的原始轮次,不劣于 LLM 抽取式记忆(单侧 95% 界 -3.0 分,对照 -5 分容差);盲评人类打分缩小了差距但不改变结论
- 写入原始轮次的成本比抽取低 3061 倍,且换第二个回答模型结论仍成立
- 重排序的收益随预算增大而缩小:保留 3/30 候选时 LoCoMo 加 17.4 分、LongMemEval 加 9.1 分;宽松预算下仅加 1.5 和 1.1 分,且此时抽取系统更准确——这解释了已有研究结果为何矛盾
- 匹配上下文时,Jev 选择准确度不劣于 LLM 重排器(界 -2.0),延迟仅三分之一,并优于多次调用的图遍历
- 重排序会降低正确弃答率
计划、代码与评分答案均已开源。
「编程与Agent」频道最新
- Jev 模型当 LLM 裁判:一致性提升 Agent 评测可靠性 — omarsar0 · 2026-10-07
- NVIDIA 开源 OpenShell:不改写 agent 代码即可强制约束其访问边界 — dl_weekly · 2026-10-07
- DeepLearning.AI 与 Qdrant 推免费课程:端侧记忆 AI 助手实战 — DeepLearningAI · 2026-10-07
- Cursor 开放 Origin 应用市场:伙伴应用经审核即可上架 — tetsuoai · 2026-10-07
- Agently 发布:接管 Mac 的个人智能体,号称苹果做不出 — Scobleizer · 2026-10-07
- Prompt2ELF:用 AI 模型替代整套编译工具链的脑洞项目 — UncommonSort · 2026-10-07