又一个反例:图记忆在 LongMemEval 上输给平面向量基线
CShorten30 · x · 2026-09-06
一项针对「图记忆是否真的优于平面向量检索」的受控实验给出否定答案:研究者把每轮对话抽取为带类型的节点和属性边,从两跳子图回答问题,并将候选生成预算固定为 5 个检索根节点,保证公平对比。
在 LongMemEval 上,图方案 token F1 仅 0.42,平面向量基线为 0.47;对 500 个问题做配对 bootstrap 检验,差距为 -0.050(95% CI -0.085 至 -0.016),统计显著。
损失集中在需要回忆某条具体助手回复的问题上:判定正确率从 0.911 跌至 0.607——把一轮对话拆成实体节点时丢失了原文表面形式,而这恰是此类问题所需。这是图记忆近期又一个负面结果。
「编程与Agent」频道最新
- 用多智能体做卖方尽调:识别假评价与实体关联的产品设计 — AgentVN · 2026-09-06
- AutoHedge 开源:用 Swarm 智能体几分钟搭一个自动对冲基金 — The-Swarm-Corporation · 2026-09-06
- OpenAI 官方开源 Codex Skills 目录,2.5 万星 — openai · 2026-09-06
- 密码学教授用编码 Agent 辅助教学:目标不是代码而是让学生学会 — matthew_d_green · 2026-09-06
- Codex 的一款 GPT-Astra 配置:百万上下文加低推理力度 — EXM7777 · 2026-09-06
- 密码学家 Matthew Green 重构课程:允许用编码 Agent,加考对抗式实验课 — matthew_d_green · 2026-09-06