Graph 记忆反不如平铺检索?LongMemEval 实测 F1 低 0.05
omarsar0 · x · 2026-09-02
一项研究对比了图记忆与平铺向量检索在长期智能体中的表现。在 LongMemEval 上,图记忆方法的 Token F1 为 0.42,低于平铺向量基线的 0.47。统计检验显示差距显著(95% CI -0.085 至 -0.016)。问题在于图结构将对话轮次拆分为实体节点,丢弃了表面形式,导致在回忆特定助手轮次时正确率从 0.911 跌至 0.607。不过,其遗忘模块表现较好,能基于时效性和访问频率有效剪枝。
「编程与Agent」频道最新
- LangSmith 推出 Messages View 助力 Agent 调试 — hwchase17 · 2026-09-02
- 30 种 LLM 智能体记忆技术合集开源 — tom_doerr · 2026-09-02
- Fable 5.1 体验:更倾向扮演管理者与全局规划 — AlchainHust · 2026-09-02
- 开源 iOS 手机农场:浏览器实时控制真机运行 TikTok — JiliJeanlouis · 2026-09-02
- 实测 Fable 5.1:接手多天难题,比 Opus 更不「Claude 腔」 — DimitrisPapail · 2026-09-02
- 用 AI 重构 BaoCut 界面,让它反驳我的设计意见 — dotey · 2026-09-02