Agent 记忆 API 基准注水:同一产品自报与三方成绩差 20-30 分
Efficient_Joke3384 · reddit · 2026-09-04
一位开发者实测对比 agent 记忆 API(Mem0、Zep、Letta、MemoryLake)时发现,各家都引用 LoCoMo 基准,但自报分数与第三方数据严重打架:
- Mem0 自报 92.5%,第三方表格仅约 64%
- Zep 自报 94.7%,第三方约 85%
- Letta 无自报数字,第三方约 74%
- MemoryLake 自称 94%,但无独立验证
同一家产品的同一基准分数因报告方不同可相差 20-30 个百分点,厂商之间甚至互不信任——Zep 曾专门发博客质疑 Mem0 的数字(「Mem0 真的是 SOTA 吗」)。
作者认为原因在于各家的测试设置与「答对」的判定标准不一致,导致 LoCoMo 分数已沦为营销话术而非可比指标,并呼吁社区建立真正可信的评测。
「编程与Agent」频道最新
- Software World:用智能体模拟 GitHub 生态研究多智能体协作 — PangWeiKoh · 2026-09-04
- 开发者用 Codex 复刻暗黑破坏神玩法,自称 Path of Codex — Dimillian · 2026-09-04
- GPT-6 演示:在 Blender 里全自动建模,一键导出 UE5 关卡 — petewoodbridge · 2026-09-04
- Gemini CLI、Crush 与 Chrome DevTools MCP 到底该怎么选 — Different_Regret_146 · 2026-09-04
- OpenClaw 新手引导大改版,手机与 Mac 双网关一键配好 — steipete · 2026-09-04
- Instinct 创始人推出免界面个人 agent,藏在 iMessage 与 WhatsApp 里 — Scobleizer · 2026-09-04