Agent 记忆 API 基准注水:同一产品自报与三方成绩差 20-30 分

Efficient_Joke3384 · reddit · 2026-09-04

一位开发者实测对比 agent 记忆 API(Mem0、Zep、Letta、MemoryLake)时发现,各家都引用 LoCoMo 基准,但自报分数与第三方数据严重打架:

同一家产品的同一基准分数因报告方不同可相差 20-30 个百分点,厂商之间甚至互不信任——Zep 曾专门发博客质疑 Mem0 的数字(「Mem0 真的是 SOTA 吗」)。

作者认为原因在于各家的测试设置与「答对」的判定标准不一致,导致 LoCoMo 分数已沦为营销话术而非可比指标,并呼吁社区建立真正可信的评测。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →