记忆产品横评为何没人信?实测者吐槽基准测试无法对齐

Efficient_Joke3384 · reddit · 2026-09-06

一位长期使用 AI 角色聊天应用并自建记忆方案的用户发帖称:对话的语气和情感表达已接近真人,但记忆仍是短板——即便用昂贵的旗舰模型也不行。本地存记忆再手动回灌可行,但 token 成本攀升很快。

他随后转向把「记忆作为产品」售卖的创业公司,却发现无从判断哪家真的好用:各家记忆基准测试的设置不同、token 预算不同、甚至读取答案打分的模型也不同,分数之间不可比。他向社区求助:大家实际怎么选记忆方案?

帖子折射出 agent 记忆层生态的一个真实痛点:缺乏统一、可复现的评测标准,用户只能靠自己的钱包试错。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →