PAST-Bench:智能体记忆能力评测基准发布

alifcoder · x · 2026-08-05

PAST-Bench 是一个用于评估个人智能体基于过往经验进化能力的新基准。它涵盖了 26 个任务族场景和 204 个片段,测试了记忆、程序复用、信息收集和更新 4 项能力。

研究团队在 7 个基础模型和 4 个智能体框架上进行了测试,发现保留经验确实能改善未来行为,但提升幅度高度依赖于具体能力、模型和框架。这意味着开发者不能盲目照搬他人的记忆设计,而必须在自己的技术栈上进行测试。

所属事件:普林斯顿推出PAST-Bench:评估个人智能体经验积累能力(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →