PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents
Shuhan Xue, Zixin Ding, Yichen Shen, Yinjie Wang, Zhenfei Yin, Yingcheng Wu, Yuxin Chen, Mengdi Wang, Ling Yang
cs.CL
2026-08-05
PAST-Bench 用 26 个场景、204 个任务、开/关记忆的对照实验测了七个底座模型:留存经验带来的提升是真的,但跨能力很不均,同样分数背后机制未必对。
个性化 Agent 会跨会话保留偏好、任务历史、工具流程和学到的技能。直觉上,留存的经验应该让它越用越懂你。但「真的变强了吗」这件事从来没有人干净地测过。一个 Agent 第二次任务做得好,可能是因为它记住了上一次,也可能只是底座模型本身强、提示词顺、这次任务简单,或者打分本身有噪声。现有 benchmark 只看一次性任务表现,把「底座能力」和「靠经验自我改进」混在了一起。
PAST-Bench 要做的就是把这个归因问题隔离开。它定义「在线自我演进」:Agent 在不重训模型、不改提示词、不靠长上下文的前提下,复用过往经验来改变后续行为。这套 benchmark 给的是归因答案,不是排行榜。
benchmark 覆盖 26 个场景、204 个 episode,横跨四类能力:
每个任务族按顺序跑四种角色:冷启动(还没存任何东西)、学习(把目标信息写进持久层)、评估(去掉触发措辞、在新会话里考复用)、控制(确认增益不是靠捷径或表面背诵骗来的)。
关键设计是配对消融:同一个 prompt、同一套 grader、工具栈和随机种子下,分别跑「关掉记忆」和「打开记忆」两版。主要看两个指标:自我演进增益 Δ(开减关的差),和机制证据分 Mech,后者判断增益是不是真走了「写、取、正确应用」这条预期路径。
七个底座模型(GLM-5.1、Kimi K2.6、DeepSeek-V4-Pro、MiniMax-M2.7、GPT-5.4、Claude Sonnet 4.6、Claude Opus 4.6)上,记忆都带来了正增益,Overall Δ 从 +0.13 到 +0.24。但能力分布很不均:GPT-5.4 在记忆和更新上最强,记忆维度涨 38%、更新涨 35%;Kimi 和 DeepSeek 主要靠记忆拉分。
| 底座 | Overall Δ | Mech |
| GPT-5.4 | +0.24 | 0.80 |
| Claude Sonnet 4.6 | +0.20 | 0.76 |
更值得在意的是:相同分数背后机制未必一致。两个 Agent 可能 Overall Δ 都是 +0.13,但一个 Mech 0.64(真走了预期路径),另一个只有 0.39(可能是蒙的)。这正是这类 benchmark 最该暴露的东西。
作者据此提出 Hermes+,加了五个运行时机制:E1 计划期先查存档、E2 类型化记忆绑定(带 scope、过期、新旧值)、E3 可打补丁的技能排序、E4 取回门(任务依赖过往状态却没读记忆时拦住草稿答案)、E5 同步收尾把新值写成权威产物。Hermes+ 把更新维度的增益从 +0.12 拉到 +0.24,跨五个底座迁移时 GPT-5.4 上拿到 Overall Δ +0.24、Mech 0.80。
但有一个诚实的数字必须摆出来:Hermes 与 Hermes+ 的 Overall Δ 是 0.13±0.04 对 0.15±0.06,这 0.02 的整体提升小于运行间抖动。真正干净的提升只在更新维度。所以「Hermes+ 全面更好」这个结论要打折,它的贡献是诊断方法加上更新维度的小幅真改进。
任何做长期记忆、个性化 Agent、或 agent 框架的人都该看这篇。它给的不是「谁第一」,是一个测量学警告:你报告的「Agent 越用越好」可能是底座强、可能是噪声、可能是蒙对,只有配上 Mech 这种机制证据才站得住。框架开发者也能直接对照那五个机制,看自己缺哪一环,多数缺的是 E4 取回门和 E5 同步收尾。
作者自己列了几条:任务族是合成的、隔离评估,缺真实人写场景;只测了当下任务序列,没测一个族的经验跨族迁移;四类能力是必要地基,没覆盖更强的递归改进;Mech 分测的是路径一致性而非因果必要性,要真正坐实得做反事实干预(删掉、替换、污染那个 artifact 再看)。
额外存疑的一点:这套 Mech 打分假设存在唯一「语义上正确」的持久路径,但不同 Agent 完全可能把同一段经验存成记忆、技能、结构化文档或改写后的策略,都合理。强求走同一条路,可能低估了某些 Agent。