个性化 Agent 靠积累经验真能变强?PAST-Bench 实测:提升真实却不均

PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents

Shuhan Xue, Zixin Ding, Yichen Shen, Yinjie Wang, Zhenfei Yin, Yingcheng Wu, Yuxin Chen, Mengdi Wang, Ling Yang

cs.CL

2026-08-05

PAST-Bench 用 26 个场景、204 个任务、开/关记忆的对照实验测了七个底座模型:留存经验带来的提升是真的,但跨能力很不均,同样分数背后机制未必对。

这篇在解决什么

个性化 Agent 会跨会话保留偏好、任务历史、工具流程和学到的技能。直觉上,留存的经验应该让它越用越懂你。但「真的变强了吗」这件事从来没有人干净地测过。一个 Agent 第二次任务做得好,可能是因为它记住了上一次,也可能只是底座模型本身强、提示词顺、这次任务简单,或者打分本身有噪声。现有 benchmark 只看一次性任务表现,把「底座能力」和「靠经验自我改进」混在了一起。

PAST-Bench 要做的就是把这个归因问题隔离开。它定义「在线自我演进」:Agent 在不重训模型、不改提示词、不靠长上下文的前提下,复用过往经验来改变后续行为。这套 benchmark 给的是归因答案,不是排行榜。

方法

benchmark 覆盖 26 个场景、204 个 episode,横跨四类能力:

每个任务族按顺序跑四种角色:冷启动(还没存任何东西)、学习(把目标信息写进持久层)、评估(去掉触发措辞、在新会话里考复用)、控制(确认增益不是靠捷径或表面背诵骗来的)。

关键设计是配对消融:同一个 prompt、同一套 grader、工具栈和随机种子下,分别跑「关掉记忆」和「打开记忆」两版。主要看两个指标:自我演进增益 Δ(开减关的差),和机制证据分 Mech,后者判断增益是不是真走了「写、取、正确应用」这条预期路径。

结果

七个底座模型(GLM-5.1、Kimi K2.6、DeepSeek-V4-Pro、MiniMax-M2.7、GPT-5.4、Claude Sonnet 4.6、Claude Opus 4.6)上,记忆都带来了正增益,Overall Δ 从 +0.13 到 +0.24。但能力分布很不均:GPT-5.4 在记忆和更新上最强,记忆维度涨 38%、更新涨 35%;Kimi 和 DeepSeek 主要靠记忆拉分。

底座Overall ΔMech
GPT-5.4+0.240.80
Claude Sonnet 4.6+0.200.76

更值得在意的是:相同分数背后机制未必一致。两个 Agent 可能 Overall Δ 都是 +0.13,但一个 Mech 0.64(真走了预期路径),另一个只有 0.39(可能是蒙的)。这正是这类 benchmark 最该暴露的东西。

作者据此提出 Hermes+,加了五个运行时机制:E1 计划期先查存档、E2 类型化记忆绑定(带 scope、过期、新旧值)、E3 可打补丁的技能排序、E4 取回门(任务依赖过往状态却没读记忆时拦住草稿答案)、E5 同步收尾把新值写成权威产物。Hermes+ 把更新维度的增益从 +0.12 拉到 +0.24,跨五个底座迁移时 GPT-5.4 上拿到 Overall Δ +0.24、Mech 0.80。

但有一个诚实的数字必须摆出来:Hermes 与 Hermes+ 的 Overall Δ 是 0.13±0.04 对 0.15±0.06,这 0.02 的整体提升小于运行间抖动。真正干净的提升只在更新维度。所以「Hermes+ 全面更好」这个结论要打折,它的贡献是诊断方法加上更新维度的小幅真改进。

为什么重要

任何做长期记忆、个性化 Agent、或 agent 框架的人都该看这篇。它给的不是「谁第一」,是一个测量学警告:你报告的「Agent 越用越好」可能是底座强、可能是噪声、可能是蒙对,只有配上 Mech 这种机制证据才站得住。框架开发者也能直接对照那五个机制,看自己缺哪一环,多数缺的是 E4 取回门和 E5 同步收尾。

局限与存疑

作者自己列了几条:任务族是合成的、隔离评估,缺真实人写场景;只测了当下任务序列,没测一个族的经验跨族迁移;四类能力是必要地基,没覆盖更强的递归改进;Mech 分测的是路径一致性而非因果必要性,要真正坐实得做反事实干预(删掉、替换、污染那个 artifact 再看)。

额外存疑的一点:这套 Mech 打分假设存在唯一「语义上正确」的持久路径,但不同 Agent 完全可能把同一段经验存成记忆、技能、结构化文档或改写后的策略,都合理。强求走同一条路,可能低估了某些 Agent。

术语

原文与代码

相关论文

全部论文解读