新论文提出 Agent Plasticity:衡量 AI 智能体从经验中自我改进的效率
anirudhg9119 · x · 2026-10-09
arXiv 论文《Agent Plasticity: Measuring Self-Improvement Through Experience》提出,现有评测只衡量智能体某一时间点的能力,而不是它学习的效率。作者让智能体把过往经验摊销为可复用的 artifact 并被后续实例继承,在训练与 held-out 环境中按 checkpoint 测量收益并计入学习成本,定义「agent plasticity」=单位学习成本带来的 held-out 性能提升。
关键发现:
- 前沿模型在相同学习机会下提升轨迹差异巨大:有的获得持续大幅提升,有的停留在甚至低于初始水平。
- 训练域内的提升往往只能部分迁移到分布外条件,终点能力与获取效率并不等同。
- 学习复用率与提升幅度相关但不充分:即使 94–98% 的相关决策都在复用 artifact,提升幅度仍差异很大;强提升者 83–99% 的剩余失败发生在 artifact 正在使用时。
案例:国际象棋中 Claude 模型在 300 步限制下得 0 分,随后学会在接近步数限制时重视和棋,最终能拖到对手 Stockfish 出错再取胜;NetHack 中模型因原始按键祈祷而死,之后增加了一条通过控制器祈祷的可复用规则。论文结论:从经验中学习是可测量的,但远非自动发生。
所属事件:Agent Plasticity 新指标发布:最强智能体未必最会学习(11 条相关)→
「编程与Agent」频道最新
- 两周产 23 条广告 100 个版本:AI 视频制作工作流的 10 项实战复盘 — justin_hart · 2026-10-09
- 支持 120 国号码接入,独立开发者重构 AI 电话平台摆脱 Twilio — redouanea · 2026-10-09
- Git 挑战第 5-6 天:多智能体「组织架构」频崩,调试组织成主任务 — Al_Grigor · 2026-10-09
- 开发者感慨:未来孩子难以理解当年要手动打断点调试代码 — eherrerosj · 2026-10-09
- 用户撤销权限后 Codex 仍可读写旧文件夹,且官方无法解释 — Some-Following-392 · 2026-10-09
- OpenAI Live API可用session.instructions.append实时转向 — juberti · 2026-10-09