新论文提出 Agent Plasticity:衡量 AI 智能体从经验中自我改进的效率

anirudhg9119 · x · 2026-10-09

arXiv 论文《Agent Plasticity: Measuring Self-Improvement Through Experience》提出,现有评测只衡量智能体某一时间点的能力,而不是它学习的效率。作者让智能体把过往经验摊销为可复用的 artifact 并被后续实例继承,在训练与 held-out 环境中按 checkpoint 测量收益并计入学习成本,定义「agent plasticity」=单位学习成本带来的 held-out 性能提升。

关键发现:

案例:国际象棋中 Claude 模型在 300 步限制下得 0 分,随后学会在接近步数限制时重视和棋,最终能拖到对手 Stockfish 出错再取胜;NetHack 中模型因原始按键祈祷而死,之后增加了一条通过控制器祈祷的可复用规则。论文结论:从经验中学习是可测量的,但远非自动发生。

所属事件:Agent Plasticity 新指标发布:最强智能体未必最会学习(11 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →