Agent Plasticity 新指标:衡量智能体从经验中自我改进的效率
Harman Singh、Anuj Mahajan、Jason 等人发布论文《Agent Plasticity: Measuring Self-Improvement Through Experience》(arXiv 2610.08902),团队还包括 Rob Fergus、Sanjeev Arora 等知名学者。论文核心主张是:评估智能体不仅要看它能做什么,还要看它如何改进,并提出 Agent Plasticity(智能体可塑性) 指标。
已确认
- 指标定义:智能体将经验摊销(amortize)为可复用工件(artifacts)后,在达到饱和前,每单位学习成本所换取的 held-out 性能提升。
- 实验在 Chess、Go、Hex 三个游戏上展开;结果显示 GPT-5.6 Sol 的学习效率约为 Claude Fable 5 的 5 倍。
- 核心发现之一:最强的智能体未必最会学习;即使四个模型在 94–98% 的相关决策中都会复用已有产物,收益仍然差距很大,说明复用本身不足以解释学习效果。
- 案例展示:@anirudhg9119 在系列帖子中转述了多个具体例子。Claude Fable 5 在国际象棋上,当一局在 300-ply 上限记 0 分后,会修改自己的引擎去重视和棋,后续 checkpoint 甚至能顶住 Stockfish 直到被将死。Claude Opus 5.5 在 NetHack 中曾因通过原始按键 praying 而死亡,随后它给控制器加了一条可复用规则,改为通过控制器祈祷,后来这次祈祷真的治好了它,体现了持续性的自我改进。
为什么重要
- @anirudhg9119 指出,「有记忆不等于会学习」:多数智能体难以从经验中改进,该工作为区分记忆与真正的自我改进提供了可量化的衡量框架。
- 部分智能体几乎不改进的原因线索在于它们不复用学到的成果,但数据表明复用率高也不保证收益,这为后续研究智能体学习机制留下开放问题。
2026-10-09 ~ 2026-10-09 · 7 条相关
一手来源
- 新论文提出 Agent Plasticity:衡量智能体从经验中自我改进的效率 — anirudhg9119 ·
- Agent Plasticity 论文正式发布:作者阵容含 Rob Fergus、Sanjeev Arora 等大咖 — anirudhg9119 ·
- 新指标 Agent Plasticity:GPT-5.6 Sol 学习效率约为 Claude Fable 5 的 5 倍 — anirudhg9119 ·
- 提出 Agent Plasticity:衡量智能体从经验学习的效率,最强者未必最会学 — RulinShao · 2026-10-09
- 【源头】新指标 Agent Plasticity:GPT-5.6 Sol 学习效率约为 Claude Fable 5 的 5 倍 — anirudhg9119 · 2026-10-09
- 为什么有的智能体难提升?四个模型复用率 94-98% 收益却大相径庭 — anirudhg9119 · 2026-10-09
- Agent Plasticity 论文连载:Claude 在 NetHack 中学会把祈祷改成可复用规则 — anirudhg9119 · 2026-10-09
- 为什么多数 Agent 学不到东西:有记忆不等于会学习 — anirudhg9119 · 2026-10-09
- 【源头】Agent Plasticity 论文正式发布:作者阵容含 Rob Fergus、Sanjeev Arora 等大咖 — anirudhg9119 · 2026-10-09
- 【源头】新论文提出 Agent Plasticity:衡量智能体从经验中自我改进的效率 — anirudhg9119 · 2026-10-09