Meta 提出「智能体可塑性」:衡量自改进 Agent 每美元学到了多少
omarsar0 · x · 2026-10-09
Meta Superintelligence Labs 发布关于自改进智能体的论文,核心问题是:自改进到底划不划算?
- 提出 agent plasticity(智能体可塑性) 指标:在模型权重冻结、每轮从全新上下文启动的条件下,每花一美元学习成本在 held-out 任务上获得的收益。
- 关键发现:表现最好的模型往往不是学习效率最高的模型。在棋类、围棋和 Hex 中,Claude Fable 5 最终分数最高,而 GPT-5.6 Sol 每美元收益最大。
- NetHack 中只有 Claude Opus 5.5 显著提升,约花 1,073 美元学习成本换来 66 个归一化点。
- 论文还讨论了慢学习模型常忽略的变量:笔记、技能、跨轮次的工具调用等对自改进的驱动作用。
所属事件:Meta 提出 Agent Plasticity:能力最强不等于学习效率最高(15 条相关)→
「编程与Agent」频道最新
- 并行跑 5 个编码 Agent 不算自动化:四层架构构建 Agentic 软件工厂 — intellectronica · 2026-10-10
- 用公开 API 组 AI Agent 自动跑 Apple Search Ads 投放 — jdluk87 · 2026-10-10
- fchollet 力挺 Busabase:开源 MIT 数据库让 Agent 工作成果可沉淀复用 — fchollet · 2026-10-10
- 前 OpenAI Operator 研究员展示真实世界 RL 高精度任务训练成果 — ZhaoMandi · 2026-10-10
- 让 agent 自我剖析:一条 prompt 让它画出自己的工作流运行图 — brada · 2026-10-10
- LlamaParse 实测:嵌套表格也能完整解析,Micron 财报 18 项数据全对位 — llama_index · 2026-10-10