Agent 后训练困境:首步锁定策略,缺乏中途反思机制

omarsar0 · x · 2026-08-20

一篇新论文研究了 Agent 是否能真正通过后训练提升其他 Agent。分析发现,Agent 往往在第一步就锁定训练策略,剩余预算仅用于局部调整。尝试的三种修复方法中,基于经验的支架(scaffold)显著提升了执行效果(GSM8K +12.6,HumanEval +40.8),但策略依然僵化;人类引导虽能改变初始选择,但随后会滑回局部循环;增加推理算力仅对简单任务有效。核心痛点是 Agent 缺乏在执行中重新思考策略的能力。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →