TEMPO:通过宏步策略优化解决长周期 Agent 训练难题

teortaxesTex · x · 2026-08-15

针对长周期 Agent 强化学习中训练信号稀疏和归因困难的问题,研究人员提出了 TEMPO(Test-Time-Scaled Value Estimation with Macro-Step Policy Optimization)。该方法将长轨迹分解为宏步,在每个边界处让同一模型从执行者切换为生成式评论家,回顾交互历史、验证假设并估算剩余回报。这使得 Agent 不仅学会行动,还学会自我评估。该技术随 dots3-note Preview 预览版一同开源。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →