TEMPO 让同一模型在 actor 与 critic 间切换评估长任务

omarsar0 · x · 2026-08-20

TEMPO 的做法是把长轨迹划分为若干 macro-step,在每个步骤上,同一个模型从 actor 切换为 critic:Critic 对当前状态进行推理、调用工具,并在整个任务完成之前估计期望的剩余回报。这一机制针对的是长程任务中 credit assignment 的难题——数十小时的 rollout 中,单一终端奖励需要归因到数千次交互,GRPO 等 value-free 方法因此失效。

所属事件:TEMPO 让模型角色切换评估长任务,登顶 ARC-AGI-3(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →