TEMPO 递归自评:把数十小时轨迹切成宏步骤做过程奖励

SarahAnnabels · x · 2026-08-30

dots3-note 采用 TEMPO 机制解决长程任务的奖励稀疏问题:一次 rollout 可能长达数十小时,最终奖励来得太晚、无法说明哪些动作真正有效。TEMPO 将轨迹切分为宏步骤,同一模型在每个步骤从 actor 切换为 critic——对自身状态推理、调用工具、估计是否取得真实进展,形成递归式自我批评。

所属事件:dots3-note 测试时学习与 TEMPO 自评机制解析(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →