TRACE:长时序智能体奖励分配新法

SharonYixuanLi · x · 2026-07-19

TRACE 是一个面向**长时序智能体**的 turn-level 奖励分配方法,目标是解决仅用最终结果奖励时的**信用分配难题**。 核心思路是:在每个工具调用边界上,用一个**冻结的参考模型**衡量“到当前前缀时,金答案变得多可预测”,再把这种变化转成状态价值,并用 TD 变化给每一步互动分配正/负 credit。它不需要训练 critic、过程标签、Monte Carlo continuation,也不依赖强 LLM judge。 作者称,在纯 RL、没有 cold-start SFT / agentic mid-training / live-web data 的设置下,TRACE 显著提升长链路搜索能力:在 BrowseComp-Plus 上,Qwen3-4B 从 7.2 提升到 35.6,Qwen3-30B-A3B 从 8.4 提升到 42.6,后者已接近 Tongyi-DeepResearch-30B-A3B。控制模型、数据、工具和 outcome reward 一致时,TRACE 也优于 GRPO、GSPO 和 GiGPO。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →