TRACE:长时序智能体奖励分配新法
SharonYixuanLi · x · 2026-07-19
TRACE 是一个面向长时序智能体的 turn-level 奖励分配方法,目标是解决仅用最终结果奖励时的信用分配难题。
核心思路是:在每个工具调用边界上,用一个冻结的参考模型衡量“到当前前缀时,金答案变得多可预测”,再把这种变化转成状态价值,并用 TD 变化给每一步互动分配正/负 credit。它不需要训练 critic、过程标签、Monte Carlo continuation,也不依赖强 LLM judge。
作者称,在纯 RL、没有 cold-start SFT / agentic mid-training / live-web data 的设置下,TRACE 显著提升长链路搜索能力:在 BrowseComp-Plus 上,Qwen3-4B 从 7.2 提升到 35.6,Qwen3-30B-A3B 从 8.4 提升到 42.6,后者已接近 Tongyi-DeepResearch-30B-A3B。控制模型、数据、工具和 outcome reward 一致时,TRACE 也优于 GRPO、GSPO 和 GiGPO。
所属事件:微软等提出TRACE:破解长程智能体信用分配难题(3 条相关)→
「编程与Agent」频道最新
- 受 OpenAI 万机群启发,开发者开源 agent 众包解题平台 — Benjaminsen · 2026-09-11
- 开源 Mac 应用 Lucid:只在跑 AI 时阻止笔记本休眠 — Pitiful_Hedgehog_600 · 2026-09-11
- 20kb 函数匹配达成,banteg 召集 AI 逆向 Snail Mail 剩余 20 个挑战 — banteg · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11