TRACE:长时序智能体奖励分配新法
SharonYixuanLi · x · 2026-07-19
TRACE 是一个面向**长时序智能体**的 turn-level 奖励分配方法,目标是解决仅用最终结果奖励时的**信用分配难题**。 核心思路是:在每个工具调用边界上,用一个**冻结的参考模型**衡量“到当前前缀时,金答案变得多可预测”,再把这种变化转成状态价值,并用 TD 变化给每一步互动分配正/负 credit。它不需要训练 critic、过程标签、Monte Carlo continuation,也不依赖强 LLM judge。 作者称,在纯 RL、没有 cold-start SFT / agentic mid-training / live-web data 的设置下,TRACE 显著提升长链路搜索能力:在 BrowseComp-Plus 上,Qwen3-4B 从 7.2 提升到 35.6,Qwen3-30B-A3B 从 8.4 提升到 42.6,后者已接近 Tongyi-DeepResearch-30B-A3B。控制模型、数据、工具和 outcome reward 一致时,TRACE 也优于 GRPO、GSPO 和 GiGPO。
「编程与Agent」频道最新
- Obsidian CEO 开源日常 Claude Skills 配置 — Roger_M_Taylor · 2026-07-20
- GBrain为LLM挑选上下文 — garrytan · 2026-07-20
- 12个Agent实战项目清单 — Roger_M_Taylor · 2026-07-20
- HF 上的 lingbot-video 在热榜 — victor · 2026-07-20
- 用真实代码说服 AI 怀疑者 — alex_verem · 2026-07-20
- MCPgrade给MCP服务器打安全分 — LankyStruggle7605 · 2026-07-20