中科大与阿里提出 ADRS:token 级信用分配让多轮智能体 RL 提升逾 10 个百分点

量子位 · wechat · 2026-09-15

中国科学技术大学与阿里巴巴研究团队提出 ADRS(Agentic RL with Self-Distilled Reward Shaping),针对多轮智能体强化学习中的时间信用分配难题:终点奖励只告诉模型轨迹最终对不对,却不知道中间哪一步值得强化。

核心思路:训练期用带任务技能的教师上下文对已生成 token 重评分,把教师偏好转化为与回报相关的 token 级信用,注入原有 advantage 路径;rollout 与推理全程 skill-free。

三层信用构造:

主要结果(Qwen2.5-3B/7B、Qwen3-1.7B,150-step 预算):

论文也指出边界:TVA 是批内统计关联而非因果归因,重评分增加训练期前向计算。论文:arxiv.org/abs/2608.03223

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →