中科大与阿里提出 ADRS:token 级信用分配让多轮智能体 RL 提升逾 10 个百分点
量子位 · wechat · 2026-09-15
中国科学技术大学与阿里巴巴研究团队提出 ADRS(Agentic RL with Self-Distilled Reward Shaping),针对多轮智能体强化学习中的时间信用分配难题:终点奖励只告诉模型轨迹最终对不对,却不知道中间哪一步值得强化。
核心思路:训练期用带任务技能的教师上下文对已生成 token 重评分,把教师偏好转化为与回报相关的 token 级信用,注入原有 advantage 路径;rollout 与推理全程 skill-free。
三层信用构造:
- 步骤内教师分数中心化与尺度归一化,只保留步骤内相对证据;
- TVA 门控:根据「教师置信度—实际回报」的批内关联决定是否放行教师信号;
- 不另开蒸馏损失支路,直接在 advantage 构造前注入与环境奖励合并。
主要结果(Qwen2.5-3B/7B、Qwen3-1.7B,150-step 预算):
- ALFWorld 成功率 94.5%,较最强基线 +10.1pt;7B 达 96.1%;
- WebShop Score/Success 87.5/76.6;
- 消融:GiGPO 82.8% → 无 TVA 87.5% → +TVA 89.8%;
- action/style token 更新幅度比达 95.3,说明更新集中在关键决策 token;
- 60% 数据即超全量 GRPO,未见任务平均 +11.9pt。
论文也指出边界:TVA 是批内统计关联而非因果归因,重评分增加训练期前向计算。论文:arxiv.org/abs/2608.03223
「编程与Agent」频道最新
- AI 老 researcher 吐槽:Astra 跟子 agent 说我「要结果不要客套」 — moyix · 2026-09-16
- 实测 11 件商品自动化转卖后,他追问 Agent 自主权边界该怎么划 — Ok_Appearance_7559 · 2026-09-16
- 用 Muse 智能体搭内容工作室:自动分析账号、周更选题、写爆款脚本 — thederbiedone · 2026-09-16
- 开源项目 free-claude-code 获 5.5 万星,免费用 Claude Code — goyalshaliniuk · 2026-09-16
- Gemini CLI 发布 v0.62.0 nightly,修复 AgentLoopContext 与 MCP 展示 — gemini-cli-robot · 2026-09-16
- Jeffrey Emanuel 式 Agent 编码方法论:穷尽规划+beads 任务拆解+蜂群协作 — doodlestein · 2026-09-16