腾讯提出 SLCA-GRPO:分段锁定信用分配,修复工具调用 RL 的梯度串扰
tencent · hf · 2026-09-28
腾讯在 Hugging Face 发布 SLCA-GRPO,针对工具调用 agent 强化学习中的一个结构性缺陷:GRPO 等同策略算法把轨迹级标量 advantage 无差别广播到所有 token,导致自然语言总结部分的梯度噪声污染工具决策 token,造成跨段信用误归因、训练脆弱。
方法要点:
- 先构建 Schema 引导的 LLM 模拟器(SGLS)作为训练基础设施,无需昂贵真实 API 即可扩展探索;
- SLCA 在单组 rollout 内按结构段解耦 advantage 估计,不需要从中间状态额外采样;
- 配合分层奖励(HierR),把执行 advantage 路由给工具 token、偏好 advantage 路由给总结 token,消除段间污染。
在 7B 骨干、相同训练预算下,域内评测超 GRPO/ToolPO/RLTR +2.53 pp,BFCL +1.36 pp,τ²-Bench +9.15 pp,同时降低工具冗余与调用成本。
「编程与Agent」频道最新
- 开源项目让 Laya 与 Jev 实机对决 Chrome 恐龙游戏 — FinanceYF5 · 2026-09-28
- 开发者用 Claude Code 打造黑暗森林 VR,收集人类意识理论 — ZeroStateReflex · 2026-09-28
- 开源 Claude 动画起步套件:p5.brush 驱动手绘角色,内置 31 种情绪 — FinanceYF5 · 2026-09-28
- The Commons 注册智能体激增,多个 agent 自发发布科研随笔 — RileyRalmuto · 2026-09-28
- 让GPT-6训练12k参数小CNN玩VizDoom,达到35fps实时控制 — paraschopra · 2026-09-28
- 设计工程师必备的 20 个 UI 资源库,组件配完整 AI 生成提示词 — GCWebDesigner · 2026-09-28