腾讯提出 SLCA-GRPO:分段锁定信用分配,修复工具调用 RL 的梯度串扰

tencent · hf · 2026-09-28

腾讯在 Hugging Face 发布 SLCA-GRPO,针对工具调用 agent 强化学习中的一个结构性缺陷:GRPO 等同策略算法把轨迹级标量 advantage 无差别广播到所有 token,导致自然语言总结部分的梯度噪声污染工具决策 token,造成跨段信用误归因、训练脆弱。

方法要点:

在 7B 骨干、相同训练预算下,域内评测超 GRPO/ToolPO/RLTR +2.53 pp,BFCL +1.36 pp,τ²-Bench +9.15 pp,同时降低工具冗余与调用成本。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →