美团 TGRL:温度分组强化学习,RLVR 训练速度提升最高 36%

meituan · hf · 2026-09-30

美团提出 TGRL(温度分组强化学习),把温度带来的 rollout 多样性转化为显式训练信号,解决可验证奖励强化学习(RLVR)中探索效率的瓶颈:

在 11 个基准上广泛超越强 RLVR 基线:32B 模型六项数学基准平均 +1.6%,CodeForces rating +196.7 分,LiveCodeBench Pass@16 +4.4%,ALFWorld/WebShop 成功率 +6.3%/+4.9%。代码已开源。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →