美团 TGRL:温度分组强化学习,RLVR 训练速度提升最高 36%
meituan · hf · 2026-09-30
美团提出 TGRL(温度分组强化学习),把温度带来的 rollout 多样性转化为显式训练信号,解决可验证奖励强化学习(RLVR)中探索效率的瓶颈:
- 每个 prompt 的 rollout 组被分为低/高温度两个子集,通过两者的奖励对比估计「探索增益」,再用 JS 散度把这个组级信号分配为 token 级 credit;
- 不扩大 rollout 预算的前提下,达到同等精度最高快 36%。
在 11 个基准上广泛超越强 RLVR 基线:32B 模型六项数学基准平均 +1.6%,CodeForces rating +196.7 分,LiveCodeBench Pass@16 +4.4%,ALFWorld/WebShop 成功率 +6.3%/+4.9%。代码已开源。
「研究」频道最新
- AutoRef 开源:面向智能体多参考图生成的 Harness 优化 — NunyaBuzor · 2026-09-30
- VLANeXt Family:500+ 控制实验提炼 12 条 VLA 模型实用配方 — ccloy · 2026-09-30
- RL with Confidence Margin 论文:让置信度逐步追踪推理正确性 — EliasEskin · 2026-09-30
- 阿里达摩院开源 WorldAttention:交互式视频世界模型高效注意力架构 — Alibaba-DAMO-Academy · 2026-09-30
- 南科大 ActFirst-OPD:先行动后思考,多轮智能体蒸馏训练提速最高 4.9 倍 — SouthernUniversityofScienceandTechnology · 2026-09-30
- 新加坡国立大学 MaLiang-Harness:用可执行程序控制图像视频生成,并定义 P2V 差距 — NationalUniversityofSingapore · 2026-09-30