COLM 2026 论文:基于评分规则的奖励监督与自蒸馏新方法
armancohan · x · 2026-10-07
研究者将在 COLM 2026 展示论文《Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation》,面向 LLM 后训练中的奖励监督问题,提出以评分规则(rubric)为条件的自蒸馏方法。海报环节为 10 月 7 日周三 11:00–13:00 PST,Grand Ballroom #128。
「研究」频道最新
- COLM 2026 杰出论文奖揭晓,CMU 团队获奖致谢 — dan_fried · 2026-10-07
- 训练小技巧:随机化 20% 样本的 SWA 跨度,全序列损失收敛更快 — kalomaze · 2026-10-07
- Parsewave 审计:AutomationBench 600 公开任务中 206 个验证器有严重问题 — rohanpaul_ai · 2026-10-07
- 数学家仍在啃 OpenAI 160 页纳维-斯托克斯证明,Claude 生成 8 步 3D 讲解视频 — imjustnewatai · 2026-10-07
- kalomaze 解读长序列训练梯度分布:条件信息与不确定性是关键 — kalomaze · 2026-10-07
- Ai2 发布 Olmo-core MoE 高效训练技术报告,TLDR 干货密集 — StasBekman · 2026-10-07