用可验证奖励加评分细则改造模型训练的评分算力
stochasticchasm · x · 2026-09-22
- 作者讨论在模型训练中结合 verifiable rewards(可验证奖励)与 rubrics(评分细则):先用可验证信号把关,再用人工/合成的评分细则对不同输出做区分性打分。
- 原推提到其评分流程是离线合成 rubrics → 打分 → 迭代精炼,并指出还有很大扩展空间:把每项评分做成 agentic 流程、增加多轮 refinement 循环等。
- 回帖补充建议:可以加入编程风格类 rubrics 来进一步差异化评分;这套思路也解释了「grading compute」(评分算力)的量级。
所属事件:RL 训练新讨论:组内沙盒对比与评分细则对抗奖励黑客(4 条相关)→
「研究」频道最新
- Harvard+MIT 论文:让金融 AI 用回归测试安全地从错误中学习 — rohanpaul_ai · 2026-09-22
- 哈佛 MIT 论文 FINSKILLOPS:把失败变成带回归测试的技能补丁 — rohanpaul_ai · 2026-09-22
- 限制单人投稿量没用?会议统计:量大多来自低产作者 — furongh · 2026-09-22
- 3800字长文:脑类器官究竟对阿尔茨海默病研究有用吗? — owl_posting · 2026-09-22
- 小模型 4B 混合架构 13 倍速击败纯 LLM,成本仅 56% — Sentdex · 2026-09-22
- Logan 建议AI创业者:25%时间做benchmark,推动模型实验室重视 — BenBlaiszik · 2026-09-22