RL 训练热议:沙盒组内对比与评分细则缓解奖励黑客

社区围绕 RL 训练设计展开讨论:stochasticchasm 提出在 groupwise 阶段不再需要 pairwise 比较,可把候选输出丢进同一沙盒由 agent 对比,并赞赏奖励重分配算法与在线过滤 reward hack 的机制。另有讨论提出先离线合成评分细则再打分、多轮精修以缓解奖励黑客,但 grading 计算开销可观;还可结合可验证奖励与评分细则来改造模型训练的评分算力。

2026-09-22 ~ 2026-09-22 · 4 条相关