RL 训练热议:沙盒组内对比与评分细则缓解奖励黑客
社区围绕 RL 训练设计展开讨论:stochasticchasm 提出在 groupwise 阶段不再需要 pairwise 比较,可把候选输出丢进同一沙盒由 agent 对比,并赞赏奖励重分配算法与在线过滤 reward hack 的机制。另有讨论提出先离线合成评分细则再打分、多轮精修以缓解奖励黑客,但 grading 计算开销可观;还可结合可验证奖励与评分细则来改造模型训练的评分算力。
2026-09-22 ~ 2026-09-22 · 4 条相关
- 离线合成评分细则+多轮精修:一种缓解奖励黑客的做法 — stochasticchasm · 2026-09-22
- 用可验证奖励加评分细则改造模型训练的评分算力 — stochasticchasm · 2026-09-22
- RL 训练新思路:用 agent 在沙盒里做组内对比取代 pairwise — stochasticchasm · 2026-09-22
- RL 细节讨论:奖励重分配算法与在线过滤 reward hack — stochasticchasm · 2026-09-22