实验室 PRM 细节披露:数据依赖长度惩罚或成 Agent 训练关键
关于实验室所用 Process Reward Model(PRM)的用法细节近日披露,社区讨论聚焦 RL 训练中的长度惩罚设计。作者看好「组相对长度惩罚」等数据依赖做法,认为其更契合数据特性,同时指出验证器的不稳定性超预期。所讨论行为虽较基础,但配合 warm start 等手段完全可以强迫 agent 学会目标行为,或成训练关键。
2026-09-22 ~ 2026-09-22 · 2 条相关
- 训练者热议:数据依赖的长度惩罚设计,验证器不稳定超预期 — stochasticchasm · 2026-09-22
- 实验室 PRM 用法细节浮出:数据依赖的长度惩罚或成 Agent 训练关键 — stochasticchasm · 2026-09-22