实验室 PRM 细节披露:数据依赖长度惩罚或成 Agent 训练关键

关于实验室所用 Process Reward Model(PRM)的用法细节近日披露,社区讨论聚焦 RL 训练中的长度惩罚设计。作者看好「组相对长度惩罚」等数据依赖做法,认为其更契合数据特性,同时指出验证器的不稳定性超预期。所讨论行为虽较基础,但配合 warm start 等手段完全可以强迫 agent 学会目标行为,或成训练关键。

2026-09-22 ~ 2026-09-22 · 2 条相关