实验室 PRM 用法细节浮出:数据依赖的长度惩罚或成 Agent 训练关键

stochasticchasm · x · 2026-09-22

关于实验室所用 Process Reward Model(PRM)的细节终于有所披露,作者认为所讨论的行为虽属较基础的一类,但配合 warm start 等手段,完全可以强迫 agent 自动组织「调研→实现→验证→对抗性审查」这类步骤编排。作者还表示喜欢 group-relative length penalty 的思路,并在「组内相对」与「参考轨迹校准(如 k3)」两种提法之间摇摆:两者都满足他的核心诉求——长度惩罚应当依赖数据,因为不同任务天然需要不同数量的 token。

所属事件:实验室 PRM 细节披露:数据依赖长度惩罚或成 Agent 训练关键(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →