实验室 PRM 用法细节浮出:数据依赖的长度惩罚或成 Agent 训练关键
stochasticchasm · x · 2026-09-22
关于实验室所用 Process Reward Model(PRM)的细节终于有所披露,作者认为所讨论的行为虽属较基础的一类,但配合 warm start 等手段,完全可以强迫 agent 自动组织「调研→实现→验证→对抗性审查」这类步骤编排。作者还表示喜欢 group-relative length penalty 的思路,并在「组内相对」与「参考轨迹校准(如 k3)」两种提法之间摇摆:两者都满足他的核心诉求——长度惩罚应当依赖数据,因为不同任务天然需要不同数量的 token。
所属事件:实验室 PRM 细节披露:数据依赖长度惩罚或成 Agent 训练关键(2 条相关)→
「研究」频道最新
- 果蝇大脑启发脉冲网络 Spi-Fly:少样本学气味、省内存 — Brighter-Side-News · 2026-09-22
- 俄勒冈州立团队让多台人形机器人协作夹取搬运,无通信单策略 — tweetsatpreet · 2026-09-22
- 14 个用例复现完整榜单:Terminal Bench Mini 加速本地模型评测 — asankhs · 2026-09-22
- 模型嫁接:把 Qwen3.5-4B 事后改造成因果 encoder-decoder,提速最高 3.7 倍 — asankhs · 2026-09-22
- SteerDuplex:全双工语音对话模型可控性提升 44.5 个百分点 — ScaleAI · 2026-09-22
- 假投稿疑集中少数大学,研究者提议限制作者投稿数 — sarahookr · 2026-09-22