RL 训练新思路:用 agent 在沙盒里做组内对比取代 pairwise

stochasticchasm · x · 2026-09-22

stochasticchasm 讨论一种 RL 训练设计:在 groupwise 部分不再需要 pairwise 比较,因为 agent 已经够强——把候选输出全部丢进同一个沙盒,让 agent 直接对比优劣,还可以加 subagents 进一步加工。配合可验证奖励和 rubric 区分差异,甚至可以加入编程风格 rubric。

所属事件:RL 训练热议:沙盒组内对比与评分细则缓解奖励黑客(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →