别用LLM当裁判:用确定性奖励函数评RL轨迹更稳

ivan_bezdomny · x · 2026-08-21

作者分享 RL 训练中的评测心得:与 Harvey 用 LLM judge 的做法不同,他设计确定性奖励函数来比较多条 rollout,理由是:

作者提醒这不适用于所有问题,但在可行的场景下效果相当好。

所属事件:开发者弃用 LLM 裁判改用确定性奖励函数评 RL(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →