开发者弃用 LLM 裁判改用确定性奖励函数评 RL

一位开发者分享了强化学习训练中的评测心得:与 Harvey 等使用 LLM 作为裁判的方案不同,他设计了确定性奖励函数来比较多条 rollout,认为其更确定、速度更快,并已将该方法应用于 RL 优化模型自动撰写新闻的任务中。他主张若能用代码近似评判逻辑,就应避免依赖 LLM judge,以获得更稳定的评测效果。

2026-08-21 ~ 2026-08-21 · 2 条相关