开发者弃用 LLM 裁判改用确定性奖励函数评 RL
一位开发者分享了强化学习训练中的评测心得:与 Harvey 等使用 LLM 作为裁判的方案不同,他设计了确定性奖励函数来比较多条 rollout,认为其更确定、速度更快,并已将该方法应用于 RL 优化模型自动撰写新闻的任务中。他主张若能用代码近似评判逻辑,就应避免依赖 LLM judge,以获得更稳定的评测效果。
2026-08-21 ~ 2026-08-21 · 2 条相关
- 别用LLM当裁判:用确定性奖励函数评RL轨迹更稳 — ivan_bezdomny · 2026-08-21
- RL 优化模型自动写新闻,确定性奖励函数替代 LLM 评判 — ivan_bezdomny · 2026-08-21