别用LLM当裁判:用确定性奖励函数评RL轨迹更稳
ivan_bezdomny · x · 2026-08-21
作者分享 RL 训练中的评测心得:与 Harvey 用 LLM judge 的做法不同,他设计确定性奖励函数来比较多条 rollout,理由是:
- 更确定、速度更快;
- LLM 本身不擅长对多个选项排序并转成分数——反正你还得把二元判断或 checklist 转回分数,而且不可能对每对 rollout 做 N² 的一对一比较;
- 奖励函数不必完备,只需近似 LLM judge 的裁决即可,可以离线优化,每批 RL 轨迹后微调。
作者提醒这不适用于所有问题,但在可行的场景下效果相当好。
所属事件:开发者弃用 LLM 裁判改用确定性奖励函数评 RL(2 条相关)→
「编程与Agent」频道最新
- Claude Code v2.1.238 发布:修复内存泄漏与自托管代理 — ashwin-ant · 2026-08-21
- 亚马逊CTIFoundry:结构化知识库让智能体F1提升0.28 — dair_ai · 2026-08-21
- Wake 发布:基于 Rust 的多人协作 AI Agent OS — prasannaalahoti · 2026-08-21
- 自托管编码 Agent 迁移 Bun 1.4:Rust 重写体验平稳 — lucasmeijer · 2026-08-21
- Gemini CLI PR:为 PR 生成器实现入口与日志配置 — joneba-google · 2026-08-21
- AI 代理自行设计录制以解决 Minecraft 确定性测试 — gandamu_ml · 2026-08-21