决策式评分器替代 LLM Judge,便宜32倍快8倍,一致率94%

rhythmrg · x · 2026-10-06

Applied Compute 的 RL 与评测管线此前用 LLM judge 按每条 rubric 标准逐条评分并输出文字说明,在复杂任务上评分既慢又贵。

团队在 AC2 的代码 QA benchmark 上把评分器换成「决策式评分器」(decision grader):一次调用同时为所有标准给出 yes/no 概率。在 100 个样本任务(407 条标准)上的结果:

结论:便宜、快且带校准置信度的评分器能支撑更多 rollout 和更多评分维度,值得在评测管线中替代逐条文字评分的 LLM judge。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →