决策式评分器替代 LLM Judge,便宜32倍快8倍,一致率94%
rhythmrg · x · 2026-10-06
Applied Compute 的 RL 与评测管线此前用 LLM judge 按每条 rubric 标准逐条评分并输出文字说明,在复杂任务上评分既慢又贵。
团队在 AC2 的代码 QA benchmark 上把评分器换成「决策式评分器」(decision grader):一次调用同时为所有标准给出 yes/no 概率。在 100 个样本任务(407 条标准)上的结果:
- 成本降约 32 倍,速度提升约 8 倍
- 与原 LLM judge 判断一致率 94%
- 决策器有信心时与 LLM judge 一致率达 99%
- 低置信度(30-70%)的条目会暴露 rubric 含糊处,借此清理了噪声任务、改善数据集
结论:便宜、快且带校准置信度的评分器能支撑更多 rollout 和更多评分维度,值得在评测管线中替代逐条文字评分的 LLM judge。
「编程与Agent」频道最新
- YC 总裁用 Opus 5.5 花 20 分钟把 Doom 移植进 Paul Graham 的 Bel 方言 — garrytan · 2026-10-07
- L0pht 传奇黑客谈 AI 代码安全:「让它安全」不是一句 prompt — WeldPond · 2026-10-07
- 合同审查 Agent 评测为何极难:十位顶级律师改出十种红线稿 — graceisford · 2026-10-07
- Reddit 工程师吐露 AI 时代审码倦怠:每天审 20 个没人真正写过的 PR — Specialist_Agent3599 · 2026-10-07
- COLM 2026 现场:研究员探索通用一次性 Agent 与演化知识库的 RSI 新范式 — yisongyue · 2026-10-07
- KNOWS 基准发布:联合评测 Agent 搜索、工具与视觉理解三能力 — anmarasovic · 2026-10-07