从胡说到与人类 27/30 一致:LLM 评委调优实录
tejaskumarlol · reddit · 2026-10-08
作者在 AI Engineer World's Fair 上现场演示如何把 LLM-as-judge 从不可用调到与人类判定 27/30 一致。关键发现与步骤:
- 字符串匹配测试会放过胡说:只检查回答含 "cannot",模型答 "可以退货,但不能免运费" 也通过。
- 自偏好实锤:GPT-3.5 Turbo 当评委时,把自己写的错误答案排在前面,它每次都选自己的答案(与 Panickssery 等人 2024 年研究一致)。
- 改用 pointwise 而非 pairwise:引用 COLM 2025 研究,pairwise 判定在差答案更自信/更长/更谄媚时约 35% 会翻转,绝对评分仅 9%。
- 对齐 30 个人工判定的修复顺序:① 给评委提供 14 天退货政策原文;② 逐条读分歧案例补充规则(如"改变主意需未使用且原包装");③ 换模型——GPT-3.5 Turbo 给足上下文仍失败,GPT-4o mini 通过;④ 补"政策不可谈判"规则解决谄媚误判(评委因语气不够友好而 fail 正确拒绝)。
- 门禁设计:一致率 <80% 或 =100% 都让构建失败——100% 意味着评委过拟合或谄媚。
- 附加建议:固定 judge 模型版本(gpt-4o-mini 是 alias)、持续注入人工标注的新流量、让 judge 检索与 agent 同一份政策。
作者来自 IBM,demo 中的检索用的是开源的 OpenRAG。
「编程与Agent」频道最新
- Graph Hacks 黑客松 10 月开赛:奖金 2 万美元,用图数据库做 agent 上下文 — KlausCodes · 2026-10-08
- Brave 工程师复盘修复 macOS 26 Dock 图标深色模式 Bug — vikvang1 · 2026-10-08
- 网友吐槽:Agent 蜂拥而上像虫族 rush,自己失去控制权 — sloppenheimer · 2026-10-08
- 整站由 Grok 驱动:agent 自主运行网站还兼任后端 — Daniel_Farinax · 2026-10-08
- 沙箱 agent 复核代码评测只对 60%,把判断题拆成可验证题后 12/12 全对 — Grimmoner · 2026-10-08
- Grok 找不到 Mac 驱动,干脆自己写了一个并成功装好打印机 — Daniel_Farinax · 2026-10-08