把 LLM 裁判从 Sonnet 换成 16 倍便宜的模型,84 次判定零翻转
EvalRaccoonDev · reddit · 2026-09-28
一位做 Coder Eval(Apache 2.0)的工程师分享换裁判模型的实测:Sonnet 裁判每次运行平均 $1.65,换成 GPT Luna 加一段简短校准提示后只要 $0.09,重放 84 个真实评分判定,结论零翻转。
更大的发现不在裁判模型本身:
- 85 个评分中有 15 个用了评分标准从未定义的分数(在 1.0/0.8/0.5/0.2/0 刻度上打 0.9、0.95)
- 有 10 个判定要求拿满分才能通过
- 所有观察到的判定翻转,无论用哪个裁判模型,都来自这些阈值问题而非模型差异
结论:先修好评分 rubric 再挑裁判模型,便宜的模型可能就够了。
「编程与Agent」频道最新
- OpenAI 总裁 Brockman 提示法推出 Agent 时代更新版 — kimmonismus · 2026-09-28
- 乔木剪辑 Skill 开源:一句话让 Agent 剪出成片级视频 — vista8 · 2026-09-28
- 数百万页井数据 OCR 后交给 agent 检索,勘探省下 40 小时 — oilmutt · 2026-09-28
- Muse 被称「最易魔改的 AI OS」:连 Docker 造工具还能拍电影 — NathanWilbanks_ · 2026-09-28
- 开源 macOS 小工具:一键切换浏览器,隔离 AI Agent 测试会话 — sormagec · 2026-09-28
- Google Antigravity 原生支持 agent 间消息与用户私聊 agent — rseroter · 2026-09-28