把 LLM 裁判从 Sonnet 换成 16 倍便宜的模型,84 次判定零翻转

EvalRaccoonDev · reddit · 2026-09-28

一位做 Coder Eval(Apache 2.0)的工程师分享换裁判模型的实测:Sonnet 裁判每次运行平均 $1.65,换成 GPT Luna 加一段简短校准提示后只要 $0.09,重放 84 个真实评分判定,结论零翻转。

更大的发现不在裁判模型本身:

结论:先修好评分 rubric 再挑裁判模型,便宜的模型可能就够了。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →