把 LLM 裁判蒸馏成可执行程序,评测成本降 50 倍还不掉准

Codifying the Judge: Scalable Evaluation via Program Distillation

Tzu-Heng Huang, Shengqi Qiu, Frederic Sala

cs.AI, cs.LG

2026-05-29

PAJAMA 把 LLM 裁判蒸馏成 Python 程序,评测时跑代码不调 LLM;准确率追平 OLMo-2-13B、快 47 倍,做奖励信号比 GPT-4 标注更准还便宜 50 倍。

这篇在解决什么

用大模型当裁判(LLM-as-a-judge)现在是自动化评测的标准做法,但它有四个老毛病。最直接的是贵:跑 GPT-5、Gemini-3-Pro 这类闭源模型评测百万级样本,API 账单受不了。它还黑,决策过程看不见,没法判断一个评分到底是照着理由给的,还是模型幻觉出来的。大模型裁判系统性偏好长答案、花哨排版、情绪化措辞,这是偏。最后是重跑税,评测标准(rubric)一改,整套数据集就得重新过一遍 LLM。

这篇要做的,是把这些 LLM 裁判的判断逻辑,蒸馏成一段段可执行的程序,评测时直接跑程序打分,不再每次调 LLM。

方法

核心叫 program distillation(程序蒸馏)。具体来说,PAJAMA 用一个强 LLM(Claude Opus 4.6)生成一批 Python 函数 judgingfunction(query, response),每个函数把一条评测标准写成代码、返回一个数值分数。作者整理了 10 条可编码的评测标准(相关性、语言质量、逻辑连贯性、证据密度等),一共合成 80 个候选程序,再按验证集准确率挑出 top-k 组成委员会(不同数据集选 8 到 21 个)。

单个程序不可能覆盖所有输入,所以靠聚合。把每个程序的输出做 min-max 归一化、转成偏好差、再二值化成 {-1, 0, +1} 的投票,然后用弱监督(weak supervision)里的 label model(用的是 Snorkel 框架)从各程序的一致性模式里学出每个程序的权重,合成一个联合判决。

对于程序委员会也拿不准的样本(投票分歧大、或后验概率接近 0.5),有一个 fallback:把这些低置信样本转交回 LLM 裁判。路由信号直接来自程序委员会本身,不需要额外模型,调阈值就能在准确率和吞吐之间扫出整条曲线。

结果

五个偏好数据集(JudgeLM-100K、PandaLM、MultiPref、Prometheus、Preference-700K)上,程序委员会平均准确率 78.11%,和 OLMo-2-13B-Instruct(79.70%)、Qwen2.5-3B-Instruct 同档,比最强的 GPT-5 Thinking(85.72%)低约 8 分。在 Prometheus 上,只用 8 个程序就到 88.78%,追平 OLMo-2-7B。

速度差距更大。程序委员会比 OLMo-2-13B-Instruct 快 47.25 倍,比最小的 Gemma-3-270M-It 还快 2.12 倍,同时准确率高 30.11 分;对更大的 14B/12B 模型,程序快约 50 倍。

把程序输出当路由信号混搭 LLM,能推进准确率与吞吐的 Pareto 前沿:配 OLMo-2-7B,准确率高 5.0%、吞吐 2.9 倍;配 Qwen2.5-3B,高 2.6%、吞吐 2.2 倍。

最实际的用处是当奖励信号。在 RewardBench 上,用程序判决蒸馏出来的奖励模型,比用 GPT-4 标注训出来的更好:Prometheus 训 56.65 对 54.98,JudgeLM 训 61.77 对 57.28,而 API 成本低约 50 倍(7.21 美元对 363.97 美元),评测时一次闭源调用都不用发。

信号来源RewardBench 均分标注成本
GPT-4 标注(Prometheus)54.98$363.97
PAJAMA 程序(Prometheus)56.65$7.21

为什么重要

它把每次评测都要付费、还黑箱的 LLM 裁判,换成透明、可检查、可编辑、成本几乎不随样本数增长的程序。评测标准写错了,改程序就行,不用重跑整个数据集。对做 RLHF、大规模 benchmark 的人来说是实打实省钱的。副产品是给奖励模型训练提供了一种比闭源标注更便宜的信号。

局限与存疑

只对那些能写成代码的评测标准有效(相关性、连贯性、覆盖度这类)。模糊、主观、难以用程序特征捕捉的判断,还是得靠 LLM。合成程序 upfront 要用一个强模型(Claude Opus 4.6),一次性但并非免费,质量也被这个模型卡住。委员会弃权的样本被随机赋标签来凑覆盖率,会带进噪声。作者自己也说,和理想路由器之间还差一点,更丰富的特征能进一步缩小差距。最后要清楚:78% 是 13B 这一档的水平,不是 GPT-5 这一档,这是成本换质量的取舍,不是质量上的全面胜出。

术语

原文与代码

相关论文

全部论文解读