PAJAMA 将 LLM 裁判蒸馏成程序,效果逼近 13B 级评测器
sprocket-lab · hf · 2026-07-28
核心思路
这篇工作认为 LLM-as-a-judge 评测虽然已经很常见,但问题是贵、慢,而且判断过程不透明。作者提出的替代方案是 program distillation:把评审逻辑蒸馏成一组可直接打分的程序。
PAJAMA 系统
- 把程序合成为“裁判”
- 将多个程序的结果聚合成最终判定
- 对低置信度样本设置 fallback,必要时再交给 LLM
实验结果
作者在 5 个数据集、4 类模型家族 上验证,结论是程序化裁判可以达到 13B 级 LLM judge 的效果。
价值
- 显著降低单样本评测成本和延迟
- 判定逻辑更可解释、可编辑
- 还能生成便宜的 reward signal:在 RewardBench 上,用程序 verdict 蒸馏出的 reward model,优于用专有 LLM 标签训练的模型,而且 API 成本低了 两个数量级
「编程与Agent」频道最新
- 多数脚本故障都毁在导航层,而不是逻辑 — Opening-Profile6279 · 2026-07-28
- 用户称 Opus 5 让 17 次月导出变得多余 — gaganghotra_ · 2026-07-28
- 很多 agent 失败,其实是人类交接没设计好 — Fit_Average8352 · 2026-07-28
- 一个设计团队做了个评测,阻止 AI 文案靠感觉上线 — Fit_Average8352 · 2026-07-28
- 现代 AI Agent 如何先规划再执行任务 — goyalshaliniuk · 2026-07-28
- AI agent 任务规划的十步流程:先想清楚再执行 — goyalshaliniuk · 2026-07-28