宾大 Autorubric:逐条打分可进 RL,换 judge 家族比堆缓解更管用

Autorubric: A Unifying Framework for Rubric-Based LLM Evaluation on Non-Verifiable Tasks

Delip Rao, Chris Callison-Burch

COLM 2026 camera ready copy

cs.CL, cs.AI

2026-02-13

宾大开源 Autorubric,把不可核验任务的 rubric 评测做成逐准则可审计框架。RiceChem 5-shot 准确率 80.7%,CHARM-100 上换 judge 家族远比开关缓解手段管用。

这篇在解决什么

开放写作、对话质量、研究综述这类任务没法用程序断言判对错,行业默认把大模型当成裁判(LLM-as-a-Judge)。裁判自己会踩位置偏见、随机不一致、把多条标准搅在一起、证据不够还硬打分、不同模型刻度对不上。

常见误解是 rubric 只是一段更长的 prompt。从教育测量看,它是打分仪器:分析式还是整体式、二值还是有序量表、权重、弃权、校准、评分者信度。这些选择散落在论文和半成品仓库里,每组人重造一遍。宾大 Delip Rao 和 Chris Callison-Burch 把这套选择收进开源框架 Autorubric,COLM 2026 camera-ready,对应发布 v1.5.3。

方法

默认走分析式 rubric:每条准则单独一次 LLM 调用,输出 MET、UNMET、CANNOTASSESS,或有序、无序选项,并强制写一两句证据理由。N 个裁判、M 条准则并行调用。

准则只允许三类。二元是达标或不达标。有序是带行为锚点的有界量表。名义是无序分类。连续打分被刻意排除,因为模型会往中间档挤,连小数请求也常打成整数。每个选项带显式 0 到 1 的数值,默认打乱展示顺序,分数跟位置脱钩。

权重可正可负,负权重专门罚反模式。有正权重时,加权和除以正权重总和,再截到 [0, 1];纯惩罚表从 1 往下扣。证据不够可以弃权,策略有 SKIP、ZERO、PARTIAL、FAIL。

少样本校准用 verdict-balanced 抽样:各标签样本配平,避免裁判从示例里读出先验比例。多裁判可按多数票、加权票、全票或任一票聚合。跑完给出 Cohen's κ、二次加权 κ、Spearman 相关、Earth Mover's Distance。

结果

RiceChem 是 1,240 份大学化学长答、27 条二元准则。held-out 819 个「答卷-准则」判定上:

方法准确率
GPT-4 零样本(原论文)70.9%
Autorubric + Gemini-3-Flash 零样本78.0%(639/819)
同上 5-shot80.7%(661/819)
微调 RoBERTa+MNLI(原论文)86.8%

5-shot 比零样本高 2.7 个百分点,54 条变对、32 条变错。作者把它当描述性差值,没做按学生聚类的显著性检验。离监督微调还差 6.1 个点。

ResearcherBench 评 Deep Research 系统:65 题、931 条加权二元准则、5,586 次判定。覆盖率如下。

系统Sonnet-4.5Gemini-3-Flash原论文 Sonnet-3.5
Gemini DeepResearch0.692 [.640, .741]0.810 [.751, .864]0.693
OpenAI DeepResearch0.620 [.569, .670]0.771 [.723, .818]0.703
Grok3 DeepSearch0.579 [.520, .637]0.618 [.569, .667]0.441

总排名一致,前两名置信区间重叠。配对置换检验里,Sonnet-4.5 上 Gemini 领先显著(p=0.003,Cohen's d=0.39),Gemini-3-Flash 上不显著(p=0.219)。两家裁判对「哪题难」相关 0.54 到 0.82,65 题里只有 15 题(23.1%)三人排序完全一致。准则级 κ=0.53,原始一致率 78.5%。批判分析类分歧 27.9%,枚举和深度类 14% 到 15%。Gemini-3-Flash 便宜约 5 到 6 倍,总排名不变。

CHARM-100 是这篇新放的合成 chatbot 集,6 条混类型准则。Gemini-3-Flash 当裁判时,事实准确精确率 87.0%(κ=0.642);四条有序准则精确一致只有 38% 到 58%,相邻一档则到 85% 到 93%;自然度二次加权 κ 最高,0.719;回复长度精确 81%,短回复召回 0.70,冗长召回 0.14。总分正偏 +0.170,分数 Spearman 0.810。

配置扫描在 80 条测试项上,Default 为打乱选项加 3-shot 加 SKIP:

裁判精确率平均 κ
Gemini-3-Flash60.4%0.679
GPT-5.4-nano51.0%0.462
LLaMA-3.1-8B19.4%-0.001

去掉 few-shot 或打乱,三家方向都不一样。同模型集成给 Gemini 最多加 1.1 个百分点,给 GPT 反而降 2.0 到 4.1 个百分点。跨家族集成 57.1%/0.626,低于 Gemini 单家。没有一套对所有模型都涨分的缓解栈。

下游两处。Llama 3.1 8B 审 10 篇论文、10 条二元准则:无 skill 得 0.17,一句糊指令 0.47,专家写的 skill 0.82。用逐条失败反馈改一轮,点估计到 0.85 和 0.86,与专家的置信区间重叠。换 GPT-5.4-mini 复评,糊指令到改写是 0.58 到 0.74,专家仍是 0.78。

强化学习用 Qwen3-4B-Instruct 加 LoRA,数据是 AdvancedIF 的 402 条复杂指令,奖励是 Gemini-3-Flash 打的 Autorubric 分数,50 步大约 12 美元。验证集从 0.756 到 0.795,选的是十条检查点里最高的 step 25,名义 Wilcoxon p=0.032,未对选择校正。满分回答 21/81 到 30/81,平均长度 1,097 降到 733 token。换 GPT-5.4-mini 重打只有 +0.023,p=0.243。IFEval 九类指令里八类非负迁移,标点 +4.5 个百分点,McNemar p=0.28。

为什么重要

做开放任务评测或把 rubric 当强化学习奖励的人,终于有一块把准则类型、打乱、弃权、校准、集成、信度指标收在一起的底板,不用每次从论文堆里拼。逐条分数能看见整体分看不见的洞:同一条「长度」准则,短回复召回 0.70,冗长只有 0.14。

这是工程统一,不是新的打分算法。RiceChem 没追上微调基线。CHARM 配置扫描每格只跑一次。裁判家族差距压过缓解开关。LLaMA-3.1-8B 的 κ 贴零,框架救不了弱裁判。

不要把它读成开箱即用的「正确分数」。

局限与存疑

作者列了十条。有序量表往两端堆,精确准确率被压低。CHARM 每个配置只跑一次,分差里掺着随机性。冗长偏好没有单独处理。实验和默认 prompt 全是英文。便宜裁判能保住总排名,保不住准则级校准。优化这边,改出来的 skill 跟 rubric 和模型绑在一起;强化学习用同一份验证集既选检查点又报增益;换裁判时同时换了采样,分不清是裁判耦合还是生成波动。框架默认 rubric 写得对,并不认证一条准则是不是测到了它声称的构念。

CHARM-100 的对话和参考标签都是模型合成的,二次标注只覆盖分层抽的 50 条,宏平均 κ=0.687。合成集能控标签分布,生态效度有限。RiceChem 的 2.7 个百分点没有按学生聚类的推断。强化学习的 p 值未校正,IFEval 迁移不显著。文中实验对应 COLM 投稿时的快照,camera-ready 时框架已多了 skill 接入和 rubric 诱导,这些实验没有在 v1.5.3 上重跑。

术语

原文与代码

社区讨论

相关论文

全部论文解读