Prediction-Powered Smoothing and Validation for Disaggregated AI Evaluation
Sho Kawano, Zehang Richard Li, Paul A. Parker
stat.ML, cs.AI, cs.LG, stat.AP, stat.ME
2026-09-18
Fay–Herriot平滑GREG分域估计,10%标注下phi-4的RMSE从0.082降到0.059,覆盖贴近95%。
拆开报分域成绩已经是评测默认动作:HELM 一类套件按任务类型切,线上 agent 按对话类型或用户群切。问题是标一次真标签很贵。Liang 等人报过,给单个 LLM 跑完 HELM 要 9337 美元 API。开放题还要加人审。预算不够时,每个域只能摊到很少的标签。
直接估计只吃本域样本。Horvitz–Thompson(HT,按入样概率加权的均值)、prediction-powered inference(PPI,用全量预测加抽样残差校正)和 generalized regression(GREG,把校正斜率从数据里估出来的 PPI++)都属这一类。域里标签少,方差按 \(1/ni\) 涨。小域估计(small area estimation)就是为这个场景准备的:用模型把信息从相邻域借过来。缺的是一套能同时做点估计、区间,并在直接估计和平滑之间做选择的工作流。
把评测集当成有限总体。域 \(i\) 的目标 \(\thetai\) 是该域全部单元的均值,不是某个超总体参数。抽样必须是概率抽样,每个单元入样概率已知。第二节用 PRISM 做过反例:如果按「被拒回复」加倍抽、却当随机样本去估,偏差不会随预算消失,95% 区间覆盖掉到名义水平以下。PPI 也修不好,因为残差本身还带着选择偏差。
有了概率样本之后,流程分两段。
估计。先在每个域上算 GREG:HT 均值,加上用全量辅助变量(历史模型对错、题目难度、LLM judge 分)校正抽样偏差的一项,校正斜率 \(\hat\lambda\) 由各域合在一起的加权回归给出。弱辅助会把 \(\hat\lambda\) 压到大约三分之一,GREG 不会比 HT 更差;PPI 没有这一档,弱辅助时 RMSE 反而高于 HT。再把各域的 GREG 点估计和抽样方差送进贝叶斯 Fay–Herriot 模型,按精度把估计拉向域级回归。标签越少,拉得越狠。这就是 prediction-powered smoothing(PP-S)。如果域本身嵌在分类法里(任务类型属于基准,或 LLM 与对话类型交叉),随机效应按层相加,变成 PP-TS。域样本变大时,平滑权重回到 1,估计回到直接量,设计一致性保住。
验证。直接估计无偏,平滑估计用偏差换方差,不能只比抽样方差。新的 design-based cross-validation(DB-CV)把样本按域切成 \(K\) 折,用留出折的 HT 当对照,再扣掉折内噪声和整份样本的 HT 误差,得到近似无偏的均方误差分。协方差对 HT、GREG、平滑估计都有闭式。同一份样本就能选模型并报出所选估计的误差。
两套数据都有全量真值,用来当 oracle。抽样是按域分层的简单随机抽样,预算固定 10%,重复 100 次。
Open LLM Leaderboard:9324 题、34 个任务类型嵌在 5 个基准里,估 microsoft/phi-4 的准确率。辅助变量来自历史记录,不含 phi-4。单位相关:数学专精 Qwen2.5-Math-7B-Instruct 为 0.31,小通用 Qwen2.5-1.5B-Instruct 为 0.33,历史难度为 0.61。
| 估计 | 专精 RMSE | 通用 RMSE | 难度 RMSE |
| HT | 0.082 | 0.082 | 0.082 |
| PPI | 0.106 | 0.105 | 0.074 |
| GREG | 0.080 | 0.082 | 0.074 |
| PP-S | 0.075 | 0.071 | 0.061 |
| PP-TS | 0.072 | 0.070 | 0.059 |
PP-TS 在三种辅助下都是最低 RMSE、最低区间分(难度辅助下 IS 0.295,HT 为 0.418)。覆盖率全部落在 0.93–0.95。拆开看,只做 Fay–Herriot、不用辅助,几乎不比 HT 好。增益主要来自域级协变量,其次才是分类法。两个弱辅助的单位相关几乎一样,但通用模型的域均值降 RMSE 远多于专精模型。专精模型在 MATH 上准、在 IFEval 上差,这个不均匀正好被分类法吃掉。
PRISM 当成线上流量:68371 条 1–100 满意度,63 个域(21 个 LLM × 3 种对话),judge 是 gpt-5-nano,单位相关 0.40、域均值相关 0.93。打完全量约 6 美元。10% 预算约 6837 个标签。PP-S(judge + 内容协变量)的 oracle RMSE 是 1.527,HT 是 2.505。最稀疏四分之一域上,HT 区间平均 15 分,PP-S 收到 7 分,而这些域的满意度也最低。
同一预算下,DB-CV 选出的估计 oracle RMSE 1.543,Kendall \(\tau\) 0.89,所报误差是 oracle 的 1.07 倍。朴素 CV 选出的点估计差不多(1.528),但把误差报成 4.00 倍。50/50 和 80/20 拆样本分别报到 2.59 倍和 3.54 倍。为什么重要
做分域评测的人,手里往往只有一份抽样标签和一堆便宜的预测。这篇把 PPI/GREG 和小域估计接成一条能跑的流水线,并且给出从单一样本选模型、报误差的分数。代码和预处理表在公开仓库里。
适用边界清楚:必须能做概率抽样。基准出题方自己控抽样,这做得到。线上流量如果靠投诉、flag、人工盯梢进审,估计会偏,标签自己查不出偏了多少。平滑本身贡献有限,辅助变量在域级用得好不好,才决定增益。两个同样准的 LLM judge,当协变量的价值可以差一截,所以验证步骤不能省。
这是把调查统计搬进 LLM 评测的渐进工作,不是新的评测协议。
作者自己点了几处。未见域(一个域零标签)能不能靠域级协变量做零样本估计,还没有可靠性判据。开放题的分数是判断,两个评分员对不上,这篇没把测量误差吃进区间。线上大量非概率样本(被 flag 的对话)怎么和概率样本拼,只点了方向。
实验里两个总体都是固定的,随机性只来自抽样。真实线上流量在变,分布漂移下区间是否仍按名义覆盖,没有直接验证。Fay–Herriot 的抽样模型是中心极限近似,最小的那些域恰好是最需要借力、近似也最弱的地方。Table 4 里朴素 CV 选中的估计 RMSE(1.528)略优于 DB-CV(1.543),DB-CV 的卖点是误差标定,不是选得更准。