黑盒 API 不确定性估计:0.8B 外挂裁判一次前向预判回答对错,0.86 AUROC

Pinocchio: Fast Uncertainty Estimates for Black-Box Language Models

Kevin David Hayes, Arka Pal, Haosong Zhang, Tom Goldstein, Micah Goldblum

cs.AI

2026-09-22

外挂校准器只读问题和回答,单次前向给黑盒 API 答案打正确性分,held-out 0.863 AUROC,零样本迁移 13 个未见模型均值 0.814。

这篇在解决什么

医生问 GPT 两种药会不会相互作用,模型答得笃定且答错了,API 返回里没有任何信号提示这次翻了车。闭源 API 模型在高风险场景落地普遍是这个处境:GPT、Claude、Gemini 不吐 log-probabilities、不让微调,而最需要不确定性信号的恰恰是这几个模型。

现有方法对不上号。logits 或隐藏状态方法要白盒访问;黑盒路线各有代价:verbalized confidence(模型自报置信度)系统性过度自信,self-evaluation 继承模型自己的盲区,semantic entropy 要采样 5-10 次,推理预算翻好几倍。又快又准的黑盒不确定性估计一直缺位。

方法

Pinocchio 不从目标模型身上挖不确定性,另训一个外挂裁判:输入问题、回答、模型身份标签(视觉任务带图),输出 P(correct)。

多模型混训是迁移力的来源:单一模型训出的裁判在没见过的目标上平均只有 0.672-0.759,三个模型混训后到 0.878;在 11 个未见模型的迁移套件上,只用 4 个强模型是 0.649,逐步加入 3 个弱模型后升到 0.814。弱模型补上了强模型不再犯的错。

结果

held-out 测试集 1,953 条(题目级切分,与训练零重叠):

方法AUROCBrierECE
Pinocchio0.863 [.847, .879]0.1640.107
Combined(自报置信度+长度)0.6490.2290.021
Verbalized(原始)0.6100.3260.299
Verbalized(isotonic 再校准)0.6440.2310.009
LLM-as-judge(GPT-5-mini)0.5320.2570.110
TypeSafe Jev(商用决策模型)0.6660.2400.133

差距全部通过 DeLong 检验(p < 0.001)。isotonic 再校准能把自报置信度的 ECE 压到 0.009,但 AUROC 仍只有 0.644:再校准修得好校准,修不了排序,Pinocchio 的优势在判别力。

采样类方法换到能直接采样的开源目标上更惨。LLaMA-3.1-8B 上老老实实采 N=10 份,semantic entropy 0.476、self-consistency 0.477、SPUQ 0.482、conformal 0.574,全部低于或接近随机;Pinocchio 黑盒打分同一批回答是 0.811。这个结果在 Granite-4.1-30B(0.806)和 Devstral-2-24B(0.836)上复现。解释是:难题上模型会沿同一条错误轨迹反复采样,一致性信号失灵。

零样本迁移:同一个校准器打 13 个训练时没见过的模型(8 家机构,含训练后发布的 GPT-6 Astra),平均 0.814,比训练内的 0.862 只降 0.05;换 benchmark 也稳,leave-K-out 验证里未见 benchmark 0.875、见过 0.877。四个开放目标上,100 条标注样本做 isotonic 再校准,ECE 从 0.259 降到 0.058。

裁判确实在读回答:397 道源模型答案分歧的题目(同题同难度)里,按题内排序 AUROC 0.726,答案盲的预测器只能 0.5;把「maybe」「I think」这类 hedge 词全删或全加,AUROC 变动不到 0.02,它不是在数客套词。

部署工作流:错误检测 AUPRC 0.867(自报置信度 0.576);置信度门控在 90% 准确率约束下自动放行 27-35% 的回答,基线全都做不到;人工复核按分数升序排,到 95% 系统准确率只需看 79% 的回答,省 21% 工作量。数据scaling上,2,000 条训练样本到全量性能的 91%,5,000 条到 96%;裁判大小几乎不影响,0.8B 约等于 8B。

为什么重要

对用闭源 API 做产品的团队,这是目前最便宜的正确性信号:一次 0.8B 前向,对比采样法的 5-10 倍推理开销;不碰 logits、权重、内部状态,pip install pinocchio-uq 加两行代码。分数能直接接进门控、分流、路由,论文还演示了 DPO 数据对挑选(88.8% 有效对)、三模型路由(67.4%,比固定用最强模型高 5.4 个点)、合成数据过滤(保留一半时准确率 90.9%)。

方法本身是渐进推进:沿 APRICOT 的外挂裁判路线,新东西在多目标混训、模型身份标签、视觉信号反哺文本,以及迁移到未见模型的验证。

还有个独立发现:semantic entropy 这类采样一致性方法在难题长回答上掉到随机以下,且在三个目标模型上复现。用采样做幻觉检测的团队该重新审视这个前提。

局限与存疑

作者列出的:要有能自动判分的标注数据,开放式生成不适用;跨家族迁移有折损(0.862 到 0.814);依赖 benchmark 名与模型身份元数据,部署时未知会打折;训练数据仅英文;恰好在最难的基准上最弱(HLE-Multimodal 0.557),因为对的回答同样满篇 hedge;推理步(step)级别预测接近随机(0.53)。

两点存疑。训练时回答截断到 800 字符,长思维链只能看到开头,对越来越长的 reasoning 输出是否丢信号,主文没给结论。医疗、金融两个部署场景的成本单价(医生复核 25 美元一条之类)全是假设值,不是实测,只能当示意看。

术语

原文与代码

社区讨论

相关论文

全部论文解读