Revisiting Uncertainty Estimation and Calibration of Large Language Models
Linwei Tao, Yi-Fan Yeh, Minjing Dong, Tao Huang, Philip Torr, Chang Xu
cs.CL, cs.AI, cs.LG
2025-05-29
悉尼大学等评了 80 个 0.6B–671B 模型:从回答含糊推断的 LVU,平均比 token 概率和口头打分大约高 10% AUROC、低 10% ECE。
高风险场景里,模型不但要答对,还要知道自己会不会答错。校准看不确定程度是否对得上正确率,选择性分类看能不能把对的和错的排开。方法已经很多:token 概率、内部激活、多样本一致性、口头数字分、口头含糊。缺的是一次把现代模型谱系铺开的对照。
悉尼大学、香港城市大学、上海交通大学和牛津的这组人评了 80 个模型,覆盖开源与闭源、稠密与 MoE、推理与非推理、量化变体,参数从 0.6B 到 671B。评测只走黑盒、单次生成的三条:TPU(长度归一化后的 token 概率)、NVU(让模型自己打 0–100 分)、LVU(另用一台模型给「probably / might」这类含糊打分)。基准是更难、更不容易饱和的 MMLU-Pro。
不确定性定义成 [0,1] 标量,0 是完全确定。TPU 取生成序列的几何平均 token 概率,再做 1 减它。NVU 用带思维链的提示,让模型同时给答案和数字分。LVU 不要求数字,把生成里的含糊交给 LLaMA-4-Maverick-17B-128E-Instruct 当裁判。校准用 10 桶 ECE,排序能力用 AUROC。白盒内部状态和多样本语义熵被刻意排除:部署里经常拿不到,也更贵。
LVU 在 80 个模型上平均比次优方法大约高 10% AUROC、低 10% ECE。准确率高不等于不确定性可靠。GPT-4.1、LLaMA-4-Maverick、LLaMA-3.1-405B 准确率高,TPU 校准却差;Qwen3-235B-A22B 推理模式准确率只有 67%,比 DeepSeek-R1、GPT-4.1 低大约 15 分,三项不确定性指标却都进第一档。
规模、后训练、推理模式都有用。Qwen3 从 0.6B 到 32B,越大 ECE 越低、AUROC 越高,但 8B 已经接近饱和;0.6B 和 1.7B 接近乱猜。Instruct 相对 Base 三项都更好。推理模式把高置信错误砍掉超过 20%,Qwen3-4B Think 的不确定性可以摸到 GPT-4.1。Qwen3-30B-A3B(MoE,每次激活 3B)在 LVU 上优于参数接近的稠密 Qwen3-32B,可对照的 MoE–稠密对很少。数学、生物、物理这类推理科目的 AUROC,比法律、历史这类知识题高超过 10%。FP8 和 AWQ 量化通常让不确定性变差一点,幅度大约 5%。多样本 Consistency 在 Qwen3-32B 上 ECE 可到 0.08,比单次方法更准,但更贵。格式不合规的回答平均丢掉 17%。
ECE 和 AUROC 相关很弱,LVU 上几乎不相关。校准好不代表排序好。
要在黑盒、一次生成的约束下做拒绝回答或人工复核,口头含糊比让模型打分、比看 perplexity 更稳。后训练和推理模式不只抬准确率,也在改不确定性怎么被说出来。部署时不要用准确率当校准的代理指标。
LVU 依赖裁判模型,论文自己说只做了小规模有效性检查。小模型指令跟随差,裁判把不合规输出标成高不确定,AUROC 会被「答得乱等于答错」抬起来,不一定是真会表达不确定。全场只测 MMLU-Pro 选择题,开放生成会不会同样成立,没有直接证据。MoE 优势只有一对接近对照。17% 解析失败被丢掉,可能系统性偏向会听话的模型。