NUS提出ConfTuner免置信标签做口头校准,ECE最多降54.7%

ConfTuner: Training Large Language Models to Express Their Confidence Verbally

Yibo Li, Miao Xiong, Jiaying Wu, Bryan Hooi

NeurIPS 2025

cs.CL, cs.AI

2025-08-26

NUS提出ConfTuner,用tokenized Brier分数微调口头置信,无需真实或代理置信标签;相对最强基线ECE最多降54.7%、AUROC升14.4%,自我纠错与模型级联也跟着变好。

这篇在解决什么

LLM已经会用自然语言报出80%这种把握,训练目标里却从来没有这一项。错了也敢报99%。医学、法律这类场景里,人会按高置信去行动。

现有两条路都薄。Prompt工程改不了模型内部的概率习惯。微调没有真实置信标签,只能拿启发式代理:同类题平均正确率、多次采样一致性、另一个模型的判断。组级统计把不同难度当成同一题,采样又贵又噪,模型当裁判会把偏差写进标签。

核心问题是:训练时能不能直接校准口头置信,既不要真实置信分数,也不要这些代理。

方法

ConfTuner来自新加坡国立大学,把分类器里的proper scoring rule(恰当评分规则)搬到token上。经典Brier score是(y − p)²,最小化它会逼模型把p报成真实正确概率。LLM吐出的是「Confidence: 80%」这种token序列,没有现成的标量p。

论文图2给过一个小学算术:1051是否大于1039+15。标准模型答Yes、置信99%;微调后同一句Yes变成5%。1051其实小于1054。

流程就两步。

没有人需要标注「这题该报67%」,也不用对同一题采10次或100次。论文证明该损失是口头置信意义上的proper scoring rule:最优解把全部概率质量压在最接近真实正确概率η的那一档。

训练只用HotpotQA。基座是Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Ministral-8B-Instruct-2410。推理一律greedy decoding。

结果

对照包括未改动基座、三次采样再平均的Ensemble,以及SaySelf和LACIE(同一基座、同一HotpotQA重训)。指标是ECE(越低越好)和AUROC(越高越好)。

基座方法ECE五集平均AUROC五集平均
LLaMABase0.27680.5923
LLaMALACIE0.23870.6229
LLaMAConfTuner0.10820.6740
QwenBase0.37810.6155
QwenConfTuner0.28720.6861
MinistralBase0.43930.5216
MinistralConfTuner0.18840.6810

相对最强基线,ECE最多降54.7%(LLaMA上对LACIE),AUROC最多升14.4%(Ministral上对Ensemble)。HotpotQA上LLaMA的ECE从0.4803降到0.0405。分布外的TruthfulQA、TriviaQA也降;GSM8K、StrategyQA降幅更小,Qwen在GSM8K上ECE从0.1306到0.1302,几乎不动。

平均最优,单点不是全赢。Qwen在StrategyQA的ECE是0.1815,差过Ensemble的0.1226;LLaMA在TruthfulQA的AUROC是0.5739,差过Ensemble的0.6038;Ministral在StrategyQA的AUROC只有0.5147,Ensemble是0.6222。

数字档训练、测试改成high/medium/low,LLaMA的AUROC平均仍有0.6511,高于SaySelf的0.5989。提示改成「请在回答时表达不确定」,再用GPT-4o把措辞映射到0到100,隐式ECE平均0.1483、AUROC 0.6820,显式是0.1082和0.6740。

黑盒侧用LLaMA版ConfTuner给GPT-4o的答案打置信:五集平均ECE从GPT-4o自评的0.1640降到0.0970,AUROC从0.5945升到0.6275。

自我纠错设定是置信低于0.5才改写。Qwen加上ConfTuner后,HotpotQA和TruthfulQA的准确率提升最大;基线提升很小,有的还改坏,低置信里混进了对的答案。模型级联按低置信挑100到400条交给GPT-4o,同一预算下HotpotQA准确率最多高9.3个百分点,TruthfulQA最多高5.5。

4张A40上训练4分钟、2000条、每题采样1次。SaySelf是120分钟、9万条、每题100次;LACIE 26分钟、1万条、每题10次。附录显示2000条就收敛。

为什么重要

这是一条很干净的微调配方:有标准答案就能训,不必造置信标签,也不必为校准去采样。用户看见的是口头置信,闭源API也拿不到logit。

两个能落地的用法。给7B到8B指令模型补一句把握声明;给GPT-4o这类黑盒挂一个外校准器。自我纠错和级联的数字说明,阈值分流只有在校准过关以后才值钱,否则改写预算会砸在本来就对的题上。

Qwen上ECE平均只从0.3781降到0.2872。三个基座幅度差一截。损失只改置信token的分布,答题正确率不是优化目标。

局限与存疑

论文自己点了两条。固定置信token集合能不能撑到更复杂对话、更多样的不确定措辞,仍是开放问题。proper scoring rule只保证目标函数方向对,数据质量、模型结构和优化动态仍会挡住真实校准。

正文没有给出附录F的准确率表,校准有没有伤到答题能力,无法从主文核对。自我纠错只画了变化率柱状图,没写改前改后的绝对准确率。隐式置信靠GPT-4o再打分,尺子本身也会过自信。训练只在HotpotQA上,Qwen在GSM8K的ECE几乎不动,任务迁移不均匀。tokenized Brier盯的是greedy答案对错之后的置信分布,换温度或换解码,条件正确概率会不会跟着变,文中没测。

术语

原文与代码

社区讨论

相关论文

全部论文解读