ConfTuner: Training Large Language Models to Express Their Confidence Verbally
Yibo Li, Miao Xiong, Jiaying Wu, Bryan Hooi
NeurIPS 2025
cs.CL, cs.AI
2025-08-26
NUS提出ConfTuner,用tokenized Brier分数微调口头置信,无需真实或代理置信标签;相对最强基线ECE最多降54.7%、AUROC升14.4%,自我纠错与模型级联也跟着变好。
LLM已经会用自然语言报出80%这种把握,训练目标里却从来没有这一项。错了也敢报99%。医学、法律这类场景里,人会按高置信去行动。
现有两条路都薄。Prompt工程改不了模型内部的概率习惯。微调没有真实置信标签,只能拿启发式代理:同类题平均正确率、多次采样一致性、另一个模型的判断。组级统计把不同难度当成同一题,采样又贵又噪,模型当裁判会把偏差写进标签。
核心问题是:训练时能不能直接校准口头置信,既不要真实置信分数,也不要这些代理。
ConfTuner来自新加坡国立大学,把分类器里的proper scoring rule(恰当评分规则)搬到token上。经典Brier score是(y − p)²,最小化它会逼模型把p报成真实正确概率。LLM吐出的是「Confidence: 80%」这种token序列,没有现成的标量p。
论文图2给过一个小学算术:1051是否大于1039+15。标准模型答Yes、置信99%;微调后同一句Yes变成5%。1051其实小于1054。
流程就两步。
没有人需要标注「这题该报67%」,也不用对同一题采10次或100次。论文证明该损失是口头置信意义上的proper scoring rule:最优解把全部概率质量压在最接近真实正确概率η的那一档。
训练只用HotpotQA。基座是Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Ministral-8B-Instruct-2410。推理一律greedy decoding。
对照包括未改动基座、三次采样再平均的Ensemble,以及SaySelf和LACIE(同一基座、同一HotpotQA重训)。指标是ECE(越低越好)和AUROC(越高越好)。
| 基座 | 方法 | ECE五集平均 | AUROC五集平均 |
| LLaMA | Base | 0.2768 | 0.5923 |
| LLaMA | LACIE | 0.2387 | 0.6229 |
| LLaMA | ConfTuner | 0.1082 | 0.6740 |
| Qwen | Base | 0.3781 | 0.6155 |
| Qwen | ConfTuner | 0.2872 | 0.6861 |
| Ministral | Base | 0.4393 | 0.5216 |
| Ministral | ConfTuner | 0.1884 | 0.6810 |
相对最强基线,ECE最多降54.7%(LLaMA上对LACIE),AUROC最多升14.4%(Ministral上对Ensemble)。HotpotQA上LLaMA的ECE从0.4803降到0.0405。分布外的TruthfulQA、TriviaQA也降;GSM8K、StrategyQA降幅更小,Qwen在GSM8K上ECE从0.1306到0.1302,几乎不动。
平均最优,单点不是全赢。Qwen在StrategyQA的ECE是0.1815,差过Ensemble的0.1226;LLaMA在TruthfulQA的AUROC是0.5739,差过Ensemble的0.6038;Ministral在StrategyQA的AUROC只有0.5147,Ensemble是0.6222。
数字档训练、测试改成high/medium/low,LLaMA的AUROC平均仍有0.6511,高于SaySelf的0.5989。提示改成「请在回答时表达不确定」,再用GPT-4o把措辞映射到0到100,隐式ECE平均0.1483、AUROC 0.6820,显式是0.1082和0.6740。
黑盒侧用LLaMA版ConfTuner给GPT-4o的答案打置信:五集平均ECE从GPT-4o自评的0.1640降到0.0970,AUROC从0.5945升到0.6275。
自我纠错设定是置信低于0.5才改写。Qwen加上ConfTuner后,HotpotQA和TruthfulQA的准确率提升最大;基线提升很小,有的还改坏,低置信里混进了对的答案。模型级联按低置信挑100到400条交给GPT-4o,同一预算下HotpotQA准确率最多高9.3个百分点,TruthfulQA最多高5.5。
4张A40上训练4分钟、2000条、每题采样1次。SaySelf是120分钟、9万条、每题100次;LACIE 26分钟、1万条、每题10次。附录显示2000条就收敛。
这是一条很干净的微调配方:有标准答案就能训,不必造置信标签,也不必为校准去采样。用户看见的是口头置信,闭源API也拿不到logit。
两个能落地的用法。给7B到8B指令模型补一句把握声明;给GPT-4o这类黑盒挂一个外校准器。自我纠错和级联的数字说明,阈值分流只有在校准过关以后才值钱,否则改写预算会砸在本来就对的题上。
Qwen上ECE平均只从0.3781降到0.2872。三个基座幅度差一截。损失只改置信token的分布,答题正确率不是优化目标。
论文自己点了两条。固定置信token集合能不能撑到更复杂对话、更多样的不确定措辞,仍是开放问题。proper scoring rule只保证目标函数方向对,数据质量、模型结构和优化动态仍会挡住真实校准。
正文没有给出附录F的准确率表,校准有没有伤到答题能力,无法从主文核对。自我纠错只画了变化率柱状图,没写改前改后的绝对准确率。隐式置信靠GPT-4o再打分,尺子本身也会过自信。训练只在HotpotQA上,Qwen在GSM8K的ECE几乎不动,任务迁移不均匀。tokenized Brier盯的是greedy答案对错之后的置信分布,换温度或换解码,条件正确概率会不会跟着变,文中没测。