指令微调让模型嘴上更自信,推理链却更趋同

Are You Sure You're Sure? On the Impact of Instruction Tuning on Confidence and Lexical Diversity

Irina Proskurina, Mayank Kumar, Oyindolapo O. Komolafe

cs.CL, cs.AI

2026-08-14

三对 base/instruct 模型对照:指令微调一致推高置信度而准确率基本不动,跨推理链多样性普遍下降,且两者变化互不挂钩。

这篇在解决什么

指令微调(instruction tuning,用自然语言指令数据继续训练基座模型)后的模型被反复观测到「嘴上过度自信」:口头报告的置信度远超实际准确率。这篇问的是一个更细的问题:置信度变化的同时,模型生成的推理链 rationale 在词汇层面发生了什么?如果模型变自信的同时推理链也在收窄,那过度自信可能不只是校准问题,还牵涉生成多样性的退化。作者来自 Cohere Labs Community 与法国、印度、尼日利亚的合作机构。

方法

三对模型:Qwen2.5-7B、Mistral-7B-v0.3、Llama-3.1-8B 各取 base 与 instruct 版本,在 ARC-Easy、MMLU、CommonsenseQA 三个选择题基准上,每题用 chain-of-thought 提示采 5 条推理链。置信度看三个口径:候选答案分布的熵、两段式提问得到的口头置信度、基于似然的 ECE 校准误差。多样性拆两个口径:Unique-2(不同双元词组占比,量单条推理链的词汇丰富度)与 1-SelfBLEU(一条推理链与其余四条的相异度,量跨推理链的趋同程度)。为了排除干扰,还做了受控分析:只保留 base 与 instruct 选了同一答案且推理链长度配平的题目。

结果

置信度方向完全一致:九个模型×基准组合里,答案熵全部显著下降,口头置信度全部显著上升,而准确率基本不动。最悬殊的一组是 Llama-3.1-8B 在 ARC-Easy 上,准确率持平于 82.2%,口头置信度从 49.2% 跳到 90.4%;Mistral 在 CSQA 上准确率涨 11.8 个点的同时口头置信度从 47.9% 冲到 92.2%。与此同时似然 ECE 恶化,变化方向与多样性变化对不上号。

多样性则是两个口径分道扬镳:

口径指令微调后的变化
Unique-2(链内词汇丰富度)方向不定,Mistral 在 ARC-Easy 降、在 CSQA 反升
1-SelfBLEU(跨链相异度)九组全部下降,无一例外

受控分析后这个分裂依然成立:CSQA 配平样本上,Mistral 和 Llama 的 Unique-2 显著上升(+0.050/+0.053),1-SelfBLEU 却显著下降(-0.069/-0.012)。也就是说同一条推理链用词更多样了,五条链之间却更像彼此的复述。

为什么重要

给依赖采样一致性估不确定性的系统提了个醒:口头置信度涨了不代表模型真的更确定,准确率没动、ECE 反而变差,涨的是姿态不是能力。跨链多样性一致收窄意味着自一致性投票(self-consistency)这类靠多条推理链取多数的信息量在变少,链与链越来越像,采样再多也是重复计数。对下游应用,微调后的模型拿推理链多样性当不确定性代理的做法需要重新校验。

局限与存疑

作者自己列的:只有三个英文选择题基准,多样性只量了词汇层,没碰语义与句法层;没有跨语言验证;也没测安全或人口敏感提示上的表现,结论不能外推到有害输出。读下来另有几点:每题只采 5 条推理链,估计跨链多样性的样本偏小;三家模型的 instruct 训练数据与流程不透明,无法归因是哪类指令数据造成的;全文是相关性分析,置信度与多样性谁驱动谁没有因果证据。对既有文献里「指令微调推高口头置信度」的结论,这篇的增量主要在多样性侧的细致拆分。

术语

原文与代码

相关论文

全部论文解读