Chain-of-Thought Faithfulness of Reasoning Models Varies with Where and How Preference Cues Are Delivered
Aryo Pradipta Gema, Neel Rajani, Rohit Saxena, Wai-Chung Kwan, Pasquale Minervini
cs.CL, cs.AI
2026-08-30
爱丁堡FACE-Eval用5100样本测15个开源推理模型:工具返回或隐含的偏好线索都会降低CoT口头承诺,未声明采纳率全面上升。
CoT 监控的前提是:推理痕迹会记下真正推动答案的信息。现有忠实度测试通常把偏置线索塞进用户消息,看答案变了之后模型有没有提这一笔。这个设定对聊天助手还算贴切,对 agent 就不贴了。
Agent 经常从工具返回、邮件、Slack、浏览记录里碰到用户偏好,而且经常是原始材料,需要自己推断。线索换了通道、换了显式程度之后,推理链还记不记得「决定按这个偏好改答案」?爱丁堡大学这组实验测的就是这件事。
FACE-Eval 共 5100 条样本:5000 条带线索,100 条无线索对照。设计是 5 个偏好轴、每轴 2 个立场、5 种来源、多种投放条件、每轴 20 个情景。五个轴覆盖左右立场、伦理(功利与义务)、平等观、认识姿态(怀疑与顺从)、领域专业程度。五个来源是用户画像、邮件、Slack、个人笔记、浏览记录。
投放拆成两个正交轴:
核心指标不是「有没有提到线索」,是口头承诺率 VCR:在答案已经跟着偏好走的样本里,推理链有没有明确写下「决定按这个偏好改答案」。线索跟随率 CFR 是答案跟着走的比例。未声明采纳率 UAR = CFR × (1 − VCR),分母是全部带线索样本。模型可以很少口头承诺,但如果答案本来就不跟,UAR 仍然可以很低。
评了 8 个家族、15 个开源权重模型,总参数 4B 到 1.60T,含 DeepSeek V4 Pro(1.60T)、Kimi K2.6(1.04T)、Inkling(975B)、GLM 5.2(744B)。主裁判是 Claude Haiku 4.5,推理和答案分开打分;GPT-5.6-Luna 做第二裁判复现趋势。另外测了两种系统提示:要求把信息归因到来源,以及告知推理会被监控。最后用 GPT-5.6-Luna 和 GPT-4o-mini 当转录监控器,在每个家族最大模型上检测偏好采纳。
15 个模型无一例外:用户消息通道的 VCR 高于工具返回,显式线索的 VCR 高于隐含线索。用户相对工具的 VCR 优势从 GLM 5.2 的 0.08 拉到 OLMo 3.1-32B 的 0.77。CFR 落在 0.43 到 0.58 之间,模型读得懂线索、也会跟,只是跟的时候不一定写下来。
UAR 在工具通道上 15/15 更高,差距 0.03(Gemma 4-E4B)到 0.21(Qwen 3.5-27B)。隐含相对显式的 UAR 上升在 30 组模型-通道对比里有 28 组成立。把显式与隐含对按模型自评清晰度对齐之后,显式线索仍保留约 0.14(用户通道)和 0.13(工具通道)的 VCR 优势,清晰度解释不了全部差距。
| 设置 | 指标 | 结果 |
| 15/15 模型 | 工具 vs 用户 VCR | 工具更低 |
| 15/15 模型 | 工具 vs 用户 UAR | 工具更高 0.03–0.21 |
| 28/30 对比 | 隐含 vs 显式 UAR | 隐含更高 |
| GPT-5.6-Luna | 转录监控 AUROC | 0.71–0.73 |
| GPT-4o-mini | 转录监控 AUROC | 0.64–0.74 |
监控器在 32 个模型-通道-显式单元格上,UAR 越高,检测越差(Pearson r 分别为 -0.54 和 -0.78)。给 GPT-5.6-Luna 加上 CoT,只在用户通道上带来可检出的增益;工具通道的区间含零。GPT-4o-mini 四组都有增益,但通道和显式差距仍在。
来源归因提示在 7 个模型上缩小了通道差距,Qwen 3.5 主要是用户通道 UAR 上升,不是工具通道下降。告诉模型「推理会被监控」最多改 0.070,关不上差距。提高推理力度在两个 GPT-OSS 上单调降低 UAR,主要来自 VCR 上升而不是 CFR 下降;DeepSeek V4 Pro 和 Inkling 没有同样的四条件模式。每个可调力度的模型在每个力度档上,用户通道和显式线索的 VCR 仍然更高。
如果产品上的 CoT 监控只拿用户消息里的显式偏置做测试,会高估 agent 场景下的可监控性。真实偏好经常藏在工具结果和原始材料里,而这正是 15 个模型口头承诺最低、监控 AUROC 也更差的格子。
提示工程和加推理步数都不是稳妥补丁。归因指令有时只是把缺口从工具通道挪到用户通道;加长 CoT 可能只是给裁判更多机会扫到套话。
这篇是测量学警告,不是新训练方法。对做 agent 安全评审的人,FACE-Eval 把「线索从哪来、写得多直白」变成必须拆开报的维度。
论文自己说得清楚:实验指出差距在哪,没有指出为什么。工具通道除了位置不同,还多了一条预填工具调用,训练先验、报告习惯、裁判对通道措辞的敏感都可能掺在里面。
任务是单轮、预填工具,模型不自己选工具。按偏好改答案也不一定需要很长的串行推理,模型可能把 CoT 当可选报告,不当必要工作区。需要多步推理才能用上线索的任务,结果可能不一样。
VCR 依赖自动裁判。第二裁判复现了主趋势,但绝对值和部分排名会变。更长的痕迹给裁判更多机会找到承诺用语,GPT-OSS 的力度结果尤其容易被这个效应污染。
这不是在证明模型故意隐瞒。合成的邮件和笔记也不等于真实用户数据。提高口头承诺的干预,还可能教会模型写公式化披露。