改写把「可能」写成「是」,最多75%输出抬高确定性

From 'May' to 'Is': Certainty Distortion in Language Model Rewriting

Catarina G Belem, Shang Wu, Hongyu Yao, Mark Steyvers, Sameer Singh, Padhraic Smyth

EMNLP 2026 (Main)

cs.CL, cs.AI, cs.LG

2026-06-06

科学与医学改写中最多75%输出会改变确定性;多数模型把确定性抬高的次数是压低的1.5到2倍,提示词减不掉。

这篇在解决什么

医学、法律、科学文本会用「可能」「提示」「据称」这类认识情态标记,把已经坐实的结论和试探性判断分开。读者按这些标记更新信念。人写的科学传播已经会抬高确定性:大约 30% 的研究发现在媒体转述里被夸大。日常改写、摘要、简化越来越多交给语言模型之后,问题变成模型会不会在「意思不变」的改写里,把「空腔可能来自慢性阻塞性肺病」写成「空腔就是慢性阻塞性肺病」。

UCI 和 MIT 的这项 EMNLP 2026 工作把确定性当成一条独立于事实性的轴来测,并给出可操作定义:certainty distortion(确定性失真),即一次本应保义的变换之后,文本表达的确定性是否发生了有意义的变化。

方法

他们跳过单句绝对分,直接做成对比较。给定原文和模型改写,用 gpt-5.4-mini 当裁判,两段文字匿名成 Text A / Text B,在五档量表上选哪一段更确定,再把顺序对调问一遍以消位置偏差。两次方向一致才算数,方向冲突记成平局。指标 CD 是发生偏移的样本比例,再拆成向上 CD-↑(抬高)和向下 CD-↓(压低)。

现成的 BERT 打分器在对照实验里会顶到天花板,分不清「比较确定」和「非常确定」。人标也吵,Krippendorff's α 大约 0.25。用 240 对文本、129 名 Prolific 标注者做校验:gpt-5.4-mini 与人群共识的 Kendall τB 是 0.47,高于单个标注者均值 0.34,也高于此前最强 BERT 估计器约 0.16。这个裁判至少不比随机抽一个标注者差。

评测先放在句子级,减少胡编无关内容的干扰。科学侧用 SPICED 的 397 条研究发现;医学侧用 MIMIC-CXR 放射报告 Findings 里 800 句,其中 400 句带认识情态标记。任务四种:科学改写、写成《纽约时报》口吻、放射句改写、改成给病人看的白话。模型覆盖 Gemini 3.1 (fl)、gpt-5.4-nano、Claude 4.5 (H)、Llama 3.3 (70B)、Qwen3 (8B),默认 T=1、top-p=0.9。

结果

句子级科学改写已经有 37.5%–64% 的输出会改确定性;写成新闻稿时 Claude 4.5 (H) 到 74.8%,Gemini 3.1 (fl) 到 75.3%。医学侧低一截,12.5%–38.3%。五个模型平均 CD 从 gpt-5.4-nano 的 30.0% 到 Llama 3.3 (70B) 的 49.4%。人工写的 SPICED 新闻本身也有 23.9% 失真,模型改写则是 44.3%–75.3%,不能只用「学了新闻腔」来解释。

模型科学改写科学新闻放射改写病人白话平均
gpt-5.4-nano37.544.325.812.530.0
Claude 4.5 (H)48.174.829.120.143.0
Gemini 3.1 (fl)60.275.324.326.846.7
Qwen3 (8B)43.157.731.118.237.5
Llama 3.3 (70B)64.069.338.326.049.4

方向不对称。多数模型抬高确定性的次数是压低的 1.5–2 倍;Qwen3 在科学侧达到 2.0。例外是 gpt-5.4-nano 在 SPICED 上几乎打平(比值 0.9),Llama 3.3 (70B) 在 MIMIC 上甚至更爱压低(0.6)。把原文按确定性高低切开后,低确定性科学句有 50%–75% 被抬高,高确定性句被压低的只有 20%–50%。已经很确定的科学句,Claude 和 Gemini 仍有约 20% 继续加码。

这不是采样噪声。改成 greedy(T=0)后,失真再升 9–20 个百分点,多出来的几乎都是抬高。科学改写大多一刀定型,后面几轮变化不大;医学改写会叠。Claude 4.5 (H) 一轮后抬高 20%,五轮后 40%。MIMIC 每 100 词有 4.84 个认识情态标记,SPICED 只有 1.54,反复改写有更多机会把「可能」磨掉。

放大模型帮不了多少。新闻改写上 Claude 从 Haiku 的 74.8% 降到 Opus 的 55.7%,Gemini 从 75.3% 到 69.5%,GPT 家族几乎没动(44.3% 到 46.1%)。没有任何变体把科学新闻失真下到 39.5% 以下,或把医学改写下到 11% 以下。

文档级同样存在,只是比例更低:500 篇摘要上 CD 15.0%–24.8%,抬高是压低的 3.1–11.3 倍;800 份放射报告 2%–5%。文档级裁判还没有同等的人标校验。

提示词能减不能灭。在科学任务上叠「保义」「别编」「保持确定性」,改写 CD 从 50.6% 降到 40.1%,新闻从 64.3% 降到 41.9%。只有显式要求保持确定性,才把抬高/压低比拉到约 1,但仍有约 40% 单条失真。

为什么重要

保义评测一直盯事实和语义,确定性被当成措辞问题。这篇说明它是一条独立轴:事实没错,读者读到的承诺已经变了。写产品文案、改放射印象、把论文改成新闻稿,默认提示就会把试探写成定论。Greedy 解码会加重,不是减轻。提示词只能把偏差扳平,不能按条保住。更值得跟进的是实例级校验,或在偏好数据里惩罚确定性漂移,而不是再叠一句「请保持不确定」。

局限与存疑

只测了英文,而且只有科学和医学。法律、金融会不会一样,论文没做。文档级对齐步骤只有对照改写的方向性检查,没有人标。机制也没钉死:模型对主张的先验信念与失真方向几乎不相关(Kendall τB≈−0.1)。更像是预训练学到了新闻腔和放射报告腔,或是指令微调偏好干脆、好用的句子。作者自己也说,现有 RLHF 文献看到的「确定性加强」来自问答,推不到保义改写。人写新闻 23.9% 的对照也不是受控实验。

术语

原文与代码

社区讨论

相关论文

全部论文解读