ChatGPT上线后写作复杂度方差降21%到50%,LLM润色抹掉身份线索

2026-08-24

南加大在七个数据集、超88万条文本上发现,LLM润色把写作复杂度方差压低21%到50%,语义还在,年龄性别党派等身份线索被冲淡并偏向模型先验。

这篇在解决什么

语言不只传意思,还带着作者是谁:年龄、性别、立场光谱、人格、道德立场,都会在用词和句法里留下痕迹。心理诊断、营销个性化、招聘筛选、文化研究,都靠这些痕迹工作。LLM当写作助手以后,输出偏向训练数据里最常见的续写。问题就变成:润色之后,意思还在,身份信号还在不在。

南加州大学这组工作把观察和实验绑在一起。Nature Human Behaviour的正式文本因付费墙拿不到PDF,方法细节来自同题预印本(arXiv:2502.11266)。正式摘要把工作收成三项研究、七个数据集、超过88万条文本。预印本把同一套材料拆成四段:时间序列、受控改写、特质预测、词表相关。下面按这条更细的拆法写,数字以正式摘要和预印本正文能对上的为准。

方法

观察段用三个偏个人、约束相对松的来源,时间窗大约2018年到2023/2024年:Reddit r/WritingPrompts故事318,490条(少于200词的回复丢掉)、Patch地方新闻379,583篇、arXiv计算机语言学与计算机视觉摘要80,238篇。AI痕迹用Binoculars(归一化困惑度)打,作者称在相近文体上真阳性>0.95、假阳性<0.01。复杂度用五项特征的月方差再合成:词汇Simpson指数、Shannon熵、平均依存弧长、Type-Token Ratio、 Hapax。ChatGPT上线(2022年11月30日)当冲击点,拟合含Time / ONSET / POST的间断增长模型,再用Granger看AI使用率能不能预测后续方差。

实验段从GPT-3.5上线前的Reddit和arXiv各抽1,000篇,用GPT-3.5、Llama 3 70B、Gemini Pro,两条中性提示(改语法、改写)重写。语义保留看text-embedding-ada-002余弦相似度,另加20条Reddit样本的四人人工打分。方差用Levene检验。

特质段换到作者标签已知的文本:国会演讲710人(年龄、性别、党派)、Pennebaker Essays 2,348篇(Big Five)、Empathic Conversations 711篇(IRI共情)、YourMorals 3,641名用户的Facebook帖(道德基础)。在原文上训练SVM、逻辑回归、随机森林、梯度提升、Longformer,特征是TF-IDF或同一套embedding,5折×40种子,只留原文上高于随机且至少20次成功的模型,再拿到改写文上比F1。另定义Δ衡量预测类别失衡,并用预测方向变化看模型把作者往哪边推。最后用LIWC等词表做自上而下的相关,看「外向爱用社交词」这类经典联系在改写后还在不在。

结果

正式摘要给出的总效应:改写后写作复杂度方差在数据集和模型间下降21%到50%(P≤0.05),核心内容保留,但与主导特征相关的模式被放大、其他模式被压住。

观察段里,三个来源的复杂度方差在ChatGPT上线后都往下走。arXiv的POST项β=−0.0014(p<.001),叠在本来就下降的Time趋势上;Granger在滞后5到8个月显著。Patch有明显的ONSET下降(β=−1.405,p<.001),Granger不显著,编辑流程可能缓冲了直接因果。Reddit的POST β=−0.0021(p<.001),Granger滞后14个月才显著,作者把它读成普通用户采用更慢。

受控改写里,87%的余弦相似度高于0.95;人工均分2.97/3(Gwet AC1=0.947)。Levene检验下多数模型×提示组合方差显著下降,Reddit上最猛的一档从0.0091降到0.0045(约50%)。

特质分类器绝对F1平均掉大约6个百分点,但仍高于随机。年龄伤得最重:0.351落到0.260。改写文的Δ更大,预测更往某一边挤。方向上,改写后模型更常把作者判成更低共情(除个人痛苦)、更高道德、更年长、更开放、更宜人、更内向、更偏民主党、更偏男性。词表层,性别与负向情绪词、外向与代词、忠诚与朋友词、年龄与将来时等经典联系被冲掉;神经质与负向情绪、纯洁与信仰词、性别与社交词还在。

特质原文F1改写文F1随机基线
年龄组0.3510.2600.244
共情0.6570.6030.541
人格0.6580.6020.514
性别0.6940.6230.495
道德0.6400.5780.521
党派0.6640.5910.490

为什么重要

对做文本画像、招聘筛选、心理健康监测的人,这是一个测量学警告:LLM润色会留下语义、抽走风格,分类器还在随机之上,但校准已经偏了,而且偏的方向跟模型先验一致(更年长、更男性、更自由派、更高道德、更低共情)。招聘场景里,会用AI把稿子磨到「像那么回事」的人,可能占掉写法本来更跳的人。对训练数据闭环更麻烦:网上越来越多被模型改过的文本会再进下一轮预训练,方差还可能继续收。

这不是「模型会统一全世界文风」的证明。新闻侧Granger已经不显著,说明组织规范能挡一层。可挡的是冲击大小,不是方向。

局限与存疑

Nature正文本拿不到,正式稿把预印本的四段收成三项研究,未展示的图表数字无法逐格核对。观察段的AI检测依赖Binoculars,检测器和复杂度特征都跟「可预测性」有关,作者用「使用率的水平 vs 复杂度的方差」来切割,但仍可能共线。多项滞后的Granger有I型错误风险,作者自己写了。改写实验用的是中性提示,真实用户会加人设、会选风格,效应可能更小或更大。分类器掉点不等于人类读不出身份。国会演讲、学生作文、问卷用户都不能代表全球写作者。致谢里有美国陆军实验室和DARPA资助,研究问题本身仍是语言多样性,但外推到作战或情报场景,论文并没有做。

术语

原文与代码

社区讨论

全部论文解读