LLM 润色抹平文风,从文本推断作者年龄的 F1 掉 9 个点

The Shrinking Landscape of Linguistic Diversity in the Age of Large Language Models

Zhivar Sourati, Farzan Karimi-Malekabadi, Meltem Ozcan, Colin McDaniel, Alireza Ziabari, Jackson Trager, Ala Tak, Meng Chen, Fred Morstatter, Morteza Dehghani

cs.CL

2025-02-17

四项观测加实验显示,ChatGPT 上线后写作复杂度方差下降;LLM 改写保留语义(87% 余弦>0.95)但压扁文风,个人特质分类 F1 平均掉约 6 个点。

这篇在解决什么

语言不只传信息,还带着作者是谁。年龄、性别、人格、党派倾向、共情、道德基础,都有可测的词汇和句法痕迹。临床筛查、营销画像、招聘里的「文化匹配」,都在用这些痕迹。

前提是人写东西的方式真的不一样。大语言模型被训练成续写最可能的词,再被一小群标注员对齐到「得体」的写法。当它们变成默认润色工具,文风会不会被推到同一条中轴上,把身份信号一起抹掉?南加州大学这组人用四项研究回答。

方法

Study 1 是观测。Reddit r/WritingPrompts 31.8 万篇故事(2018–2024)、Patch.com 38.0 万篇地方新闻(2018–2023)、arXiv CS.CL 与 CS.CV 摘要 8.0 万篇。用 Binoculars(归一化困惑度)估 AI 写作占比,用 Simpson 指数、Shannon 熵、依存距离、TTR、hapax 五个复杂度特征的月度方差做多样性指标,再合成一个综合方差。以 2022 年 11 月 30 日 ChatGPT 上线做间断增长模型,再用 Granger 检验 AI 占比能不能预测后续方差。

Study 2 是实验。从 GPT-3.5 上线前的 Reddit 和 arXiv 各抽 1000 篇,用 GPT-3.5、Llama 3 70B、Gemini Pro,配两条中性提示:「按最好的句法语法改写」和「转述」。用 ada-002 余弦相似度看语义还在不在,用 Levene 检验复杂度方差有没有被压扁。20 条 Reddit 文本请 4 人打语义分。

Study 3 把改写接到有作者标签的语料:国会演讲(年龄、性别、党派)、Pennebaker 意识流作文(Big Five)、共情对话、YourMorals 的 Facebook 帖。在原文上训练 SVM、逻辑回归、随机森林、梯度提升和 Longformer,再拿到 LLM 改写稿上测 F1。同时看预测往哪个类别漂。

Study 4 用 LIWC、NRC、共情词典、MFD2,比较原文和改写稿里「词类频率与特质」的相关还在不在。

结果

Study 1:三个来源在 ChatGPT 上线后,写作复杂度方差都往下走。arXiv 上持续下降项 POST β=-0.0014(p<.001),叠在本来就有的下行趋势上;AI 占比在滞后 5–8 个月时 Granger 显著。Reddit 的 POST β=-0.0021(p<.001),滞后 14 个月 Granger 显著。地方新闻有一次性下降(ONSET β=-1.405,p<.001),Granger 不显著,编辑规范可能挡住了一部分直接采用。

Study 2:87% 的改写与原文余弦相似度高于 0.95;人工评分均值 2.97/3(Gwet AC1=0.947)。复杂度方差几乎处处下降,Llama 3 的「转述」最狠:arXiv 从 0.0090 收到 0.0064(F=12.007,p<.001),Reddit 从 0.0091 收到 0.0045(F=19.387,p<.001)。Gemini 在 Reddit「转述」上 p=.145,Llama 3 的语法改写在 arXiv 上把方差抬到 0.0111(p=.066),不是每一格都显著。

Study 3:分类器绝对 F1 平均掉约 6 个点,仍高于随机基线。年龄伤得最重,F1 从 0.351 掉到 0.260(d=0.543)。其余:共情 0.657→0.603,人格 0.658→0.602,性别 0.694→0.623,道德 0.640→0.578,党派 0.664→0.591。预测漂移不随机:改写稿更常被判成年龄更大、男性、民主党、更高开放性与宜人性、更低外向性、更高道德、更低共情。作者概括成更像年长、男性、偏自由派、正道德效价、低共情的文风。

Study 4:不少经典关联被冲掉,例如性别与负向情绪词、外向性与代词、忠诚与朋友词、年龄与未来时。神经质与负向情绪、纯洁与信仰词、性别与社交词还在。这是选择性的改写,不是均匀加噪。

为什么重要

给「AI 腔」补了一组可复现的测量。润色几乎不改意思,改的是能当身份指纹的那一层。招聘筛简历、临床从文本估抑郁、营销做人群画像,只要默认过一遍 LLM,测量对象已经被推过一遍。更麻烦的是漂移有方向:大家都更像模型偏好的那一类人,不是变成「平均人」。

对写产品的人,「保持作者声音」不能靠「请写得自然」这种空提示。两条中性提示已经足够抹平方差。需要的是显式保住风格特征,或者根本不要让模型改句法层。

局限与存疑

Study 1 的 Granger 扫了 1–20 阶滞后,作者自己写了 I 类错误风险。地方新闻 Granger 不显著,「全网都在趋同」推过了数据。AI 检测靠 Binoculars,再准也会把人和模型写的混在一起,观测段的因果链比实验段弱。

实验只用了两条不保留风格的提示,没测「请保持原文口吻」。GPT-3.5、Gemini Pro、Llama 3 70B 都是 2024 年前后的模型,带强风格控制的新模型会不会轻一些,这篇没说。语料基本是英文。认知多样性会被语言趋同收窄,这一段是推测,没有实验。

Study 3 的分类器在原文上训练、改写稿上测试,F1 下降里有多少是单纯的域偏移、多少是身份信号真没了,没有完全拆开。作者强调改写后仍显著高于随机,身份没有被删干净。

术语

原文与代码

社区讨论

相关论文

全部论文解读