AI 写作留下稳定熵与多样性指纹,改稿却把词密打低 d=-3.10

AI Writers Have a Consistent Stylometric Footprint, but AI Editors Do Not

Zhengyang Shan, Yukyung Lee, Sophie Hao

EMNLP Main 2026

cs.CL

2026-08-28

波士顿大学用 14 项风格特征比较 AI 写作与改稿。生成文本熵高 1 个标准差、词汇多样性高 2 个,线性分类准确率 91.74%;改稿主信号是词密下降(d=-3.10),更贴近人类原文。

这篇在解决什么

AI 文本检测默认一件事:只要模型插手过,文本就会带上一套稳定的统计痕迹,而且这套痕迹在「从头写」和「改人写的稿」之间可以共用。检测器拿全生成文本训练,再拿去打润色稿、改写作业,这个迁移能不能成立,过去没有在同一套可解释特征上被直接测过。

波士顿大学问了两个很具体的问题。AI 生成文本有没有跨模型、跨领域还稳定的风格?AI 改稿会不会走上同一条路?

方法

他们做了一个叫 GEN 的语料,Generated, Edited, and Naturalistic。五个英文领域:Wikipedia、WikiHow、arXiv 摘要、Reddit 问答、Reddit 故事。人类稿 4,998 篇,主要来自 M4 和 WritingPrompts;AI 生成 39,916 篇,八个开源指令模型各写一遍,Qwen-2.5 7B/72B、Gemma-3 12B/27B、Llama-3.1-8B、Llama-3.3-70B、GPT-oss-20B/120B;AI 编辑 273,420 篇,用 1,000 篇人类种子、31 条提示、八类编辑(语法、流畅、清晰、语气、改写、加细节、结构调整、压缩),三个大模型来改,目标编辑比 30%/50%/70%,实际编辑比用词级 Levenshtein 事后量。

每篇抽 14 个可解释风格特征,覆盖词汇多样性、词密、熵、突发性、可读性、标点、句法树深度等。检测器是带 L2 的逻辑回归,特征按训练集标准化,十次类别均衡抽样取平均。特征重要性同时看系数绝对值,和打乱该特征后准确率掉多少。

结果

生成侧,足迹又瘦又稳。相对人类稿,AI 生成文本的熵均值高约 1 个标准差,词汇多样性高约 2 个标准差。只用这 14 维,人类 vs 生成的全局准确率 91.74%±0.61。分领域都在 92.57%–95.83%。分模型大多 92%–99%,例外是 GPT-oss-120B,只有 79.45%,这份数据里最像人的生成器。

跨 14 种训练条件(全局、分领域、分模型),词汇多样性进入前五重要特征 13 次,熵 12 次,两者稳定性分数最高。突发性在全局条件下排第三,换条件就不稳。温度 0.3/0.7/1.0 时准确率 82.2%/80.7%/79.5%,特征排序 Spearman ρ 均值 0.89。闭源补测:Gemini-3-Flash 82.1%,GPT-5.4-mini 78.6%,词汇多样性仍有用,次级特征已经换人。

编辑侧走的是另一条路。相对人类原文,词汇多样性只微升(Cohen's d=+0.24),熵下降(d=-0.28),生成那套「两个一起升」没有出现。最强编辑信号是词密大降(d=-3.10):实词占比被压下去,功能词相对变多。词密在生成检测里的排列重要性只有 0.056,几乎帮不上生成识别。GPT-oss-120B 当编辑器又不合群,熵上升 d=+0.44,Linsear Write 大降 d=-2.81。

三类两两可分性(AUC):

方法人 vs 生成编辑 vs 生成人 vs 编辑
风格逻辑回归0.970.980.80
EditLens-Llama1.000.850.97
两者平均1.000.990.94

风格特征很会分开编辑和生成,不太会分开编辑和原文。EditLens 正好反过来。5% 误报下,EditLens-Llama 抓「人 vs 编辑」的真正例率 91%。编辑文本贴着原文,不贴着生成稿,不是两者的中点。

为什么重要

「AI 文本」不能再当一个标签用。用全生成数据训出来的检测器,拿去打「人写、模型改」的稿,风格特征会系统性失灵:编辑稿贴着原文,不贴着生成稿。学校查重、期刊筛稿、平台打标,如果训练数据全是纯生成,对润色、改写、扩写会漏。风格模型和神经编辑检测器吃的信号不一样,合在一起两边都补得上。这是测量学结论,不是新检测器刷榜。

局限与存疑

14 个特征是为了可解释和轻量,语义、论证结构、事实幻觉都不在里面。主实验八个开源模型,编辑只用三个约 70B 级开源模型,闭源生成只补了两个模型且规模更小。语料是英文长文,对话、多语、强专业写作能不能搬,没有证据。特征分析是相关不是因果:熵高不一定「因为是 AI」,也可能跟长度、领域、解码设置缠在一起。编辑提示来自 EditLens 那套,真实用户怎么改稿,分布可能完全不同。GPT-oss-120B 在生成和编辑两边都不跟其他模型走,说明「足迹」对模型家族已经开始裂。

术语

原文与代码

社区讨论

相关论文

全部论文解读