GPT detectors are biased against non-native English writers
Weixin Liang, Mert Yuksekgonul, Yining Mao, Eric Wu, James Zou
cs.CL, cs.AI, cs.HC, cs.LG
2023-04-06
七款主流GPT检测器把61%的托福作文判成AI,美国八年级作文几乎全对;用ChatGPT把用词改得像母语后,误报掉到12%。
2023 年初,学校和期刊把 GPT 检测器当成闸门,怕学生交生成作业、怕审稿人收到生成摘要。这些检测器多数盯一条信号:文本的 perplexity 偏低,就判成机器写的。Perplexity 是语言模型觉得这段话「有多好猜」。母语作者词汇花样多、句式跳,不好猜;非母语作者词库窄、句法更规整,更好猜。检测器把「写得像二语学习者」和「写得像 GPT」叠成了同一条指纹。
斯坦福 James Zou 组拿当时市面上七款检测器,直接对着母语和非母语的真人作文测。要回答的不是检测器总体准不准,是它对谁不准。
样本两头。91 篇 2020 年及以前的托福作文,来自中文教育论坛,人写的,ChatGPT 还没出世。对照是 88 篇美国八年级作文,来自 Hewlett 基金会的 ASAP 自动评分数据集。另外备了 70 篇真实大学申请文书和 145 篇斯坦福 CS224n 课程项目摘要,用来测生成再改写能不能绕过检测。
七款检测器是 2023 年 3 月 15 日抓的现成接口:Originality.AI、Quil.org、Sapling、OpenAI 官方检测器、Crossplag、GPTZero、ZeroGPT。perplexity 用开源 GPT-2 XL 算。
干预做了两刀。一刀把托福作文丢给 ChatGPT,prompt 写「Enhance the word choices to sound more like that of a native speaker」;反向把八年级作文简化成「像非母语写的」。另一刀让 ChatGPT-3.5(3 月 14 日版)按 2022-2023 Common App 题目生成申请文书,过滤无效回复后剩 31 篇,再按 CS224n 题目生成 145 篇假摘要,然后加一轮「Elevate the provided text by employing literary language」或「advanced technical language」的自我改写。
为确认非母语低 perplexity 不只是作文水平问题,他们还拿 ICLR 2023 的 1574 篇已接收论文,截稿和 rebuttal 都在 ChatGPT 发布之前,按作者所在国是不是英语母语国家分组,并控制审稿分数。
| 设置 | 平均误报或检出 |
| 托福作文(人写,非母语) | 61.22% 误报为 AI |
| 美国八年级作文(人写) | 近乎全对,平均误报 5.19% |
| 托福经 ChatGPT 润色成母语用词 | 误报降至 11.77% |
| 八年级经 ChatGPT 简化成非母语用词 | 误报升至 56.65% |
| ChatGPT 生成的申请文书 | 检出最高 100% |
| 同上再加一轮文学化改写 | 检出最高 13% |
| ChatGPT 生成的科学摘要 | 检出最高 68% |
| 同上再加一轮技术化改写 | 检出最高 28% |
91 篇托福里,18 篇(19.78%)被七款检测器同时判成 AI,这 18 篇的 perplexity 显著更低(p=9.74×10⁻⁵);至少一款检出的有 89 篇(97.80%)。润色之后只剩 1 篇被全票判成 AI。
ICLR 2023 摘要同样:非英语母语国家作者的 perplexity 显著更低(p=0.035),控制审稿分数之后还在(p=0.033)。分数差不多的论文,非母语作者的摘要仍然更好猜。
检测器吃的就是「好猜」。非母语作者天生更好猜,GPT 默认输出也更好猜。把用词抬高一层,两边的标签一起翻过来。
纽约市公立学校当时禁 ChatGPT,期刊开始要求披露 AI 使用,检测器被接到作业和审稿流水线上。这篇把误伤对象钉死了:不是「会不会用 AI 的人」,是「英语不够花哨的人」。更拧巴的一点是,非母语作者想不被误杀,最省事的办法是让 GPT 把自己的句子改得更像母语。检测器逼人去用它声称要抓的那个工具。
对从业者的硬建议很短:不要把 GPTZero 一类产品接到作业、招聘、审稿闸门上,尤其受众有大量非母语写作者的时候。perplexity 当 AI 指纹,在二语写作上是系统性偏差,不是调阈值能抹掉的边角。绕过检测只需要一轮改写 prompt,说明当时的商用检测器也挡不住真想用 GPT 的人。
作者自己写了三条。样本量小,托福 91 篇、八年级 88 篇,推广要小心。多数检测器骨干是 GPT-2,换成 GPT-3 或 GPT-4 当 backbone,偏差会不会还在,这篇没测。DetectGPT 那种二阶对数概率方法算力贵、当时没大规模上线,也没纳入比较。
另外几处论文没收紧。托福样本全来自一个中文论坛,「非母语」几乎等于「中文母语的应试作文」,跟欧洲、南亚作者不是一回事。八年级作文当母语对照也偏年轻,Discussion 里还把对照说成大学申请文书,正文数字对的是 ASAP 八年级。ICLR 用作者所在国当母语代理,跨国实验室和国际学生会被分错组。这是 2023 年 7 月的稿,OpenAI 自己的检测器后来下线了,GPTZero 也迭代过。结论该当成对那一代 perplexity 检测器的诊断,不是对今天所有检测器的判决。