三小时复现ACL文风实验,前沿模型合上71%缺口并翻检测器

Beating the Style Detector: Three Hours of Agentic Research on the AI-Text Arms Race

Andreas Maier, Moritz Zaiss, Siming Bayer

cs.CL, cs.LG

2026-05-04

用开源数据和agent套件三小时复现ACL 2026文风实验全部7条假设。GPT-5.5与Opus 4.7合上71–75%作者风格缺口,对冻结SVM 20轮改写可把5条里2条翻到人类半空间。

这篇在解决什么

ACL 2026 的 Baumler 等人问过一个很具体的问题:人把 o4-mini 草稿改到「像自己」,风格能挪多远。81 人、486 条任务观测,风格用 Reddit 上训出来的作者嵌入 LUAR-MUD 的余弦相似度来量。结论是人改完有一小步,残差缺口很大。数据(81 份 JSON)公开了,分析代码没有。这篇是 Track 2 复现伴侣:用现成的 agent 研究套件把统计管线重写一遍,再加三组新实验。人只做审稿人,方法级拍板由套件落成代码并重跑。墙上时间大约三小时,不是几周。

要回答的已经不是「人改 LLM 草稿有没有用」,而是前沿模型拿一条真人样例从零写,能不能把个人文风缺口合上,以及合上之后还能不能被检测器抓住。

方法

复现侧把 81 份日志整理成长表,LUAR-MUD 钉在 revision 9204529,嵌入缓存成 .npz,后面全是 CPU。组比较用双侧配对置换检验(10,000 次置换,最小可报 p 约 10^{-4}),效应量是带小样本校正的 Hedges' g,多重比较走 BH-FDR、q=0.05。感知相似度与 LUAR 自相似的相关用 repeated-measures correlation。

新实验把每个被试的两条无人帮助对照文拆开:taskidx 较小的那条给生成器当 demo,另一条当 held-out 评价靶,谁都看不见。o4-mini 草稿、人的 post-edit、GPT-5.5 mimic、Claude Opus 4.7 mimic 四条路打同一把尺。第一次迭代把两条对照都给了模型、再对两条的质心打分,等于把答案放进上下文;严格协议下「LLM mimic 对人 post-edit」的 g 从 +1.18 收到 +1.02。正文只报 held-out v1。

检测实验把同一批 512 维嵌入交给线性 SVM,做 leave-authors-out 的 5 折 GroupKFold:每个作者只出现在训练或测试的一侧。人类类是 81 人×2 条对照(162),AI 类是该路径的 324 条输出。六个诊断分别查作者泄漏、打乱标签、长度单特征、跨模型迁移、降维和强正则。对抗段冻结 fold-1 的 Opus 检测器(64 个训练作者),在 17 个 held-out 作者里挑 5 条最像 AI 的 Opus 稿,让 Opus 4.7 子 agent 看检测器的 signed margin,改写 T=20 轮,内容与 100–200 词约束保留。

结果

七条预注册假设方向全部复现,BH-FDR 全过。H3 的 rmcorr 复现到三位小数:r=+0.244,p=3.6×10^{-9},n=648,原文是 +0.244±0.076。涉及「与其他被试平均相似度」的四条,效应量幅度有偏移,因为原文没写清先按 pairwise 还是先按人平均;这里用按人平均,H1a、H2a、H2c 的幅度对得上。

324 条配对任务上,held-out LUAR 余弦均值:o4-mini 0.498,人 post-edit 0.546,Opus 0.643,GPT-5.5 0.649。同一作者两条对照文的均值 0.701 是天花板。相对这条尺,人合上约 24% 的缺口,两个前沿模型合上 71–75%。Friedman χ²(3,n=324)=419.3,p=1.5×10^{-90}。六对里五对过 FDR;Opus 对 GPT-5.5 打平(g=−0.08,p=0.14)。相对人的逐任务胜率:o4-mini 18.5%(37/324,另 46 平),Opus 76.9%(249/324),GPT-5.5 79.0%(256/324)。感谢信、悼词、婚礼誓词等八个场景排序不变。

路径held-out 均值对人胜率检测 AUC
o4-mini 草稿0.49818.5%0.999
人 post-edit0.5460.971
Opus 4.7 mimic0.64376.9%0.952
GPT-5.5 mimic0.64979.0%0.931

检测 AUC 从 0.999 单落到 0.931,相邻行的 bootstrap CI 不相交。长度单特征就把 GPT-5.5 做到 0.880,Opus 只有 0.517:GPT-5.5 的可检测性大半是长度,Opus 才是风格。跨模型迁移仍有 0.913 / 0.888,前沿模型有一层共用签名。对抗段平均 margin 从 +3.13 降到 −0.16;5 条里 2 条翻进人类半空间并站住,第三条离边界 0.04,没有一条在 AI 侧走平。

为什么重要

开了数据没开代码的 NLP 实验,现在可以用 agent 套件在三小时内补齐可复现管线,并顺手加泄漏控制和检测闭环。对做 AI 文本检测的人,这篇给出一个不对称的快照:平均风格已经很近,分布形状还够线性 SVM 抓;抓到的东西因模型而异,GPT-5.5 几乎是长度,Opus 是风格。给模型看冻结检测器的分数、让它改 20 轮,已经能把 5 条里 2 条翻面。已知检测器、中等算力,前沿模型已经能有效压低自己的 AI 检出概率。648 条 mimic、训练好的检测器和对抗轨迹都公开了。

局限与存疑

生成和打分都是模型对模型,LUAR 虽把原文 r=0.244 复现到三位,仍缺一个独立的第三人生成器。人拿到的是未调风格的 o4-mini 草稿再改,LLM mimic 看到样例从零写,比的是工作流,不是「人会不会写」。LUAR 量的是像不像某个作者,不向量不向量、事实对不对、本人会不会认这笔账;原文 §6.3 已经写过感知真实和 LUAR 会分家。每作者只有一条 demo,没法比示范集大小。线性 SVM 是可检测性的下界,20 轮对抗是当前 agent 能抹掉多少的上界,绝对 AUC 是 2026 年春的快照。一条 Opus 稿与 demo 的词汇重叠 0.56,对均值影响小于 0.001,正文披露但没剔除。

术语

原文与代码

社区讨论

相关论文

全部论文解读