三小时 agent 复现研究:前沿模型可高效摆脱 AI 检测
maier_ak · x · 2026-08-26
arXiv 新论文《Beating the Style Detector》用现代 agentic-research 框架,在人类仅作为 reviewer-in-the-loop 的情况下重做了一篇 ACL 2026 个人风格后编辑研究的全部实验并新增三个,复现了全部 7 个预注册假设,核心相关系数精确到小数点后三位(r=+0.244,p<10⁻⁸,n=648)。
主要发现:
- 在无泄漏 held-out 协议下,GPT-5.5 与 Claude Opus 4.7 在 324 个配对任务中弥合了 71–75% 的风格差距(人类后编辑仅 24%),约 80% 任务上超过人类后编辑。
- 将数据重构为 AI 文本检测军备竞赛:基于 LUAR-MUD 嵌入的留作者线性 SVM 达 AUC 0.93–1.00;诊断显示 GPT-5.5 的可检测性主要是长度混淆,而 Opus 存在真实风格签名。
- 给定 20 次针对冻结检测器的反馈迭代,Opus agent 将 5 个 held-out 模仿中的 2 个翻转到人类半空间,所有 margin 缩小一个数量级——前沿 LLM 已能高效降低自身被检测出的概率。
「研究」频道最新
- Skild AI 发布机器人基础模型 S1:单个视频教会 10 分钟新任务 — deepakpathak · 2026-08-26
- 新训练法:可组合课程与难度池优化数据采样 — samsja19 · 2026-08-26
- UAI2026 公布三位主题演讲嘉宾,聚焦因果学习 — LesterMackey · 2026-08-26
- 30 问吃透 Embeddings 与向量检索:从对比训练到 HNSW 与评测 — techNmak · 2026-08-26
- UBio-MolFM发布:量子精度模拟百万原子体系 — 量子位 · 2026-08-26
- Deepak Pathak 展示机器人上下文学习:单视频提示处理长程任务 — deepakpathak · 2026-08-26