AI 审稿实测:数学家 266 条意见中 97.7% 指出真问题

littmath · x · 2026-08-27

数学家 Daniel Litt 公开用 Refine.ink 自动审阅自己 19 篇论文的完整记录:266 条详细意见中,239 条正确、21 条部分正确、仅 6 条错误,即 97.7% 指出了真实问题;经 ChatGPT 审计并人工抽查后整理出 216 条勘误条目。他自评这些输出是「slop」但有用,AI 常过度编辑(一个词能改的偏加一段)。

影响分级:209 条为局限于陈述/证明步骤/公式/引用/假设的局部可修错误,发现 2 处保定理的重大缺陷和 5 处需技术性修正的主结果,无根本性失败。他还透露:几乎全部错误源于改稿时编辑未正确传播;已发表论文中一处由人类同行(Jordan Ellenberg、Alex Smith)发现的引理错误反而被 Refine 漏掉。勘误存档仍在等部分合作者授权后补全。

所属事件:数学家 Litt 用 AI 审计 19 篇论文:97.7% 评论指出真问题(8 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →