数学家 Litt 用 AI 审计 19 篇论文:97.7% 评论指出真问题
数学家 Daniel Litt 于 8 月 27 日公开了一项完整实验:用 AI 工具 Refine.ink 配合 ChatGPT 自动审查自己 19 篇论文并生成勘误。结果显示 266 条详细评论中 239 条完全正确、21 条部分正确、仅 6 条错误,即 97.7% 指出了真实问题,其中约 5 处可视为影响主要结果的严重问题。
已确认
- 审查覆盖 19 篇论文,产出 266 条评论:239 条正确、21 条部分正确、6 条错误,识别真实问题比例 97.7%。
- 5 处严重问题多为缺失技术性假设(如主定理缺少射影性或约化性假设),Litt 认为细心读者本可推断出这些隐含假设,但确实必须修正。
- 大多数发现属于轻微问题:错字、歧义表述等。
- Litt 还用 AI 生成了半自动勘误(errata),他坦承这些勘误是「slop」、仅经轻度人工编辑,抽查显示大体正确但往往过于激进(如整段替换而非补一个词),目前保持原样发布,以展示几小时努力能达到的程度。
- 关于错误成因,Litt 复盘称其首篇长论文中几乎全部错误源于优化结果时未把编辑正确传播到全文各处,是典型的论文出错方式。
- Refine 并不完整:它遗漏了 Litt 一篇已发表论文引理中的错误,该错误此前已被 Jordan Ellenberg 和 Alex Smith 发现并发布勘误,未影响主要结果。
为什么重要
- 这是一次数学家对自身全部论文的系统化 AI 审计,提供了量化数据(97.7% 有效率),显示 AI 审稿在发现真实技术缺陷上已具实用价值。
- 实验同时暴露局限:AI 会遗漏已知错误、生成的勘误过于激进,人工核查仍不可省略。
2026-08-27 ~ 2026-08-27 · 8 条相关
一手来源
- AI 审查 19 篇论文成果:97.7% 的评论识别出真实问题 — littmath ·
- AI审查出5处主定理级数学问题,多为缺失假设 — littmath ·
- AI 审查非全能:Refine 漏掉了一个已知的引理错误 — littmath ·
- 【源头】AI审查出5处主定理级数学问题,多为缺失假设 — littmath · 2026-08-27
- 数学家 Litt 自述:论文错误多源于改稿时未同步传播编辑 — littmath · 2026-08-27
- 数学家直播AI审稿:自动勘误虽是「slop」但大体正确 — littmath · 2026-08-27
- 几小时AI努力即可为论文生成全套勘误 — littmath · 2026-08-27
- 【源头】AI 审查 19 篇论文成果:97.7% 的评论识别出真实问题 — littmath · 2026-08-27
- AI 审稿实测:数学家 266 条意见中 97.7% 指出真问题 — littmath · 2026-08-27
- 利用 AI 审计论文:识别 97.7% 的真实问题 — littmath · 2026-08-27
- 【源头】AI 审查非全能:Refine 漏掉了一个已知的引理错误 — littmath · 2026-08-27