AI 审稿实测:数学家 266 条意见中 97.7% 指出真问题
littmath · x · 2026-08-27
数学家 Daniel Litt 公开用 Refine.ink 自动审阅自己 19 篇论文的完整记录:266 条详细意见中,239 条正确、21 条部分正确、仅 6 条错误,即 97.7% 指出了真实问题;经 ChatGPT 审计并人工抽查后整理出 216 条勘误条目。他自评这些输出是「slop」但有用,AI 常过度编辑(一个词能改的偏加一段)。
影响分级:209 条为局限于陈述/证明步骤/公式/引用/假设的局部可修错误,发现 2 处保定理的重大缺陷和 5 处需技术性修正的主结果,无根本性失败。他还透露:几乎全部错误源于改稿时编辑未正确传播;已发表论文中一处由人类同行(Jordan Ellenberg、Alex Smith)发现的引理错误反而被 Refine 漏掉。勘误存档仍在等部分合作者授权后补全。
所属事件:数学家 Litt 用 AI 审计 19 篇论文:97.7% 评论指出真问题(8 条相关)→
「研究」频道最新
- GLM-5.3-Flash 发布:百万上下文,评测分大涨 — qinzytech · 2026-08-27
- RMSNorm 能否打开神经网络黑箱?专家激辩 — CFGeek · 2026-08-27
- 推荐阅读:Poggio 思维机器与 Welling 随机热力学 — neurovium · 2026-08-27
- 范畴论大师谈AI:未改变数学本质,但扩展已知边界 — begusgasper · 2026-08-27
- 167 万患者数据训练,Tempus 癌症多模态模型生存预测 AUC 跃升 — neuroecology · 2026-08-27
- Goodfire 公布新研究:高效定位导致模型分叉的关键 Token — VoidAsuka · 2026-08-27