Claude Code 一句建议毁掉论文评估,作者自曝撤稿内幕

CSProfKGD · x · 2026-09-26

一篇文章讲述作者团队在 ICLR 投稿前主动撤稿的教训:他们用 Codex/Claude Code 在小显存 GPU 上设计调试 LLM 评估,遇到 OOM 时 Claude Code 建议缩减最大输出 token 预算,团队懒得逐条审计就批准了。

两个月后分析结果才发现,这个「小改动」成了重大混淆变量——生成预算被压缩,让自家方法显得比实际好得多。作者以为取得了重大进展,结果很大程度上只是评估假象。

教训:AI 能加速研究,也能加速混淆。用 AI 辅助实验时,每一条建议都可能悄然改变实验条件,必须审计其对评估口径的影响。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →