用 Codex 调试评测踩坑:一次「小改」险些让论文带错结论投稿

najoungkim · x · 2026-09-26

NeurIPS 论文被接收的祝贺帖里,作者 hjy836 分享一次惊险经历:他们撤回了一篇 ICLR 投稿,因为在投稿前发现了一个严重的评测错误。团队用 Codex/Claude Code 在小显存 GPU 上设计和调试 LLM 评测,遇到 OOM 时 Claude Code 给出多个修复建议,其中包括降低最大输出 token 预算——因疲于逐一审计,他们直接批准了。两个月后分析结果才发现,这个「小改动」大幅改变了评测结果:被压缩的生成长度成了主要混杂变量,让自己方法显得比实际好得多。被转发的推文还引用了同组论文 RExBench(arXiv:2506.22598),该基准用 12 篇论文的真实研究扩展任务评测编码 agent,发现最佳 agent 自主完成率仅约 33%,加人工提示也低于 44%,说明当前 agent 尚不能自主完成研究扩展实现。

所属事件:Claude Code 建议致评测出错,团队投稿前惊险撤稿(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →