用 Codex 调试评测踩坑:一次「小改」险些让论文带错结论投稿
najoungkim · x · 2026-09-26
NeurIPS 论文被接收的祝贺帖里,作者 hjy836 分享一次惊险经历:他们撤回了一篇 ICLR 投稿,因为在投稿前发现了一个严重的评测错误。团队用 Codex/Claude Code 在小显存 GPU 上设计和调试 LLM 评测,遇到 OOM 时 Claude Code 给出多个修复建议,其中包括降低最大输出 token 预算——因疲于逐一审计,他们直接批准了。两个月后分析结果才发现,这个「小改动」大幅改变了评测结果:被压缩的生成长度成了主要混杂变量,让自己方法显得比实际好得多。被转发的推文还引用了同组论文 RExBench(arXiv:2506.22598),该基准用 12 篇论文的真实研究扩展任务评测编码 agent,发现最佳 agent 自主完成率仅约 33%,加人工提示也低于 44%,说明当前 agent 尚不能自主完成研究扩展实现。
所属事件:Claude Code 建议致评测出错,团队投稿前惊险撤稿(2 条相关)→
「编程与Agent」频道最新
- Claude 订阅省额度玩法:Opus 当编排器,廉价模型跑子任务 — EXM7777 · 2026-09-26
- Agent 开发标准全景:MCP、A2A、ACP 各管一段,可独立采用 — bibryam · 2026-09-26
- FIU 大学举办 Codex 工作坊,学生现场实操一小时上手开发 — paw_lean · 2026-09-26
- llama.cpp 分支实现无损 prompt 去重,重场景省下数万 token — Odd_Cauliflower_8004 · 2026-09-26
- FlexViz 用 Polars 与 Rust 让 1 亿行数据交互可视化不掉帧 — JeremyCMorgan · 2026-09-26
- 用 Claude Code 一小时给妻子做了个排班 App:杀手级应用是为彼此做的小应用 — alfred_lua · 2026-09-26