112 个 bug:LLM 过得了概念验证,却过不了开发者自己的测试

lulzxdxdxd · reddit · 2026-10-11

一篇 arXiv 论文(2610.10150)分析了 84 个项目中的 112 个 bug,发现 LLM 生成的代码常能通过「概念验证」阶段,却在开发者自己编写的测试上失败。

更关键的结论是:这些 LLM 编码基准的分数会仅因评测设计(evaluation design)的不同而大幅波动,说明现有 benchmark 分数对「代码是否真正正确」的指示能力有限。对依赖 SWE-bench 类榜单判断模型编码能力的人是有力的方法论警示。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →