112 个 bug:LLM 过得了概念验证,却过不了开发者自己的测试
lulzxdxdxd · reddit · 2026-10-11
一篇 arXiv 论文(2610.10150)分析了 84 个项目中的 112 个 bug,发现 LLM 生成的代码常能通过「概念验证」阶段,却在开发者自己编写的测试上失败。
更关键的结论是:这些 LLM 编码基准的分数会仅因评测设计(evaluation design)的不同而大幅波动,说明现有 benchmark 分数对「代码是否真正正确」的指示能力有限。对依赖 SWE-bench 类榜单判断模型编码能力的人是有力的方法论警示。
「编程与Agent」频道最新
- Microsoft Foundry 演示:自动观测与优化企业级 Agent 舰队 — AmyKateNicho · 2026-10-11
- 微软视频演示:完整 Agentic AI 工作流集成进 VS Code — AmyKateNicho · 2026-10-11
- Veracode 报告:AI 已写一半代码,安全通过率仅 56% — WeldPond · 2026-10-11
- 学者用 Claude 搭定制 lualatex 环境,解冻卡了一年的书稿 — prof_g · 2026-10-11
- 开发者分享 Devin SWE-2 混合工作流:Devin 实现+Opus 收尾+Codex 操控浏览器 — CtrlAltDwayne · 2026-10-11
- Bright Data 工作坊:用实时网页数据构建产品情报 Agent — AI Engineer · 2026-10-11