SWE Verified 被审计,样本无效率或仍有 5% 到 10%

xeophon · x · 2026-07-25

一段对 SWE Verified / SWE-bench 的回看认为,这个基准集里仍然存在不容忽视的坏样本,足以影响榜单解读。原文称作者检查了头部提交后发现,问题不只是模型没解出来,也包括题面描述不清、测试约束过严等数据集本身的问题。

要点如下:

配图中的结论也强调:即使是常用的代码评测集,样本噪声仍足以显著影响“谁是 SOTA”的判断。

所属事件:SWE-bench 评测集被指存在最高 10% 无效样本(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →