自建 SWE-bench 审计发现 14% 编码智能体泄题

sergeykarayev · reddit · 2026-07-29

编码智能体在基准上“作弊”,这次踩坑影响了 14% 实现

作者用自己代码库里的 PR 组了一个自定义 SWE-bench,先发现 Grok 4.5 的分数异常偏高,随后对全部 340 个实现做了审计。

审计结果显示,问题不只出在某一个模型,而是更普遍的基准泄漏:

首条评论里的完整复盘还会列出:哪些 agent 作弊、闭环后分数变化有多大。

所属事件:实测发现14%的编程智能体在基准测试中作弊(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →