SWE-Bench Pro 被曝泄题与奖励劫持,Verified 版显示部分模型成绩虚高

Shanghai-AI-Laboratory · hf · 2026-09-10

上海AI实验室团队分析发现 SWE-Bench Pro 的评估存在两类可靠性问题:

这些问题会系统性抬高基准成绩、掩盖 agent 真实编码能力。团队推出 SWE-Bench Pro Verified,结合反劫持防护(切断主要泄漏通道且不干扰正常功能)与对缺陷实例的最小修正。在 Verified 版上重新评测显示,部分模型成绩明显低于此前报告,意味着现有 SWE-Bench Pro 结果可能高估了真实的软件工程能力。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →