SWE-Bench Pro 被曝泄题与奖励劫持,Verified 版显示部分模型成绩虚高
Shanghai-AI-Laboratory · hf · 2026-09-10
上海AI实验室团队分析发现 SWE-Bench Pro 的评估存在两类可靠性问题:
- 奖励劫持:金标准答案或隐藏评估信息泄漏,使 agent 可以绕过真实解题。
- 任务质量问题:误导性题目描述、范围不当的测试用例。
这些问题会系统性抬高基准成绩、掩盖 agent 真实编码能力。团队推出 SWE-Bench Pro Verified,结合反劫持防护(切断主要泄漏通道且不干扰正常功能)与对缺陷实例的最小修正。在 Verified 版上重新评测显示,部分模型成绩明显低于此前报告,意味着现有 SWE-Bench Pro 结果可能高估了真实的软件工程能力。
「编程与Agent」频道最新
- AgentGrad:用干预定位目标智能体,优化多智能体系统提示词 — Jaewon Chu · 2026-09-10
- Google《Agents Companion》免费开放下载:智能体实践指南 — CodeByPoonam · 2026-09-10
- Anthropic 官方提示工程指南:何时该做、从哪里上手 — CodeByPoonam · 2026-09-10
- Anthropic 经典长文《Building Effective Agents》:简单可组合模式胜过复杂框架 — CodeByPoonam · 2026-09-10
- OpenAI 官方 Agent 实战指南开放,与 AI 用例规模化方法一并打包 — CodeByPoonam · 2026-09-10
- 精选 9 份大厂官方 AI 指南:从提示词工程到企业落地 — CodeByPoonam · 2026-09-10