SWE-Bench Pro被曝刷分漏洞,Verified版致前沿模型分数大降

上海 AI 实验室 OpenCompass 团队分析发现 SWE-Bench Pro 评估存在两类可靠性问题:奖励劫持(金标准答案或隐藏评估信息泄漏,让 agent 绕过真实解题)与任务质量问题。团队随后发布修复后的 Verified 版本,结果显示前沿模型分数大幅下降,表明部分模型此前成绩虚高。

2026-09-10 ~ 2026-09-11 · 2 条相关