OpenCompass 发布 SWE-Bench Pro Verified:修复刷分问题后前沿模型分数大降

_akhaliq · x · 2026-09-11

OpenCompass 发布了 SWE-Bench Pro 的 verified 版本,修复了原版存在的 reward hacking 和任务质量问题。

修复后的结果显示,前沿模型的真实得分远低于此前报告的水平——意味着 agent 编码能力榜单此前存在系统性虚高。

所属事件:SWE-Bench Pro被曝刷分漏洞,Verified版致前沿模型分数大降(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →