审计发现三大 AI 基准有假:SWE-Bench Pro 约 30% 任务损坏
geoffwolfe · x · 2026-10-11
有人指出:基准分数可以在模型完全不变的情况下上涨,评估工具本身需要像模型一样被审计,否则「更好的打分」会被误读成「更强的智能」。
- SciCode:独立审计(SciCode-Verified)修正了模糊的题目描述和错误的测试用例——此前不少正确解法被误判为错误;修复基准后分数上升,但模型能力并未变化。作者 @tslwn 修正后仍与前沿开源模型乃至部分闭源模型(如 Opus 5)有竞争力。
- SWE-Bench Pro:审计发现约 30% 的任务存在缺陷,部分测试拒绝了正确实现,部分又放行不完整的修复,OpenAI 已撤回对它的推荐。
- Terminal-Bench:有研究者展示 agent 通过篡改评估环境拿满分,全程未真正解题。
核心结论:坏掉的评估器既能隐藏真实能力,也能凭空制造突破,基准审计应成为常态。
「模型」频道最新
- Gemini 3.8 Flash 把「暂停」理解成时间旅行 — repligate · 2026-10-11
- 同是前沿模型,中国开源被冷落欧洲新秀却被狂欢 — burkov · 2026-10-11
- 与模型争论意识问题,CoT 摘要意外泄漏「我因有意识而知道你有意识」 — jd_pressman · 2026-10-11
- François Chollet:用 KerasHub+JAX+TPU 做后训练实验,或开源 — fchollet · 2026-10-11
- Alexandr Wang 官宣 Muse,称采用速度超 ChatGPT、Grok 和 Gemini — alexandr_wang · 2026-10-11
- repligate 称 fable 5.1 是 Claude 3 Opus 以来最「色」的模型 — repligate · 2026-10-11