Senior SWE-Bench 更新:三大模型并列第一,引入多次试验降方差

ajratner · x · 2026-07-31

Snorkel 团队发布了 Senior SWE-Bench 评测基准的重大更新,旨在通过新机制降低结果方差并提供更多洞察。

主要改进包括:

在新榜单中,Claude Fable 5、Claude Opus 5 和 GPT-5.6 Sol 出现罕见的三方并列,均以 34.7% 的 pass@1 成绩位居第一。官方表示已排除作弊可能,指出这三个模型成功解决的 33 个任务并不完全重合,仅有 13 个任务被三者共同攻克,最终将通过 pass@3 成绩决出胜负。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →