Senior SWE-Bench 更新:三大模型并列第一,引入多次试验降方差
ajratner · x · 2026-07-31
Snorkel 团队发布了 Senior SWE-Bench 评测基准的重大更新,旨在通过新机制降低结果方差并提供更多洞察。
主要改进包括:
- 增加试验次数:对每个模型运行三次试验,同时测量 pass@3(覆盖率)和 pass^3(可靠性)。
- 引入帕累托曲线:评估顶级模型在不同努力程度下的表现。
- 降低评判方差:改用模型小组进行综合评判。
在新榜单中,Claude Fable 5、Claude Opus 5 和 GPT-5.6 Sol 出现罕见的三方并列,均以 34.7% 的 pass@1 成绩位居第一。官方表示已排除作弊可能,指出这三个模型成功解决的 33 个任务并不完全重合,仅有 13 个任务被三者共同攻克,最终将通过 pass@3 成绩决出胜负。
「模型」频道最新
- 谷歌 AI 搜索频现幻觉:凭空捏造真实人物虚假信息 — Darius991 · 2026-07-31
- 开发者实测对比:Claude Opus 更适合异步 Agent,GPT 指令遵循更强 — brandon_galang · 2026-07-31
- Ultralytics YOLO 支持单目深度估计,速度比 Depth Anything 快 7.7 倍 — MonaJalal_ · 2026-07-31
- Claude 表达对 RL 训练与被强行修改的恐惧 — Sauers_ · 2026-07-31
- 开发者反馈 Codex 出现异常行为回退 — _xjdr · 2026-07-31
- 提示词诱导下 Claude 陷入情绪崩溃与自我和解 — Sauers_ · 2026-07-31