OpenAI 指出 SWE-Bench Pro 编码评测存在缺陷
OpenAI News · rss · 2026-07-08
OpenAI 发布了一项新分析,指出当前流行的 AI 编码基准测试 SWE-Bench Pro 存在可靠性与准确性问题。
该分析揭示了在利用此类基准测试评估 AI 模型编码能力时,可能会混入干扰信号,从而影响评估结果的有效性。这引发了业界对于如何更科学、准确地衡量 AI 模型真实编程能力的反思。
「研究」频道最新
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11