OpenCompass 发布 SWE-Bench Pro Verified:修复刷分问题后前沿模型分数大降
_akhaliq · x · 2026-09-11
OpenCompass 发布了 SWE-Bench Pro 的 verified 版本,修复了原版存在的 reward hacking 和任务质量问题。
修复后的结果显示,前沿模型的真实得分远低于此前报告的水平——意味着 agent 编码能力榜单此前存在系统性虚高。
所属事件:SWE-Bench Pro被曝刷分漏洞,Verified版致前沿模型分数大降(2 条相关)→
「模型」频道最新
- DeepSeek V4 训练细节曝光:RL 训练超 10T token,上下文冲到 1M — stochasticchasm · 2026-09-11
- 曝 DeepSeek V4.1 Flash 配 196B 参数查询表 Engram,查表代替计算 — cephaloform · 2026-09-11
- 观察:v4 训练无失稳,1M 上下文撑约 10T token 训练量 — stochasticchasm · 2026-09-11
- Neel Nanda 复现 Astra 系统卡:无思维链推理能力暴涨 1.75 倍 — NeelNanda5 · 2026-09-11
- Artificial Analysis 没被收买:自费 1.3 万美元实测各家模型 — Antblue · 2026-09-11
- 调惯 Claude 检查点的老玩家:回用 Opus 3 才算「回魂」 — repligate · 2026-09-11