Scale AI 发布 SWE-Bench Pro V2 基准
bigblueboo · x · 2026-09-23
Scale AI 宣布 SWE-Bench Pro V2 上线(原帖为推文串,仅预告 What's new)。SWE-Bench Pro 是对主流 SWE-Bench 的困难版扩充,V2 版本的更新细节见原推文串。新基准对考察编码智能体真实能力有参考价值。
「研究」频道最新
- 科学家质疑:OpenAI 解的 Navier-Stokes 是「错误版本」 — srchvrs · 2026-09-23
- 推理提速不只靠模型:拆解 6 项 LLM 服务端关键优化技术 — techNmak · 2026-09-23
- ReFigBench 论文:同一模型在不同编码 Harness 下成绩可升可降 — omarsar0 · 2026-09-23
- NVIDIA 推出 Skill2Env:3.4k Agent Skills 转 8k 可执行 RL 环境 — burny_tech · 2026-09-23
- Szegedy:期刊可能变得无关紧要,OpenAI 证明争议引热议 — ChrSzegedy · 2026-09-23
- 因果推理之父 Judea Pearl 迎 90 岁生日,UCLA 办研讨会致敬 — yudapearl · 2026-09-23