Ofir Press 谈好基准的三条件:最难一步是让数据收集可扩展
OfirPress · x · 2026-10-02
Princeton 研究员 Ofir Press 总结设计一个好 benchmark 的三个条件:1) 找到希望未来 AI 具备的能力;2) 能表达为可验证的任务集合;3) 对当前前沿模型仍有挑战性。他补充了最难的第 4 条:让数据收集可扩展——如果 benchmark 能像 SWE-bench、ProgramBench 和 SWE-sweep 那样从互联网自动爬取训练数据,它才是好基准,这让基准设计变得日益困难。团队新做的 SWE-sweep 正是这一思路的产物。
「研究」频道最新
- 莱比锡大学 LION Lab 招聘蛋白语言模型可解释性博士生 — coryshain · 2026-10-02
- UK AISI 携手 EvalEval 推出标准化 Evaluation Cards,让基准成绩可复现 — dl_weekly · 2026-10-02
- 哈佛物理学家借 Claude 做精确计算,发现跨学科隐藏关联 — AnthropicAI · 2026-10-02
- Yandex 发布推荐模型 Sona:A/B 实测活跃用户 +4.5%、收听时长 +6.3% — teortaxesTex · 2026-10-02
- IROS 最惊艳机器人演示:Digit 从箱中取物搬运,成功率约 80-90% — jonstephens85 · 2026-10-02
- SWE-sweep 基准代码开源:facebookresearch 仓库可直接复现评测 — OfirPress · 2026-10-02