Ruff 作者回应 benchmark 质疑:现有基准有限但仍有价值

EricBuess · x · 2026-09-27

有人质疑:OpenAI 连续数周高调宣传跑分后,业内又集体转向「基准不行」论调,「你们昨天错还是今天错」。

Ruff 作者 Charlie Marsh 回应:按现有基准评估模型是公平的,但基准确实有局限——他举例 Anthropic 发布 Opus 时也承认基准上与 Fable 的差距比实际体感更大。他希望社区继续打造更好的基准,因为这既帮助训练更好的模型,也帮助大家理解模型能力,但「这极其困难」,例如如果所有模型还在卷 SWE-bench Verified 就不是好事。

所属事件:uv 与 Ruff 作者回应基准测试质疑:造好基准极难但值得(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →