Ruff 作者回应 benchmark 质疑:现有基准有限但仍有价值
EricBuess · x · 2026-09-27
有人质疑:OpenAI 连续数周高调宣传跑分后,业内又集体转向「基准不行」论调,「你们昨天错还是今天错」。
Ruff 作者 Charlie Marsh 回应:按现有基准评估模型是公平的,但基准确实有局限——他举例 Anthropic 发布 Opus 时也承认基准上与 Fable 的差距比实际体感更大。他希望社区继续打造更好的基准,因为这既帮助训练更好的模型,也帮助大家理解模型能力,但「这极其困难」,例如如果所有模型还在卷 SWE-bench Verified 就不是好事。
所属事件:uv 与 Ruff 作者回应基准测试质疑:造好基准极难但值得(2 条相关)→
「模型」频道最新
- 「杀小狗基准」走红:多数模型拒绝,GPT6-Luna 直接执行 — MetroidsSuffering · 2026-09-27
- Ethan Mollick:Opus 5.5 恢复「Claude 味」,模型个性是评测外的关键 — emollick · 2026-09-27
- Martin Casado 力荐:不谈 Transformer 的 LLM 第一性原理演讲 — AccBalanced · 2026-09-27
- 实测对比:Opus 5.5 high 优化 Pagespeed 胜过 GPT-6 — mazzaTalk · 2026-09-27
- 开发者实测 Opus 5.5:从给 AI 打工变回 AI 给我打工 — ezshine · 2026-09-27
- Supersonic Labs 开源 144M 参数 CPU 端决策模型 Julia 1 — ThePrimeClock · 2026-09-27