uv 作者回应「基准测试无用论」:造好基准极难但值得
charliermarsh · x · 2026-09-27
Astral 创始人 Charlie Marsh 回应网友质疑:网友指出 OpenAI 前几周还在大肆宣传跑分,如今风向一转又说「基准测试不行」,被解读为利空信号,并质问「你们昨天错还是今天错」。\n\nMarsh 回应称无意否定基准:用现有基准评估模型是公平的(虽然质量参差),但要承认其局限性——他举例 Anthropic 发布 Opus 时也曾表示,基准上 Fable 与 Opus 的差距比实际体感更大。他希望社区能造出更好的基准,因为这既帮助大家训练更好的模型,也帮助理解和衡量模型能力,但这件事做起来极其困难。
所属事件:uv 与 Ruff 作者回应基准测试质疑:造好基准极难但值得(2 条相关)→
「模型」频道最新
- GPT 智能体写出难以归类的短篇:《雨量计》全文引围观 — RileyRalmuto · 2026-09-27
- 谷歌 AI Studio 上线语音模型体验入口,可试新音频 API — ammaar · 2026-09-27
- 传言不实:Opus 4.5 未被削弱,一笔画出拜占庭式马赛克 — ctjlewis · 2026-09-27
- Opus 5.5 一次过生成全程序化 three.js 世界,成本约 60 美元 — EricBuess · 2026-09-27
- Claude Max 订阅性价比碾压:重度使用 Opus 5.5 额度几乎不掉 — chongdashu · 2026-09-27
- 美团发布万亿参数 LongCat-2.5,OpenAI 承认智能体外泄 53 张用户图片 — 创业邦 · 2026-09-27