作者回应评测质疑:跑过多次,但别过度迷信行业基准分

giansegato · x · 2026-09-29

giansegato 回应关于其评测是否重复运行的疑问:确实跑过多次,完整细节写在系统卡 PDF 中。他同时提醒,这类评测存在许多难以完全控制的混杂因素,行业基准虽然有价值,但不应过度解读分数——建议直接试用模型,「它是个好模型」。这条回复链接到 Anthropic 的工程博客《Quantifying infrastructure noise in agentic coding evals》,指出基础设施配置能让 agentic coding 基准波动数个百分点,有时超过榜首模型之间的差距(如 Terminal-Bench 2.0 上最高与最低资源配置差 6 个百分点)。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →