Anthropic 实测:基础设施配置可让编程评测相差 6 个百分点

giansegato · x · 2026-09-29

Anthropic 工程博客发布研究,指出基础设施配置本身就足以显著扰动 agentic 编程评测结果,差距有时超过排行榜前列模型之间的分差。

发帖人提醒:行业基准存在诸多难以完全控制的混杂因素,不必过度迷信榜单,直接试用模型是更好的判断方式。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →