Anthropic 揭秘:基础设施噪音可导致 Agent 编程评测偏差超 6%

giansegato · x · 2026-08-29

Anthropic 工程博客指出,SWE-bench 等智能体编码评测受基础设施配置影响巨大。在 Terminal-Bench 2.0 测试中,资源配置差异导致的分数波动可达 6 个百分点,超过了榜首模型间的差距。文章探讨了资源限制(CPU/RAM)如何影响评测结果,并提出了校准资源以减少噪音的方法论。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →