评测结果不该被基础设施左右:墙钟时间惩罚差基建部署

xeophon · x · 2026-09-17

在关于智能体评测方法 should 的讨论中,xeophon 提出:评测数字不应受基础设施影响,因为墙钟时间对差基建、低延迟部署、负载等过于惩罚性。

他举例说明哪些 setup 是「有效」的:其一,开源模型低 batch size 部署在 Vera Rubin 机架上、沙箱也跑在同一机架上;其二,亚洲一台 20 年前的老服务器去调 Azure 上的 OpenAI endpoint(OpenRouter 上 TPS 最低的组合)。核心论点是评测的公平性应来自控制基础设施变量,而非简单地用端到端耗时排名。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →