Reddit 网友发问:为何没有面向 Agent 运行时而非模型的基准测试?

Balance- · reddit · 2026-09-11

有 Reddit 用户指出,目前 SWE-bench、Terminal-Bench、OSWorld、BrowseComp 等基准都围绕模型,但缺少对 OpenAI Agents、Anthropic agent stack、AWS AgentCore、Google agent 平台以及 LangGraph 等本地替代方案做同类对比的 agent 运行时基准。

他希望测量的维度包括:

最有价值的实验是双向控制变量:同模型不同 harness,看运行时影响多大;同 harness 不同模型,看模型影响多大。作者认为业界实际评测的是「模型 + harness」系统,但基准仍以模型为比较单位,询问是否已有类似工作存在。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →