Reddit 网友发问:为何没有面向 Agent 运行时而非模型的基准测试?
Balance- · reddit · 2026-09-11
有 Reddit 用户指出,目前 SWE-bench、Terminal-Bench、OSWorld、BrowseComp 等基准都围绕模型,但缺少对 OpenAI Agents、Anthropic agent stack、AWS AgentCore、Google agent 平台以及 LangGraph 等本地替代方案做同类对比的 agent 运行时基准。
他希望测量的维度包括:
- 任务成功率
- 每次成功任务的成本
- 墙钟时间
- 工具调用次数/重试次数
- 长时间运行任务的可靠性
- (可选)需要的人工干预次数
最有价值的实验是双向控制变量:同模型不同 harness,看运行时影响多大;同 harness 不同模型,看模型影响多大。作者认为业界实际评测的是「模型 + harness」系统,但基准仍以模型为比较单位,询问是否已有类似工作存在。
「编程与Agent」频道最新
- 实测各 LLM 订阅真实代币价值:Grok Heavy 40 倍 ROI 最高 — thesaraharminta · 2026-09-11
- 把 Claude 当新队友配置,交接集成零会议,QA 96 分钟回报 — max_gladysh · 2026-09-11
- Replit 上线 Routines 自动化功能,还支持设置预算 — amasad · 2026-09-11
- 把 Replit Agent 装进机器人:自主建站并一键发布 — amasad · 2026-09-11
- 开源 OmniGet 支持 1800+ 站点下载课程视频并转写整理 — tom_doerr · 2026-09-11
- 独立开发者用 Fable 造群聊应用:AI 自己加班加了两个'惊喜'功能 — RileyRalmuto · 2026-09-11