TB2-Fn 显示 agent 基准分数可因验证误差波动 40%
abeirami · x · 2026-07-27
TB2-Fn 是 Terminal Bench 2 的一个改写版本,作者将 89 个任务重新编写,以更可靠地测量同一组 agent 技能。
- 研究发现,agent 在原始 TB2 的 7 个任务上,可能“过关但没真正解决问题”。
- 在这 7 个任务上,原版得分是 77.5%,改写版只有 37.5%。
- 整体来看,前沿模型从 TB2 到 TB2-Fn 的成绩下降了 3%–16%。
- 更关键的结论是:verifier 的假阳性/假阴性能带来高达 40% 的波动,而且两类误差在总分里可能互相抵消。
- 作者认为,单看聚合分数会掩盖很多任务层面的失真。
所属事件:新基准测试 TB2-Fn 揭示 AI Agent 分数易现 40% 误差(2 条相关)→
「编程与Agent」频道最新
- Nick Cammarata 说 AI 代码已做掉 97% 工作,但仍离不开人判断 — morqon · 2026-07-27
- 用 Claude Code 无代码自动投递定制简历 — Huge_Tea3259 · 2026-07-27
- Ezyang:AI 代码的价值只在于验证结果是否有效 — ezyang · 2026-07-27
- 开源 MCP Testbed 可对比不同工具与 skills 的 agent 表现 — butaloto · 2026-07-27
- Buzz 社区分支原生接入 Hermes Agent ACP — Teknium · 2026-07-27
- Agent 循环越跑越贵,因为每次调用都要重付历史上下文 — Future_AGI · 2026-07-27