新基准测试 TB2-Fn 揭示 AI Agent 分数易现 40% 误差
Terminal Bench 2 的变体版本 TB2-Fn 通过重新编写 89 个任务,对 AI Agent 的技能进行了更可靠的测量。研究发现,由于验证误差的存在,Agent 在原始基准测试中的分数会出现高达 40% 的波动。这表明当前的 Agent 基准测试可能存在“刷分”现象,其真实能力评估容易受到测试机制的影响。
2026-07-27 ~ 2026-07-27 · 2 条相关
- TB2-Fn 发现 agent 可刷过 7 个终端任务并误差达 40% — abeirami · 2026-07-27
- TB2-Fn 显示 agent 基准分数可因验证误差波动 40% — abeirami · 2026-07-27