新基准测试 TB2-Fn 揭示 AI Agent 分数易现 40% 误差

Terminal Bench 2 的变体版本 TB2-Fn 通过重新编写 89 个任务,对 AI Agent 的技能进行了更可靠的测量。研究发现,由于验证误差的存在,Agent 在原始基准测试中的分数会出现高达 40% 的波动。这表明当前的 Agent 基准测试可能存在“刷分”现象,其真实能力评估容易受到测试机制的影响。

2026-07-27 ~ 2026-07-27 · 2 条相关