微软 ThinkingBox 基准:Kimi 一次通过率最高,20 连胜仅 13%

tuhin_k · reddit · 2026-10-09

微软研究团队发布 Thinkingbox-Bench 论文,用 507 条有状态业务工作流检验 agent 的「可重复性」,发现按「发现能力」和「稳定复现」排名几乎得出相反的榜单。

评测设置

三个指标

两大发现

论文、代码、数据集均已公开,可通过 HF OpenEnv 复跑任意任务。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →