微软 ThinkingBox 基准:Kimi 一次通过率最高,20 连胜仅 13%
tuhin_k · reddit · 2026-10-09
微软研究团队发布 Thinkingbox-Bench 论文,用 507 条有状态业务工作流检验 agent 的「可重复性」,发现按「发现能力」和「稳定复现」排名几乎得出相反的榜单。
评测设置
- 覆盖零售、旅游/酒店、车险、新银行内部 IT、咨询 IT/HR 五大领域的 507 条策略约束工作流,每任务在相同干净后端上独立跑 20 次,每模型共 10,140 次试验。
- 模拟用户持有私有上下文,只有被问到才透露;评分对比终态数据库状态与副作用,477/507 任务纯按状态判定。
三个指标
- pass@1:所有尝试中的成功率;pass@20:至少成功一次的任务比例;all-20:20 次全部成功的任务比例。
两大发现
- Kimi-K3 覆盖最广,93.89%(476/507)任务至少成功一次,但 20 连全胜仅 13.41%(68/507);Claude Opus 5 覆盖 79.09%,但全胜率 47.53%(241 任务)远高;Qwen3.8-27B 为 89.35% vs 7.50%。两个榜单几乎反转。
- 121,680 次有效试验的回溯消融中,79,853 次失败里 67.24% 是「干净终止」:正常调用了改状态工具、无报错地结束——若用完成式代理指标会被判为成功。其中 77.61% 字段值错误、43.30% 产生多余副作用、25.36% 缺少必要副作用。
论文、代码、数据集均已公开,可通过 HF OpenEnv 复跑任意任务。
「编程与Agent」频道最新
- AgentGarten 用神经渲染器生成可交互世界,Agent 4 轮学习顶百万轮 RL — MirroS-Lab · 2026-10-09
- 开源机器人一周搞定整理房间:Qwen3-8B+GR00T n1.7 实操 — joemeno · 2026-10-09
- OpenClaw 更新:多人协作、记忆与技能、语音会议齐上线 — heyneighbor · 2026-10-09
- 给 Opus 加 Minecraft 世界记忆后进度提升 133%,WorldBox 沙盒发布 — Lianhuiq · 2026-10-09
- GPT-6 生成式 UI 走红后,下一代 Agent 缺的是生成式工作流层 — Over_Accountant_2311 · 2026-10-09
- Next Token 播客第 5 期:Personal Agent 大战与 AI 复刻软件影响 — op7418 · 2026-10-09