One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows
Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez Pelaez, Liang-Chun Tsai, Calvin Wang, Mirco Milletari, Tuhin Kundu, Vadim Smolyakov, Kjartan Olafsson, Tommy Guy
cs.CL, cs.DB
2026-08-20
微软发布 Thinkingbox,用 507 条可执行业务工作流评测 agent。最强 GPT-5.4 的 pass@1 为 65.36%,二十次全过仅 25.25%;84.86% 的失败轨迹看起来已经干净结束。
现有 agent 评测擅长看补丁能不能过测试、函数调用参数对不对、网页点没点到。把退款办完、改酒店订单、更新车险理赔,要在多轮里补信息、守政策、串工具,还要把后端状态改对、别改错别人的记录。只看回复像不像、工具调用合不合法,会把大量做错的工作判成完成。
微软(实习合作匹兹堡大学、西北大学、加州大学欧文分校)做了 Thinkingbox:可重置的 MCP 工具会话、完整轨迹、按终端后端状态打分的沙盒。上面再铺 Thinkingbox-bench,507 条政策约束工作流,覆盖零售、酒旅、车险、数字银行内部 IT、咨询公司 IT/HR。
每个任务是一个可执行世界:初始后端状态、用户目标、工具集、模拟用户策略、一组隐藏的可执行检查。Agent 每步要么对用户说话,要么调工具。工具打在隔离会话上,两次尝试不共享数据库行,否则 pass@k 会串状态。
打分不看黄金轨迹。结束后抽出副作用,所有检查做合取:缺了、改错了、多改了都不算过。477 条只看数据库终态,30 条(酒旅和银行内部 IT 各 15)再加一条二值回复 rubric,例如保密披露。用户开场常常缺信息,模拟用户只在被问到时才给可披露事实。Agent 需要会追问、会拒绝不合格请求、会在不可逆更新前确认。
五个域的工具和表规模不同。零售 98 题、11 套后端、16 写/17 读。酒旅政策最长,3684 词,每题动作中位 8.8 步。咨询后端系统最多,18 套。任务从非公开企业工单模式合成,发布集不含真实客户记录,五家机构名都是虚构的。每题经过清单核对、隐私检查、可解性检查和 rollout 抽检,坏工具和含糊目标会被拿掉。
评测 12 个专有和开源模型,每题 20 次独立尝试。模拟用户固定为 GPT-5.4-mini。pass@1 是单次成功率,pass@20 是 20 次里至少一次过,pass^20 是 20 次全过。后者量的是可重复,前者量的是能不能撞到一条成功轨迹。
| 模型 | pass@1 | pass@20 | pass^20 |
| GPT-5.4 | 65.36% | 91.12% | 25.25% |
| Claude Sonnet 4.6 | 58.45% | 88.56% | 20.12% |
| GPT-5.2 | 46.28% | 84.81% | 8.68% |
| DeepSeek-V4-Pro | 43.26% | 84.62% | 3.55% |
| Claude Opus 4.6 | 37.91% | 70.02% | 13.81% |
| Grok-4.3 | 14.38% | 45.96% | 0.00% |
GPT-5.4 零售 76.33%,咨询掉到 54.60%。只有它和 Sonnet 4.6 五个域都过 50%。车险最难,模型均分大约 23%;零售大约 52%。Opus 4.6 零售 74.90%,车险只有 14.65%。开源里 DeepSeek-V4-Pro 最强,接近 GPT-5.2;Mistral-Large-3 总参数 675B,均分只有 4.66%。Qwen3.6-27B 从 Qwen3.5-9B 的 5.41% 拉到 32.94%,参数规模解释不了全部排名。
失败里 77.5% 是工具使用:环境报错或查找失败后修不回来,有的还当已经成功继续往下走。真正漏掉写操作的只有 2.5%。错误状态更新占 12.1%,工具返回成功、Agent 也向用户确认完事,库里已经写错;o3-pro 这类失败里有 27.8%。DeepSeek-V4-Pro 有 24.7% 的失败停在对用户没说完。
更硬的对照在评委消融。121,680 次有效尝试里有 79,853 次失败;其中 84.86% 干净结束,80.88% 还调用过写工具,67.24% 最后一次工具返回也没显式报错。可执行检查则有 98.95% 数据库哈希对不上,77.61% 字段值错,43.30% 多改了不该动的记录。轨迹更长并不等于更对:GLM-5.1 平均 44.86 条消息、11.99 次工具调用,仍明显低于 GPT-5.4 的 29.80 条消息、11.05 次调用。
这是给企业助手用的 τ-bench 近亲,加上 MCP 隔离会话和更硬的副作用检查。同一套循环能当评测也能当奖励。对部署的直接含义:retry 能找到一条成功轨迹,不等于每次都能办对。pass@1 65% 听起来能用,二十次全过 25% 说明还不能把不可逆操作交给它。
工具调用格式正确、会话正常结束,都不是工作完成的代理指标。要看库。
477 条完全不看对用户怎么说,改对库但跟用户说错仍可能判过。每题只有一个黄金终态,多种合理处理在构造阶段就被剔除。模拟用户比真人听话:不编造、不改目标、失败后仍配合、最多十轮追问,而且和榜首模型同属 GPT-5.4 家族,交互风格偏好没法排除。任务来自非公开工单的合成重建,不声称代表企业工作分布。结果还绑在终止标记、轮次和 token 上限这些 harness 约定上。o3-pro 丢掉了 636 次系统或 harness 错误,分母和其他模型不完全可比。