微软新基准:最强模型业务流程 pass@1 仅 65%, agent可靠性堪忧

dair_ai · x · 2026-08-23

微软发布 Thinkingbox,一个评估 agent 在真实业务工作流中可靠性的沙盒与基准:

结果:最强模型 pass@1 仅 65.36%,pass^20 为 25.25%。更值得警惕的是,许多失败案例以干净的方式终止、还发出了合法的状态变更调用——只看回复文本或工具调用,几乎判断不出任务是否真正完成。

所属事件:微软研究:Agent 成功率高但可靠性严重不足(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →