微软新基准:最强模型业务流程 pass@1 仅 65%, agent可靠性堪忧
dair_ai · x · 2026-08-23
微软发布 Thinkingbox,一个评估 agent 在真实业务工作流中可靠性的沙盒与基准:
- 沙盒提供隔离的 MCP 兼容工具会话;
- 基准包含 507 条带策略约束的工作流,覆盖零售、酒店、汽车保险、数字银行 IT、咨询支持等领域;
- 评分不看来话或工具调用本身,而是检查 agent 在后端系统里实际留下的状态:可执行检查会接受合法轨迹,拒绝错误、缺失或多余的副作用——附带伤害直接扣分。
结果:最强模型 pass@1 仅 65.36%,pass^20 为 25.25%。更值得警惕的是,许多失败案例以干净的方式终止、还发出了合法的状态变更调用——只看回复文本或工具调用,几乎判断不出任务是否真正完成。
所属事件:微软研究:Agent 成功率高但可靠性严重不足(2 条相关)→
「编程与Agent」频道最新
- Agent 编程普及将重塑公众对软件开发的认知 — pixlpa · 2026-08-24
- Devin 突破 Slack 阻塞,自主发邮件求反馈 — sandylikesfrogs · 2026-08-24
- 从发号施令到协作,开发者使用Agent习惯转变 — latticecut · 2026-08-24
- 开发者不再写代码:瓶颈已从写代码转为读代码 — thursdai_pod · 2026-08-24
- 普通人用 AI 最大的错:总想造轮子而非用好工具 — Tired40s · 2026-08-24
- DeepPaperNote:将单篇论文转为 Obsidian 研究笔记 — tom_doerr · 2026-08-24