微软研究:Agent 成功率高但可靠性严重不足
微软发布论文指出,Agent 的单次成功与长期可靠性并非同一概念:表现最好的 Agent 在业务任务中至少能解决 91% 的问题,但每次都能成功的比例仅约 25%,最强模型在业务流程上的 pass@1 也仅约 65%。为此微软推出 ThinkingBox 评测基准,提供隔离的 MCP 兼容工具沙盒和 507 条带验证的任务,用于衡量 agent 在真实业务工作流中的可靠性。
2026-08-23 ~ 2026-08-23 · 2 条相关
- 微软新基准:最强模型业务流程 pass@1 仅 65%, agent可靠性堪忧 — dair_ai · 2026-08-23
- 微软论文:Agent 91% 成功但仅 25% 可靠,推 ThinkingBox 评测 — rohanpaul_ai · 2026-08-23