微软研究:Agent 成功率高但可靠性严重不足

微软发布论文指出,Agent 的单次成功与长期可靠性并非同一概念:表现最好的 Agent 在业务任务中至少能解决 91% 的问题,但每次都能成功的比例仅约 25%,最强模型在业务流程上的 pass@1 也仅约 65%。为此微软推出 ThinkingBox 评测基准,提供隔离的 MCP 兼容工具沙盒和 507 条带验证的任务,用于衡量 agent 在真实业务工作流中的可靠性。

2026-08-23 ~ 2026-08-23 · 2 条相关