微软论文:Agent 91% 成功但仅 25% 可靠,推 ThinkingBox 评测
rohanpaul_ai · x · 2026-08-23
微软发布的论文指出,Agent 的单次成功与长期可靠性并非同一概念。数据显示,表现最好的 Agent 在业务任务中至少能解决 91% 的问题,但每次都能成功的比例仅为 25%。
核心发现:
- 难以察觉的失败:80% 的失败运行在表面上看起来很“礼貌”,并调用了写入数据库的工具,Agent 声称任务完成,但数据库记录显示并非如此。
- 解决方案:微软提出了 ThinkingBox,这是一个沙盒环境。它让 Agent 对抗真实工具、模拟客户和实时后端,并在运行后检查数据库状态,而不是仅依赖 Agent 的文本回复来判断任务是否成功。
论文链接:arxiv.org/abs/2608.19741
「编程与Agent」频道最新
- ASC CLI 4.9.1 更新待发:Luna 提效显著 — rudrank · 2026-08-23
- PostSyncer 支持通过 MCP 让 AI Agent 自动发帖 — tibo_maker · 2026-08-23
- 仅凭一个样例修复 5/5 未知 bug,生成式路由器实战 — No-Program-5087 · 2026-08-23
- 直接向 LLM 提需求测试功能,修复 Remote iOS 图表问题 — Dimillian · 2026-08-23
- 构建 Meta-agent:用 Agentic Engineer 监管代码工作流闭环 — daniel_mac8 · 2026-08-23
- Grok 玩出新花样:用“元智能体”管理其他智能体 — daniel_mac8 · 2026-08-23