微软论文:Agent 91% 成功但仅 25% 可靠,推 ThinkingBox 评测

rohanpaul_ai · x · 2026-08-23

微软发布的论文指出,Agent 的单次成功与长期可靠性并非同一概念。数据显示,表现最好的 Agent 在业务任务中至少能解决 91% 的问题,但每次都能成功的比例仅为 25%。

核心发现:

论文链接:arxiv.org/abs/2608.19741

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →