微软论文揭示 LLM Agent 长链路成功率随步数几何式衰减

微软新论文《How Fast Do Agents Rot?》系统测量了 LLM Agent 在长时程任务中的可靠性衰减。研究覆盖 9 个模型(含 6 个开源模型,参数从 1.2B 到 671B)及 3 个闭源模型,发现每一步都存在出错概率,且误差随依赖步数复利式放大,衰减遵循几何规律。在 ToolQA 等测试中,Agent 走到 16 步之后成功率骤降至 0-33%,所有模型均呈现成功率随步数单调下滑的趋势,凸显长工作流可靠性是 Agent 落地的关键瓶颈。

2026-09-08 ~ 2026-09-08 · 2 条相关