微软论文:Agent 长链路衰减,16 步后成功率跌至 0-33%
rohanpaul_ai · x · 2026-09-08
微软新论文系统研究 LLM Agent 在长工作流中的可靠性衰减。
- 每一步都有出错概率,随依赖步数增加误差复利式放大;9 个模型均呈现成功率随步数下滑。
- 在 ToolQA 上,短链路接近满分的模型在 16 步后成功率仅剩 0-33%。
- 衰减主因是步数而非上下文长度:缩短上下文反而让衰减更陡,盲目裁剪历史不能提升可靠性。
- 给开发者的建议:不要把 benchmark 通过率当作生产就绪证明,应在真实工作流长度下测试、度量每步可靠性,并在坏步骤污染后续结果前加检查点。
所属事件:微软论文揭示 LLM Agent 长链路成功率随步数几何式衰减(2 条相关)→
「编程与Agent」频道最新
- 用Astra做Catan游戏完成度惊人,还能复用过往UI与3D资产 — FinanceYF5 · 2026-09-11
- 开源工具让 AI 答案在 PDF 原文中高亮溯源段落 — Flat-Phone-1596 · 2026-09-11
- 曝 OpenAI Codex 或于本周末再发额度重置,Codex 负责人暗指常有 — umesh_ai · 2026-09-11
- Ceetrix 实测:gemini-3.5-flash-lite 效果平替 3.8,成本仅零头 — julianharris · 2026-09-11
- OpenAI 开放 Agents API 公测:Codex 底层智能体基建免费提供给开发者 — The Decoder · 2026-09-11
- ComfyUI 风格浏览器更新:LoRA 预览目录与分享功能 — neonsparksuk · 2026-09-11