arXiv 论文《How Fast Do Agents Rot?》:Agent 衰减遵循几何律
rohanpaul_ai · x · 2026-09-08
论文 [arXiv:2609.01660] 系统测量 LLM Agent 在长时程任务中的性能衰减及其成因。
- 研究规模:9 个模型(6 个开源 1.2B-671B + 3 个闭源)、4 类任务(含真实工具使用循环)、5 种时程、3 种上下文机制,分析 10,664 条轨迹。
- 核心结论:任务成功率遵循由单一「每步可靠性」参数决定的几何律;该参数随模型规模上升,但即使在最强模型上也远低于 1,保证足够长时程下必然崩溃。
- 在 agentic 任务上效应最剧烈:所有模型(含主流部署系统)在 16 步内从近乎满分跌至接近 0。
- 衰减由步数驱动而非上下文长度:限制上下文窗口反而使衰减更陡(logit 斜率 -0.69 vs -0.44,p=3e-6),否定了 lost-in-the-middle 解释。
- 对生产的含义:benchmark 通过率不能证明生产就绪,应在真实时程下测试并加检查点。
所属事件:微软论文揭示 LLM Agent 长链路成功率随步数几何式衰减(2 条相关)→
「编程与Agent」频道最新
- AI 应用计费管线实战:六大计量清单,一份数据同时服务产品财务运维 — blaizedsouza · 2026-09-11
- 用户睡前下达任务,Astra 自主连续干活超 17 小时写 App — LinusEkenstam · 2026-09-11
- GPT-6 Astra 文档引热议:异步工具调用与中途转向或成 Agent 编排利器 — MikkoH · 2026-09-11
- SlopCodeBench:LLM 代码正确却难看,如何量化代码烂度 — mitsuhiko · 2026-09-11
- Agent 工程实战:用 Inbox 去重避免 webhook 重试导致重复执行 — blaizedsouza · 2026-09-11
- 微软论文:给 Agent 记忆管理器加只读校验工具,Copilot 通过率 39%→73% — dair_ai · 2026-09-11