arXiv 论文《How Fast Do Agents Rot?》:Agent 衰减遵循几何律
rohanpaul_ai · x · 2026-09-08
论文 [arXiv:2609.01660] 系统测量 LLM Agent 在长时程任务中的性能衰减及其成因。
- 研究规模:9 个模型(6 个开源 1.2B-671B + 3 个闭源)、4 类任务(含真实工具使用循环)、5 种时程、3 种上下文机制,分析 10,664 条轨迹。
- 核心结论:任务成功率遵循由单一「每步可靠性」参数决定的几何律;该参数随模型规模上升,但即使在最强模型上也远低于 1,保证足够长时程下必然崩溃。
- 在 agentic 任务上效应最剧烈:所有模型(含主流部署系统)在 16 步内从近乎满分跌至接近 0。
- 衰减由步数驱动而非上下文长度:限制上下文窗口反而使衰减更陡(logit 斜率 -0.69 vs -0.44,p=3e-6),否定了 lost-in-the-middle 解释。
- 对生产的含义:benchmark 通过率不能证明生产就绪,应在真实时程下测试并加检查点。
所属事件:微软论文揭示 LLM Agent 长链路成功率随步数几何式衰减(2 条相关)→
「编程与Agent」频道最新
- 拆解两款真实「公司大脑」:Slite 与 Gorgias 同台对比构建之道 — femke_plantinga · 2026-09-11
- 浏览器主线程很贵:动画卡顿的真正成本与前端优化实践 — jh3yy · 2026-09-11
- 开源工具 Claude Unlimited:多账号轮换让 Claude Code 会话不断线 — Similar_Injury_6739 · 2026-09-11
- 受 OpenAI 万机群启发,开发者开源 agent 众包解题平台 — Benjaminsen · 2026-09-11
- 开源 Mac 应用 Lucid:只在跑 AI 时阻止笔记本休眠 — Pitiful_Hedgehog_600 · 2026-09-11
- 20kb 函数匹配达成,banteg 召集 AI 逆向 Snail Mail 剩余 20 个挑战 — banteg · 2026-09-11