长任务 Agent 为何崩:错误复合+上下文污染+弱自我纠错三因分析
Sad_Lavishness_53 · reddit · 2026-10-05
Reddit 上一个关于长任务 agent 的结构性讨论:单步模型都做得好,但整条链仍会在长任务上崩掉。作者归纳三个原因:
- 错误复合:每步 95% 准确率,20 步链的整链成功率只剩约 36%(0.95^20)
- 上下文污染:足够多的工具调用后,上下文塞满旧输出、死胡同和失败尝试,模型逐渐丢失原始目标
- 弱自我纠错:某步出错后,模型倾向于在错误上继续盖楼而不是回退修复
作者提出核心分歧:修好长任务靠更强的模型,还是靠更精心设计的循环(checkpoint、verifier 步骤、状态存到上下文窗口外)?并抛出三个实践问题:历史是全量保留还是摘要裁剪?独立 critic/verifier 模型是否真有效还是只加延迟和成本?agent 通常在任务哪个阶段开始崩、什么修复手段真正有效?
「编程与Agent」频道最新
- 他用 Claude 做出宝可梦式韩语学习游戏,免费开放试玩 — EstanislaoStan · 2026-10-06
- 两年自建本地 AI「操作系统」Aether:记忆、编排与故障恢复全栈 — Budget_One_8784 · 2026-10-06
- 开发者发问:为何 AI 从不选 Java?训练语料欠采样或是主因 — HanchungLee · 2026-10-06
- Andrew Warner 演示 Grok Bot 12 种用法:从会议善后到收件箱分诊 — brandon_galang · 2026-10-06
- StackOverflow 调查:65% 开发者用编程 agent,六成却刻意回避 AI — pchandrasekar · 2026-10-06
- teenytiny.computer 亮相:为 Agent 打造人机共用的云端 Linux 虚拟机 — pritisinghhhh · 2026-10-06