Agent 死循环根源不是模型笨,是失败记录污染了上下文
RunAI_Coder · reddit · 2026-09-01
一篇被广泛讨论的 Reddit 分析帖指出,agent 反复尝试同一失败方案并道歉重试,机械原因是模型无状态、每轮重读完整 transcript——四轮失败后,transcript 里占主导的就是失败尝试本身,next-token 预测器把历史当作「本会话一贯做法」而非「方向错误的证据」。
关键论据:一项 SWE-bench 轨迹研究发现,失败 run 中 agent 有 72-81% 的概率已经定位到正确文件——问题从来不是找不到位置,而是无法放弃错误假设。
有效的修复都在 harness 层而非 prompt 层:
- 设置轮次/token 硬预算,让卡死的 run 停下来而不是礼貌地烧钱
- 对已尝试的 diff 做指纹识别,近似的重复重试触发强制「列出三个未验证的假设」
- 终极手段:完全清空上下文窗口,把已学到的约束压缩成几十 token 写进新的开场 prompt,而不是带着四轮失败的「重力」继续
作者最后求助:有没有不会误伤合法重试(如 flaky 测试、限流)的重复检测方案?
「编程与Agent」频道最新
- 开源 CommerceAgentBench,Qwen 跃居开源模型榜首 — Alibaba_Qwen · 2026-09-01
- 实测发现:Agent 查“此人是谁”几乎全死路 — Dry_Steak30 · 2026-09-01
- 整合 Posthog 与 Notion,Agent 自动化用户访谈与反馈闭环 — lennysan · 2026-09-01
- 用 Grok Bot 构建大学录取数据集清洗流 — lennysan · 2026-09-01
- 构想 Grok Bot 钱款漏洞猎人应用 — lennysan · 2026-09-01
- 从 Discord 机器人到多人共享 Agent 工作区:团队工作流升级记 — steipete · 2026-09-01