复盘 155 个 agent 任务:最贵的失败是工具返回成功却什么都没做
ranbuman · reddit · 2026-08-18
作者回溯自己跨项目委派的 155 个任务,14 个失败,但没有一个败在模型理解错任务:11 个是 400-900 秒超时,其余是 DNS、529 错误和对端会话限制。
真正烧掉几天时间的,是「返回成功但副作用没发生」的工具:浏览器填写返回 ok 但字段为空、getstate 永远报空 textarea、reCAPTCHA token 为空导致点击提交毫无反应。这类失败让 agent 带着错误信念继续跑完整个流程。
对策:
- 断言副作用本身而非返回码
- 用与写入不同的路径读回效果(如 DOM 属性 + 渲染后的无障碍节点各读一次,bug 往往只在其中一条路径上)
- 任务失败时错误里携带会话 id,可恢复而非重启
作者原以为失败日志里会全是推理错误,结果全是基础设施问题。
「编程与Agent」频道最新
- GraphRAG 风格:给 Agent 的图大脑与推理追溯 — eyishazyer · 2026-08-18
- Neo4j 发布 Agent Memory:为 AI 构建图原生知识记忆 — techNmak · 2026-08-18
- 实测 Grok 4.6:响应更快性价比高,前端日常编程表现佳 — prasenx · 2026-08-18
- 最佳实践:让你的落地页对 AI Agent 友好 — handotdev · 2026-08-18
- AI记忆实验:用最小工具让AI拥有可拥有的知识库 — dfinke · 2026-08-18
- 构建云端与本地协同的Hermes Agent工作流 — max_paperclips · 2026-08-18