给 agent 一周「完全自主」,三种失败模式与真正有效的修复
ladyshrekk · reddit · 2026-10-04
作者让 agent 以极少人工检查点运行一个研究+摘要工作流一周,记录了意外翻车的三种方式:
- 工具调用死循环:工具返回含糊结果时,agent 会以微小变化无限重试而不升级求助,网页研究时尤其严重——限流和 IP 封锁把模糊结果变成无限重试。换成住宅轮换代理后,因不再每次撞同一堵 IP 墙,重试循环大幅减少。
- 记忆投毒:早期的错误输出被存储并在后续引用,agent 自信地把自身错误当作来源,误差不断复利。
- 范围蔓延:目标过于宽泛时,agent 会派生技术上相关但完全偏离原目标的子任务,「没有边界的自主只是噪音」。
真正有效的修复不是更好的 prompt,而是加入显式的「置信度阈值」:让 agent 在行动之前标记不确定性。作者最后问大家是在 prompt 层、架构层解决,还是接受一定失败率作为自主的代价。
「编程与Agent」频道最新
- MCP 服务器 mcp-azure 发布,可管理 Azure DevOps 工作项与 Sprint — modelcontextprotocol · 2026-10-04
- 首位歌手自建 MCP 服务器:AI 客户端可直接流媒体播放其专辑 — modelcontextprotocol · 2026-10-04
- uv 作者自曝 fork 版工具链回放快 33%,磁盘省 60% — mitsuhiko · 2026-10-04
- 开源 cmdshellmcp:白名单约束的命令行 MCP 服务器,附 Docker 沙箱 — ag789 · 2026-10-04
- Reddit 讨论:让独立开发者的专业 Agent 组队接单,你信得过吗? — rosh-1307 · 2026-10-04
- 用多媒体设计原则给 Claude 的 demo 视频「去 slop」 — _ScottCondron · 2026-10-04