很多 agent 失败,不是不会做而是不知道在推进
orvi2014 · reddit · 2026-07-25
这条 Reddit 长帖的核心观点是:大多数 agent 失败不是智力问题,而是进度检测问题。
作者认为,很多 agent 明明已经会规划、调用工具、产出连贯的中间步骤,但系统仍然会失败,因为它缺少一个可靠的外部信号,来判断当前轨迹到底是在接近目标,还是只是在原地打转。
常见失败模式包括:
- agent 不断发起工具调用
- 每次参数只发生很小变化
- 上下文越堆越长
- 自我评估始终乐观
- 真实目标距离几乎没变
作者建议,真正有用的约束应当是结构化、外部化的,例如:
- 强制终止的步数 / token 预算
- 明确的进度谓词(状态是否朝目标发生了有意义变化)
- 比较相邻状态的语义距离
- 用 tool-call fingerprinting 检测近似循环
- 只负责判断进度、不会生成动作的独立 critic 模型
结论是:如果系统仍把模型同时当作执行者和唯一裁判,更强的模型往往只会把同一种失败做得更自信、也更昂贵。
「编程与Agent」频道最新
- Modern Relay 认为 agent 协调需要类型图而非 Postgres — sarahdrinkwater · 2026-07-25
- Pydantic Monty 新增子进程、Rust 发布和 WebSocket 支持 — samuelcolvin · 2026-07-25
- 有人在做统一调试多步 AI 工作流的工作台 — Impressive-Iron5216 · 2026-07-25
- Laguna S 2.1:用户想要开源和更简单的编程智能体 — max_paperclips · 2026-07-25
- ComfyUI 用户在讨论 Illustrious 角色一致性工作流 — sparereddit1234 · 2026-07-25
- AI 编码代理淘汰的是放弃工程判断的人 — bendee983 · 2026-07-25