重试 agent 步骤,不等于安全恢复 14 步工作流
msignificantdigit · reddit · 2026-07-28
失败重试,不等于 14 步 agent 流程的安全恢复
作者结合自己在 agent/workflow 持久化执行方向的工作指出:retry 和 resume 经常被混为一谈,但在生产环境里它们并不是一回事。
以一个 14 步的 LangGraph 流程为例,如果执行在第 14 步崩溃,直接从头重跑可能会重复发邮件、重复写 CRM、甚至重复触发付款或基础设施变更;只重试失败的那一步虽然更安全,但仍然要回答:前面 1 到 13 步是否真的完成、它们的输出是否已经持久化、工具调用能不能无副作用地再跑一次、模型或 prompt 是否已经变了、以及人类在第 4 步做过的审批是否仍然有效。
作者把问题拆成三层:
- agent 决策状态:模型看到了什么、走了哪条分支;
- 持久化编排状态:哪些步骤已完成、流程可以从哪里继续;
- 幂等性:发邮件、写数据库、调用外部工具时,重复执行会不会出问题。
结论是:checkpoint 只能帮你恢复进度,不能让外部副作用自动变成幂等;即便有 durable runtime,工具层的幂等设计仍然不可或缺。
「编程与Agent」频道最新
- 长任务 AI Agent 的上下文腐烂怎么管 — bushibuilds · 2026-07-28
- PR 守护进程把评审意见自动变成修复 PR — MikkoH · 2026-07-28
- Claude 编程上下文该不该定期重置?开发者纠结如何保留有效记忆 — mobileraj · 2026-07-28
- SAP 的 TRACE 在保留工具知识的同时实现 86% 召回 — SAP · 2026-07-28
- GlobalGPT 主打一站式 AI 工作区,月费 10 美元接入 100 多种模型 — hey_abusiddik · 2026-07-28
- GlobalGPT 演示通过 MCP 在 Codex 内生成视频 — hey_abusiddik · 2026-07-28