Agent 运行失败后如何安全重放:需保存哪些上下文

tomibrumen · reddit · 2026-09-28

作者在实现 agent 工作流恢复时区分两种场景:复现故障需要保留输入、prompt 与工具版本、工具响应及审批决策;修复后继续运行则要从安全检查点恢复,并核对哪些外部动作已经发生。\n\n核心难点是自动重试不能产生副作用重复(如重复发消息、创建重复记录),需要追踪外部 ID 与已完成动作。作者还在恢复能力与数据留存之间权衡:保留足够理解决策的上下文,但不存储所有敏感载荷。文中提出依赖失败时的三种运维响应:从检查点自动重试、携带失败轨迹通知人工、或等待人工修复后审批重跑。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →