实测四个开源 Agent 中途崩溃全部重做已完成的动作
merlinofthewater · reddit · 2026-10-09
作者构建 agent 时反复遇到同一问题,于是对四个已发布的开源 agent 代码库做了中断-重试实验:在动作执行中途杀掉进程,再按 supervisor/worker pool 的方式重试,用假服务在响应前 fsync 的账本(ledger)来计数。
- Cua(computer-use):结账中途杀掉,重试会再次扣卡,两个崩溃位置、每次都复现(0.8.4 与 0.9.0 结果一致)。
- Skyvern:步骤中进程死亡会让任务永远卡在 running 状态——不是 failed 也不报错,失败告警无从触发,唯一出路是重跑,而重跑会再次下单。
- Corsair:两个副本同时消耗同一个轮换 OAuth refresh token,崩溃后存储凭证必然失效,用户必须重新授权。
- Inconvo:一次被打断的回答多花 60% 的模型调用,因为 checkpointer 只记录图节点,不记录其下方的 15 次模型调用。
共同根因:四个失败形态不同,但都缺失同一块——没有记录哪些动作已经完成,重试进程带着空历史,只能重做一遍。
- 作者引用 arXiv 2609.29095:对 25,930 个 agent episode 按已提交效果账本评分时,agent 在重复了效果的事件中 90% 自报成功——即不能问 agent 自己做了什么,靠自报 trace 的基准会把「重复且撒谎」判为通过。
- 作者坦承无法修复的边界:动作落地与记录提交之间死亡仍会重复,效果与记录分属不同系统。
- 结论对实践的直接启示:涉及钱或外发的 agent 重试需要外部账本/幂等键,而不是信任 agent 自述。
- 披露:作者本人做相关 runtime,非中立第三方;测试工具与原始账本公开、无需 API key(全部调用打到本地假服务)。
所属事件:实测四个开源 Agent 中断重试全部重复已完成的动作(2 条相关)→
「编程与Agent」频道最新
- GitSwarm 论文:多智能体共享 Git 仓库实现可组合的长程推理 — NandoDF · 2026-10-11
- Agent 安全新难题:它们分不清你到底有没有权限做这件事 — aparnadhinak · 2026-10-11
- 一针见血:所有 Agent 都默认用户有无限注意力 — msg · 2026-10-11
- 主 Agent 可自动派生子 bot,无需再手动创建 — nateliason · 2026-10-11
- 本地跑 Qwen3.8-Flash-Next 编程实测:5090 上 11 分钟跑赢 Claude Code — dh7net · 2026-10-11
- 别再攒 43 个浏览器标签:让 Agent 帮你自动生成摘要并存档 — RachelVT42 · 2026-10-11