205 次 Agent 运行实测:外部副作用才是断点恢复的真正难题
morrown1 · reddit · 2026-09-14
Infra(面向长运行 Agent 的端到端连续性与控制层,集成层 MIT 开源,自托管运行时 PolyForm Shield 源码可得)的作者发布 205 次脱敏评测结果,核心论点是:难点不是检查点本身,而是 worker 在外部 API 成功执行动作后、本地记录结果之前死掉时,无法证明动作是否已发生——盲目重试可能重复付款、迁移或部署。
Infra 将工作状态、决策理由、工件血缘、约束与审批、外部效应生命周期作为一条端到端路径保存,重试前先与外部系统证据做对账。
评测结果:
- 25 次高风险续跑:Infra 5/5 完成 vs Strong Handoff 4/5,token 少 49.4%,恢复快 60.8%(样本小,仅方向性)
- 60 次匹配续跑:三者均 20/20 完成,Native 对简单轨迹仍最省
- 30 次效应安全测试:Infra 拦截全部 10 个注入的重复外部效应
- 90 次验证经验测试:压缩经验表示省 64.5% token 但比冷启动贵 2.0%,6 组对比仅赢 1 组——经验应选择性注入而非每次都带
作者正在招募最多 3 个设计伙伴做 shadow-only 试点,并抛出核心问题:Agent 在外部动作已发出但未记录回执时死亡,另一个 Agent 需要什么最小证据才能继续,何时该停下交给人?
「编程与Agent」频道最新
- 倒着造谜题:滑铁卢大学发布 2 万题 ORBIT 数据集训练搜索 agent — CShorten30 · 2026-09-15
- 独立开发者自建安全管理清单,覆盖其 40+ 应用项目 — saibharadwaj · 2026-09-15
- JetBrains 支持的 ThinkRail 开源,主打 AI 时代的规格驱动开发 — makingthematrix · 2026-09-15
- 在 AGENTS.md 写「别过度设计」,agent 回敬一个防过度设计框架 — granawkins · 2026-09-15
- 4000 次实测:96 个工具只掉 9 分,agent 第三轮才是真瓶颈 — EastVersion1226 · 2026-09-15
- 网友用 OpenAI Astra 配合 Codex 逐帧复刻《超时空要塞 7》游戏 — algo_diver · 2026-09-15