DepGuard 作者复盘:用持久化事故记忆回答「以前见过吗」
PranaviYalala · reddit · 2026-09-30
作者发现多数糟糕的部署并非新问题,同样的失败几个月前就发生过,证据躺在没人会去搜的 CI 日志里。为此他做了 DeployGuard:监控接入的 GitHub 仓库,基于仓库自身历史给每次 push 一个 LOW/MEDIUM/HIGH 风险判断,并引用历史部署作为依据;只建议、不拦截不回滚。
核心是「事故记忆」设计,他总结了五条经验:
- 事实与记忆分离:PostgreSQL 存确切发生的事,Hindsight 存可检索的记忆,分别回答「发生了什么」和「以前见过类似的吗」。
- 只记录观察到的事实:失败时只保留失败任务和日志尾部,根因留空,不让模型猜——「貌似合理的猜测存成事实会毒化之后所有回答」。
- 把未知写进记忆:每条事故记忆明确写「Root cause: not known」,避免召回时有人悄悄补齐。
- 用句子而非 JSON 写记忆:语义召回下,含失败阶段、变更文件、日志尾部的自然语言句子远好于序列化行。
- 幂等写入:GitHub 重试、CI 重跑、回填都要保证事故只存一次、记忆替换而非重复。
效果:问「以前见过数据库连接超时吗」,能召回日志里写 ETIMEDOUT 的历史事故,即使问题里没用到那个词——纯文本搜索做不到。代码开源于 GitHub。
「编程与Agent」频道最新
- Opus 视频生成工作流:Claude Code 加 OpenRouter 一把钥匙调全模态 — dragon_khoi · 2026-09-30
- 用 Opus 5.5 做游戏?先学会 Pinterestmaxxing 攒美学素材 — nptacek · 2026-09-30
- Codex CLI 大更新:语音启动任务、/agents 视图管理多任务 — testingcatalog · 2026-09-30
- Conductor 接入 Sign in with ChatGPT,Codex 订阅一键登录 — charlieholtz · 2026-09-30
- OpenAI 预告 Decisions API:用 gpt-6-luna 快速做图文决策 — stevenheidel · 2026-09-30
- 开发者开始构建专为 ChatGPT 内使用设计的 Codex 原生应用 — danshipper · 2026-09-30