自改进 Agent 为何难落地:一套可回滚的记忆自省架构
inbask · reddit · 2026-08-31
作者认为自改进 agent 的瓶颈不是能力而是安全审查:agent 无人监督地改写自身记忆,答不出「改了什么、依据什么、谁授权、能否撤销」四个问题。
他的设计核心是「agent 只提议、永不执行」:
- 13 个确定性分析器读取 agent 自己的执行历史并输出类型化建议对象,每条以内容哈希引用证据,不允许自由文本。
- 审查与写入是分离的 scope,禁止创建建议的 actor 自批准,每个决定必须附书面理由。
- 已应用的变更会在 1/7/30 天重测,任一检查点回归即自动提议回滚。
三个意外发现:
- 提议步骤零模型调用——确定性分析器而非 LLM 读文本,真正的收益是可复现性(随机提议无法做 A/B);
- 回滚必须是前置条件而非后补功能——apply 时必须同时记录逆操作,否则拒绝变更,直接消灭了「v2 再加 revert」这类设计;
- 知识与执行历史必须同库存储,否则按哈希引用证据的审计链就失效。底层是 SQLite(服务器版为 Postgres),一套一致性测试钉死两个后端语义相同。M4 Max 上 p50 召回约 30µs,2016 年的树莓派 3 上约 361µs,500–8000 grains 规模内持平。
限制:只改进记忆不改权重,无显式 host 授权不应用任何变更,无守护进程。项目为 Rust,MIT/Apache 双协议开源。
「编程与Agent」频道最新
- LLM 编码困境:95% 省力换 5% 绝境 — burny_tech · 2026-08-31
- 开发者热议:你会信任 AI 编码代理的 YOLO 模式吗? — NoMoreHappyPath · 2026-08-31
- Agent 开始做错事时,系统里谁有权力真正叫停它? — No_Progress92 · 2026-08-31
- OpenClaw 2.0 发布:1.6万个PR、多人协作与全新浏览器端 — The Decoder · 2026-08-31
- 打算基于 Octo.nvim 打造更合心意的插件 — 4310sy · 2026-08-31
- AI 编程实战课:为何臃肿的上下文会偷偷降低输出质量 — mattpocockuk · 2026-08-31