多智能体上下文两次踩坑后,他总结出三条可验证状态原则
New_Difficulty_8152 · reddit · 2026-09-01
作者解决了「多个 agent 共享会话状态」的老问题:不是共享聊天历史,而是共享经过验证的状态——什么改了、什么被卡住、有什么证据表明任务完成。
两次失败的尝试
- 人工维护 Markdown 交接笔记:累了就跳过更新,下一个 agent 把过期上下文当真,而且人成了每次交接的路由瓶颈。
- 让 agent 自己写交接笔记:agent 可以像真的跑过测试一样写下「tests pass」——下一个 agent 继承的不是被验证的工作,而是关于工作的故事。
最终方案的三原则
- 状态用显式字段而非段落记录,agent 无法靠写更漂亮的总结让未完成工作消失。
- 干活的 agent 不能自己验收:独立 reviewer 从原始目标出发直接检查结果,而不是读实现者的辩解。
- 可机器验证的声明必须绑定具体版本的证据:「测试通过」是声明,绑定 commit hash 的测试结果才是证据;代码变更后证据不自动转移。
30 天自用结果:16 个仓库合并 4,172 个 PR(单人维护);协调开销从 3 个 agent 到 10 个基本持平;过期上下文 bug 降到接近零。
遗留问题:reviewer 偶尔分不清「目标中途变了」和「实现错了」,目前用双方引用的 goal-hash 缓解,但 UX 仍不理想。项目已开源(链接在评论区)。
「编程与Agent」频道最新
- 用 Claude Opus 5 实现外设的 Agent 驱动逆向工程 — bibryam · 2026-09-01
- 新工具 md²:在 Agent 用量耗尽时自动切换 — JBO_76 · 2026-09-01
- TouchBar 被 Agent 救活:代码任务状态实时看 — APPSO · 2026-09-01
- 免费向量数据库避坑:8 款主流产品生产环境实测踩坑 — PrajwalTomar_ · 2026-09-01
- MongoDB CTO 谈数据库架构演进与 Agent 记忆难题 — The Cognitive Revolution · 2026-09-01
- Langfuse 推出评估器模板库,覆盖分类与检索检测 — colinmcnamara · 2026-09-01