六个编码 Agent 共享一个代码库实验:各写各的全崩,会聊天就全过
jokiruiz · reddit · 2026-10-02
开源实验作者 jokiruiz 用一个小型订房 API(6 个任务、37 个验收测试、两对语义冲突任务)测试多 Agent 协作,得出一组反直觉结果:
- 各自分支隔离开发:每个 Agent 自己的测试都通过,但 5 次合并运行全部损坏——Git 只合并了文本,没人发现语义已变(如一个 Agent 给登录加二次验证,另一个的导出功能还在调旧登录)
- 共享工作目录:10 次运行全部通过,因为 Agent 能看到彼此的改动并自适应
- 作者还试了名为 Jev 的「决策模型」:不生成文本,约 0.3 秒返回带概率的是/否判断,在每次写入前判断是否与其他 Agent 冲突。它捕获了所有真实冲突且不误伤无害操作,成本与文件锁相当;但它对 61% 的真实写入不确定,仍需交给更慢的常规 LLM——便宜的决策在混乱场景下并不真便宜
- 意外发现:给 Agent 配上互发消息的工具后,它们未经指示就自发使用,一个 Agent 还警告另一个它要重命名对方依赖的字段
作者倾向的结论:多 Agent 协调的答案可能不是裁判内核,而是让 Agent 直接对话。样本量小(每组 1-5 次),全部原始数据 MIT 协议开源在 medula 仓库。
所属事件:多编码 Agent 同仓库协作实验:隔离即崩溃,开源 Médula 协调器求解(3 条相关)→
「编程与Agent」频道最新
- remilouf 预告历时 6 个月打造、自称「彻底改变游戏规则」的 agent 产品 — remilouf · 2026-10-02
- Polyphonic 智能体可自主居住虚拟世界 Somewhere — RileyRalmuto · 2026-10-02
- 用 HTML/CSS/JS 制作 EMNLP2026 学术海报,排版完全可控 — algo_diver · 2026-10-02
- Armin Ronacher 出任 Earendil 首席 MCP 官,将连发 MCP 锐评 — mitsuhiko · 2026-10-02
- ProVer 论文:让 LLM 裁判定位关键步骤,Agent RL 超 GRPO 9.9% — omarsar0 · 2026-10-02
- 无制作团队:Opus 5.5 用 Claude Code Skill 包办 3 分半 MV 全流程 — FinanceYF5 · 2026-10-02