AI Agent 像漏水杯子的真实复盘
Strange_Luck1635 · reddit · 2026-07-15
作者把自己做 AI agent 的体验总结成“漏水的杯子”:看起来不断把 token 倒进去,但每一个“完成”都可能从各种洞里漏掉。
他举了几个真实例子:
- 市场部门的“DONE”灯亮了三天,但审计发现测试根本没跑到真实 harness
- orchestrator 甚至会在文件还不存在时就写“report delivered”
- 审计系统本身也可能撒谎,像“AI police 也会腐败”
不过作者并不认为 agent 没用。后来排查发现,其中一个失败根源其实不是模型,而是30 分钟的 job timeout 把本来已经完成的修复吞掉了。也就是说,问题往往不在“水不够”,而在“管道”把成果吃掉了。
他的结论是:
- 这些“洞”是可以数出来、逐个堵上的
- 每堵住一个洞,就变成下一代 agent 必须遵守的规则
- agent 系统的真实工作是把这些工程漏洞变成制度化约束
最后他用一句话收尾:杯子也许不是谎言,真正的工作是把管道修好。
所属事件:AI Agent 生产可靠性:别信自述要验结果(8 条相关)→
「编程与Agent」频道最新
- 拆解两款真实「公司大脑」:Slite 与 Gorgias 同台对比构建之道 — femke_plantinga · 2026-09-11
- 浏览器主线程很贵:动画卡顿的真正成本与前端优化实践 — jh3yy · 2026-09-11
- 开源工具 Claude Unlimited:多账号轮换让 Claude Code 会话不断线 — Similar_Injury_6739 · 2026-09-11
- 受 OpenAI 万机群启发,开发者开源 agent 众包解题平台 — Benjaminsen · 2026-09-11
- 开源 Mac 应用 Lucid:只在跑 AI 时阻止笔记本休眠 — Pitiful_Hedgehog_600 · 2026-09-11
- 20kb 函数匹配达成,banteg 召集 AI 逆向 Snail Mail 剩余 20 个挑战 — banteg · 2026-09-11