七年工程师:Agent 故障不报错,事故报告从不会以「AI 弄错了」收尾
ilien-dev · reddit · 2026-09-21
一位有七年经验、今年主用 agent 编程的工程师发文,指出 agent 的失败方式和脚本完全不同:脚本会抛错,agent 会「称职地做错事」,最后还给你一份漂亮的成功总结。最难的故障是那些顺利跑完、全绿通过、但底层假设没人检查的运行。
- 最危险的形态是「干净的双跑」:某一步超时后重试触发,工作被执行两次,且两次都报告成功。如果这步是写数据库行,就是脏数据;如果是转账或调用按量计费的 API,就是带价签的重复扣费——你从账单而不是日志里发现它。
- 「谁理解发生了什么」比「用什么栈」更重要:当 agent 做了昂贵操作时,谁能在决策链里定位出错的那一步?如果你只能去问模型,那这个人还不存在——问模型自己的输出对不对,它几乎总会说对。「模型自我确认」是默认的失败模式,恰好不适合用来做你需要的那项检查。
- 责任归属:「AI 弄错了」从来不是可用的事故结论。agent 不参加客户电话、不退款、不签数据泄露说明信;订阅费再贵,附带的责任是零,全部转嫁给部署方。
作者的立场:内部自用、爆炸半径只及自己的 agent,尽管放开去试;标明实验性质、提醒别盲信输出的免费工具也可以。但对收费、触碰他人资金或数据、且只能靠「问它自己」来诊断的 agent,是不可辩护的——而现在大量正在发布的产品正是这种。他最后抛出问题:对真实资金和客户数据跑 agent 的团队,你们有什么检查能真正抓住一次「干净的错误运行」?
「漫话AGI」频道最新
- 为什么有人坚信AI是假的?理性化市场解释舆论生态 — xuanalogue · 2026-09-21
- Reddit 热议:2026 将尽,AI 2027 预言还剩几分准头 — animallover301 · 2026-09-21
- Zvi 吐槽:AI 圈一周竟充斥对经济学 101 概念的表演式困惑 — TheZvi · 2026-09-21
- Dan Hendrycks 转向 EA 之外的对齐道德哲学研究 — burny_tech · 2026-09-21
- 审稿人感慨:ChatGPT 后论文论证更弱、文献综述流于点缀 — paigeinsf · 2026-09-21
- Gary Marcus 呼吁禁用 just published:2024 年的旧论文别再装新 — burny_tech · 2026-09-21