88%~95% Agent 试点难落地:真正杀手是不确定性与静默失败
ankitsharma112 · reddit · 2026-09-07
一位有多年企业 Agent 落地经验的从业者撰文:"Agent 是否 ready" 本身是错误的提问框架——Agent 只能是"在特定边界、护栏内、人机协作下胜任某项具体任务"。
为什么试点死掉
- 常被引用的数字:88%(有的来源到 95%)的 Agent 试点从未上线
- 原因几乎从不是模型太笨:demo 用的是干净切片数据、单一 prompt、终点明确;生产环境是重复客户记录、无人记录的权限模型、同一字段三种拼写、跨 6 个工具跑 40 分钟的任务
- 真正的杀手是非确定性:普通系统失败会大声报错,Agent 失败是安静的、听起来胸有成竹,且方式测试用例根本没预料到
- 实例:内部评测 95%+ 的 Agent,上线第一周因工具超时后"即兴绕路"持续烧钱;约 1/3 已归档的生产事故源于 Agent 未优雅处理工具故障——黄金路径测试抓不到这类问题
能上生产的团队的共同做法
- 把评测与可观测性当基础设施:每一步工具调用和决策都要可追踪
- 可靠性来自确定性护栏 + 模块化设计,而非更好的 prompt:LLM 只负责意图和语言理解,涉及金钱、查询、状态变更的精确操作交给有类型的、可测试的代码
- 高风险动作设真实审批门(human-in-the-loop)——"自信且不可逆地犯错"才是终结项目的失败模式
- 尽早拆分,单 Agent 包打天下的架构调试难度指数级上升
现状:跑得通的是客服分诊、SDR 外呼、内部运维与知识检索、编码辅助;银行保险进展最快(本来就习惯审计留痕),医疗和公共部门落后——说明瓶颈是治理与数据,而非智能。
「编程与Agent」频道最新
- Agent 记忆≠可信上下文层,企业记忆赛道遭质疑 — femke_plantinga · 2026-09-07
- 靠 Codex 一口气做出两款 iOS 应用和一个 Obsidian 插件 — vista8 · 2026-09-07
- 韩国头部游戏公司开放资产库,VARCO 3D 与 Sound 供 AI 调用 — arrakis_ai · 2026-09-07
- Qwen Code 发布 cua-driver v0.20.4:多平台预编译 CUA 驱动 — github-actions[bot] · 2026-09-07
- Spotify 用廉价模型分流大文件读取,Claude Code token 用量降 90% — aliscodes · 2026-09-07
- Matt Pocock:知识工作远比代码难被 Agent 自动化 — mattpocockuk · 2026-09-07