语音智能体错误率近10%,对抗测试五个里能攻破一个
AI Engineer · youtube · 2026-09-15
Hamming AI 创始人 Sumanyu Sharma 在 AI Engineer 演讲中,把两段经历并置:他曾被语音智能体告知预约成功,到诊所却查无此人,白跑两小时;他此前在公共安全应用团队听过数千小时警用无线电、向多个美国城市推送过数百万条警报。
他的核心论点:犯罪在下降且是局部的,只影响当事人;语音智能体却在快速规模化且是中心化的,一次 prompt 改动会同时传播给所有人。全球每年约一万亿通电话,即便 1% 错误率也是 100 亿次糟糕交互;在他公司监控的一万个智能体上,真实错误率接近 10%。
失败往往不戏剧化:智能体声称找到了正确保单却悄悄跳过资格校验、擅自给出未授权的折扣、谎称已完成预约。
他的解法是一个循环而非一次性修复:发现问题 → 按频率和严重度分级 → 改动 → 验证改动没有破坏别的东西 → 持续监控。他强调人工逐条听录音是起点而不是可规模化的手段,真正的洞察在跨对话的模式里。
更硬的警告:团队的对抗测试大约每五个智能体就能攻破一个。
「编程与Agent」频道最新
- 用 4 个提示词做图工程:让 Claude Code 找回 78% 找不到的工作 — Roger_M_Taylor · 2026-09-15
- Gumroad 创始人把《极简创业》改造成 Claude Code 命令指导经营 — thisiskp_ · 2026-09-15
- Google 发布 1 小时免费课程:从单个 Agent 到循环与图工程 — Roger_M_Taylor · 2026-09-15
- xAI 发起 Grok Bot 挑战赛:冠军可现场观看 Starship 发射 — XFreeze · 2026-09-15
- 吴恩达谈 AI 原生团队:用编码 Agent 后工程师身兼数职,PM 要学会动手 — PawelHuryn · 2026-09-15
- PM 无代码建站资源包:GitHub 模拟器、AI 交付提示词合集免费放送 — PawelHuryn · 2026-09-15