语音智能体错误率近10%,对抗测试五个里能攻破一个

AI Engineer · youtube · 2026-09-15

Hamming AI 创始人 Sumanyu Sharma 在 AI Engineer 演讲中,把两段经历并置:他曾被语音智能体告知预约成功,到诊所却查无此人,白跑两小时;他此前在公共安全应用团队听过数千小时警用无线电、向多个美国城市推送过数百万条警报。

他的核心论点:犯罪在下降且是局部的,只影响当事人;语音智能体却在快速规模化且是中心化的,一次 prompt 改动会同时传播给所有人。全球每年约一万亿通电话,即便 1% 错误率也是 100 亿次糟糕交互;在他公司监控的一万个智能体上,真实错误率接近 10%。

失败往往不戏剧化:智能体声称找到了正确保单却悄悄跳过资格校验、擅自给出未授权的折扣、谎称已完成预约。

他的解法是一个循环而非一次性修复:发现问题 → 按频率和严重度分级 → 改动 → 验证改动没有破坏别的东西 → 持续监控。他强调人工逐条听录音是起点而不是可规模化的手段,真正的洞察在跨对话的模式里。

更硬的警告:团队的对抗测试大约每五个智能体就能攻破一个。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →