GPT-Live-1 实测:语音自然但指令遵循频频翻车
kolchinski · reddit · 2026-09-14
一家做 AI 电话客服的公司(ThunderPhone)将 OpenAI 新发布的全双工语音模型 GPT-Live-1 接入真实电话线路,用约 1.3 万 token 的保险核保话术脚本进行了十余通真实来电和约 25 通模拟通话测试。
优点
- 迄今最自然的电话对话体验:单一连续音频流,电话端首音频延迟约 1.3 秒,无需自建 VAD 或轮次逻辑;打断、附和、句中纠错都原生支持。
B2B 场景的严重问题
- 过度字面化:提示词写「住房状态不对就问自有/租住/父母」,用户说「我现在是自有住房」,模型仍照读选项,所有提示词变体均无法修复。
- 「Yes」被当「No」处理:多次出现,导致重复追问或错误跳转。
- 压力下「自言自语」:会向用户说出「嗯,这个要小心处理,我先确认然后继续」之类的思考过程。
- 字母数字读错:回读理赔号时在音频中多读了一个字母(其自身转写正确);俄语中把 Q 读成 X(音频和转写都错)。
- 非英语流利但口音重:俄语和卢干达语带浓重美国口音,一次卢干达语来电被用斯瓦希里语应答。
作者(ThunderPhone 创始人)表示会在评论区附完整转写和音频片段,并询问其他人的使用体验。
所属事件:GPT-Live-1 真机实测:语音最自然但指令遵循常翻车(2 条相关)→
「模型」频道最新
- 让 Claude 不那么「Claude 味」有多难?工程师:最后只好搞语言学 — menhguin · 2026-09-14
- 回看 2019:OpenAI 曾因「太危险」拒绝公开 GPT-2 — timigod · 2026-09-14
- 实测对比:ChatGPT 迎合胡说,Claude 直接说「这话没意义」 — flowersslop · 2026-09-14
- Agent 轨迹数据集月下载超 5 万,作者猜被用于 SFT 与奖励作弊监测 — maksym_andr · 2026-09-14
- 作家实测:Gemini 查引文来源「稳定地」给错答案,两测两错 — danbri · 2026-09-14
- 开源插件 Astrable:让 GPT-6 Astra 指挥 Claude Fable 写代码 — daniel_mac8 · 2026-09-14