研究称语音AI话轮转换远逊人类 全双工模型仍不达标
人类对话中说话者衔接几乎零间隙、零重叠,这一反直觉现象被广泛引用,凸显语音交互系统在话轮转换上的巨大差距。一篇新的 benchmark 论文实测显示,现有最佳话轮预测模型既漏掉大量真实话轮结束点,也产生不少误判。此外,类似 gpt-realtime、ChatGPT App 的全双工音频模型虽在附和插话上更自然,但实际轮次切换体验仍难以拟人,整体均不达标。
2026-09-13 ~ 2026-09-13 · 3 条相关
- 人类对话为何几乎零间隙零重叠?语音 AI 难以复刻 — literalbanana · 2026-09-13
- 新论文实测:最佳话轮预测模型漏判多、误判也多,语音系统全不达标 — alexisgallagher · 2026-09-13
- 全双工语音模型仍难拟人:轮次切换预测器召回差、误判多 — alexisgallagher · 2026-09-13