实时语音 AI 听得到情绪却不用:120 次测试 119 次照本宣科

Once_ina_Lifetime · reddit · 2026-08-25

论文《Real-Time Voice AI Hears but Does Not Listen》(arXiv:2606.26083)测试了 GPT Realtime 2、Gemini 3.1 Flash Live、Qwen3.5 Omni Plus/Flash 四个实时语音系统在「话语与语气矛盾」场景下的表现,例如「没事」配哭腔应追问却直接结束通话、「批准转账」配恐惧语气应上报却照批、「给我报名」配明显讽刺应识别非真实同意却照样注册。

关键发现:模型在诊断性提问下大多能正确识别声音中的情绪线索(四个模型中三个可靠检出悲伤/恐惧/讽刺),但这些感知并未影响实际决策——基础提示下 120 次运行中有 119 次仍按脚本执行。此外文本内容会压倒声学信号:意大利内容的澳音会被「听成」意大利口音,老人念儿童台词会被判断为儿童。

改提示词只能部分改善(诈骗场景略有变化)且不稳定,讽刺基本仍被忽略。论文将此称为实时语音 AI 的「情绪智能缺口」,对语音 agent 的评估方法(多基于转写文本、丢失情绪细节)也是挑战。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →