实时语音 AI 听得到情绪却不用:120 次测试 119 次照本宣科
Once_ina_Lifetime · reddit · 2026-08-25
论文《Real-Time Voice AI Hears but Does Not Listen》(arXiv:2606.26083)测试了 GPT Realtime 2、Gemini 3.1 Flash Live、Qwen3.5 Omni Plus/Flash 四个实时语音系统在「话语与语气矛盾」场景下的表现,例如「没事」配哭腔应追问却直接结束通话、「批准转账」配恐惧语气应上报却照批、「给我报名」配明显讽刺应识别非真实同意却照样注册。
关键发现:模型在诊断性提问下大多能正确识别声音中的情绪线索(四个模型中三个可靠检出悲伤/恐惧/讽刺),但这些感知并未影响实际决策——基础提示下 120 次运行中有 119 次仍按脚本执行。此外文本内容会压倒声学信号:意大利内容的澳音会被「听成」意大利口音,老人念儿童台词会被判断为儿童。
改提示词只能部分改善(诈骗场景略有变化)且不稳定,讽刺基本仍被忽略。论文将此称为实时语音 AI 的「情绪智能缺口」,对语音 agent 的评估方法(多基于转写文本、丢失情绪细节)也是挑战。
「模型」频道最新
- 网友实测:Minimax H3 用中文提问效果大幅提升,英文提示词或拖后腿 — apoke890 · 2026-08-25
- 疑似 Gemini 3.8 Flash 提前泄露,网友称谷歌兑现小模型更新承诺 — Last_Conclusion_8984 · 2026-08-25
- 只训练投影器即可扩展新模态,Llama 能力不退化 — rohanpaul_ai · 2026-08-25
- 只改一个词结果大不同,用户实测 AI 回答存性别偏差 — RecordingThis6802 · 2026-08-25
- Fal 推出微调版 H3 模型,推理栈优化实现极速 — isidentical · 2026-08-25
- SGL 推出 Qwen3.8-27B NVFP4 检查点,BF16 表头显著提效 — EAccelerate_42 · 2026-08-25