全双工语音模型仍难拟人:轮次切换预测器召回差、误判多
alexisgallagher · x · 2026-09-13
作者指出,类似 gpt-realtime / ChatGPT App 的全双工(full duplex)音频模型虽然在 backchannel(附和插话)上更自然,但实际体验仍听不到人类那种「零间隙、可重叠」的轮次切换,也未见任何系统在多说话人场景下有像样表现。
他引用一篇近期基准论文:现有最佳轮次预测(turn prediction)系统表现仍然很差——真实话轮结束大量漏检(低召回),同时把许多停顿误判为话轮结束(高假阳性);且语料中人类对话的话轮间隙经常为负值,即因为话语重叠根本不存在间隙,这是现有系统难以处理的根本难点。
所属事件:研究称语音AI话轮转换远逊人类 全双工模型仍不达标(3 条相关)→
「模型」频道最新
- 争议:Anthropic 力推 METR 被指监管俘获,CoT 审计方法遭质疑 — sarahbmyers · 2026-09-14
- 曝 OpenAI GPT-6 Sol 泄露输出击败 Astra,内部更强模型 Bell 未公开 — VraserX · 2026-09-14
- Kevin Bass:中国模型已大幅追赶,美国不应减速而应扩大AI优势 — kevinnbass · 2026-09-14
- ARC-AGI-3 计分方式被指非标准,GPT-6 满分或系高估 — peterwildeford · 2026-09-14
- eigenrobot 横评 sol 与 astra:astra 更冷峻严密但不那么有趣 — eigenrobot · 2026-09-14
- 用户反映 GPT5.6 Sol 最近几天明显变笨 — VoidStateKate · 2026-09-14