TurnBench实测14套话轮系统,最佳EOT召回0.845仍慢于人类

TurnBench: A Multi-Domain Benchmark for Turn-Taking Dynamics in Spoken Dialogue

Freeman Jiang, Ramon Sanabria, Soham Deshmukh, Bandhav Veluri, Simon Michael Vuch Williams, Elliott K. Suen, Garreth Lee, Kevin Yoonho Choi, Takuya Umeki, Riku Kubo, Sathvik Udupa, Chien-yu Huang, Shih-Yun Shan Kuan, Zhuoyan Tao, Satyapriya Krishna, Sefik Emre Eskimez, Yu Tsao, Hung-yi Lee, Shinji Watanabe

eess.AS, cs.CL

2026-08-26

Sesame等机构发布TurnBench:30小时人工标注对话、六种交谈类型。14套系统里VAP最强,EOT召回0.845、中位延迟368ms,无人达到人类提前151ms接话的水平。

这篇在解决什么

口语对话系统要在几十到几百毫秒里决定:现在该接话、继续说,还是把话轮让出去。评测却一直对不齐。现有语料大多只有一种交谈类型,标注口径也不一样:Full-Duplex-Bench 系列把 backchannel(附和,不抢话轮的「嗯」「对」)、填充词和打断定义得很宽;Talking Turns 收得更紧,但只覆盖电话这一类语体。全双工模型还不直接输出话轮决策,只能从它发出的音频反推。结果是,论文里报的提升经常分不清是模型变好了,还是标注约定变了。

TurnBench 把交谈类型当成可操纵的实验变量,用同一套语言学标注和同一套打分协议,去测异构系统的话轮结束检测和打断检测。

方法

语料是 30 小时双通道双人对话:154 段、106 名配音演员、53 对,专业隔音棚、48 kHz。六种类型大致均衡(各占 13–21%):闲聊、任务导向、教学、协作、争辩、叙事。导演只给类型和起始话题,不提打断、附和、谁强势。另有 104 小时按同一协议标注的训练集,和评测说话人不相交。

标注员把 17 种细类标在时间上,评测时收成 7 个规范类,核心是 Turn、Interruption、Backchannel。每段三人独立标,规范类上 Fleiss κ 为 0.78;至少两人标签一致且端点差在 ±200 ms 内才进金标,端点取中位数。全库 85.8% 的标注事件留下来,重叠多的类型留存更低。金标给出 8,197 个话轮结束锚点和 1,151 个抢话轮打断锚点。

提交格式是每段对话、每个说话人的事件时间戳。打分器在金标前后窗口 \([t-0.25\,\mathrm{s},\,t+3.0\,\mathrm{s}]\) 里找最早未占用的预测,算召回、假阳性率和有符号延迟。排行榜按测试集召回排序,假阳性率超过 0.15 的排到所有达标系统后面。开发集用 0.1 的假阳性预算选工作点。

测了 14 套系统:能量门限 VAD、OpenAI Realtime 的 Server/Semantic VAD、Kyutai SVAD、SmartTurn v3、Voice Activity Projection(VAP,预测双方未来谁在说话)、Mimi 端点器、ESPnet 话轮预测、WavLM 变体,以及 Gemini 3.1 Live 和 Moshi 两个全双工模型。全双工只评话轮结束:把模型放进对话一侧,从它开口的时刻读决策,延迟里含生成和网络。

结果

人类在顺畅交接时,会在当前话轮结束前中位 151 ms 开始说话(含打断则是提前 281 ms)。没有任何一套在预算内的系统能做到同样早、同时不把假阳性打爆。

系统EOT 召回 / FPREOT 中位延迟INT 召回 / FPRINT 中位延迟
RMS VAD0.718 / 0.632−117 ms0.996 / 0.445123 ms
OpenAI Server VAD0.955 / 0.525282 ms0.990 / 0.458184 ms
OpenAI Semantic VAD0.303 / 0.018793 ms0.484 / 0.271196 ms
VAP0.845 / 0.055368 ms0.945 / 0.107994 ms
Kyutai SVAD0.773 / 0.0591007 ms0.898 / 0.081559 ms
Gemini 3.1 Live0.657 / 0.0221234 ms
Moshi0.233 / 0.044702 ms

预算内最强的是 VAP。话轮结束召回在六种类型上大致稳住,打断假阳性则强烈依赖类型:每种模型在闲聊上的打断 FPR 都高于争辩,闲聊附和最密。纯声学门限(RMS、OpenAI Server VAD)召回接近饱和,假阳性远超预算。带语义的端点器能进预算,但要在速度和选择性之间选边:SmartTurn v3 打断中位延迟 159 ms,召回只有 0.107;VAP 把打断拖到 994 ms 才敢拍板,召回 0.945。

为什么重要

做语音助手和全双工模型的人,终于有一套能把规则检测器、端点器、投影模型和闭源 Live API 放在同一张表上的协议。结论很具体:只看静音的 VAD 会把附和当抢话;要在附和里认出真打断,现有系统得等大约 1 秒。人类提前 151 ms 接话,这一条目前没有系统能在假阳性约束下追上。

六种类型是这篇的真正变量。只在电话语体或会议语体上调过的端点器,换到闲聊会假阳性暴涨。排行榜、开发集打分和带音频的对话查看器已经公开,测试集约 116 段不放标签。

局限与存疑

全部是英语、棚内、双人。多数表决会丢掉有信号的分歧,尤其是重叠发声该算话轮、打断还是附和。全双工模型没有打断评测方法,Gemini 的延迟还含网络。训练集和评测是非商用许可,禁止声音克隆。说话人是配音演员、尽可能预先认识,不是街头自然对话,类型是录之前指定的,外推到真实会议室或电话客服要打折。OpenAI 和 Gemini 的数字是 2026 年 6 月的一次快照,API 一改就会过时。

术语

原文与代码

社区讨论

相关论文

全部论文解读