Real-TurnTurk: A Multimodal Turkish Corpus for Turn-Taking Prediction
Ahmet Tuğrul Bayrak, Fatma Nur Korkmaz, Bekir Berker Türker, Mustafa Sertaç Türkel, Alper Kaplan
cs.CL, cs.AI
2026-08-23
11 段无剧本双人土耳其对话共 4.23 小时,遗传算法在视听语言特征上搜可解释换话规则,F1 57.0,只比永远预测换话高 7 分。
语音对话系统仍大量靠静音门限判断用户说完没有。人说话停顿长短差很大,提前抢话会叠音,等太久又像卡死。土耳其几乎没有带真实换话标注的自然对话语料,现有资源偏情感分析或合成数据。Ata Technology Platforms 收了 11 段无剧本双人对话,做成 Real-TurnTurk,并用遗传算法在多模态特征上搜可解释规则,目标是实时系统能看懂、算得起的换话检测。
换话本来就不是单一线索。问完一个问题、音高掉下来、目光挪开,都可以单独触发让话。模型必须能表达「几条路都能到」。
语料共 4.23 小时,同步 1080p 16 fps 视频、多数会话每人一条 48 kHz 音频、带毫秒级时间戳的转写。222.1 分钟在说话,非语音只占 12.4%。换话用半自动规则标:说话人变了、下一段至少 0.5 秒、不是填充词、文本长于 3 个字符。过滤后得到 1,750 个正例,再按会话时长分层抽 3,500 个负例,正例前后各空 1 秒防止泄漏。81.4% 的标注换话里有重叠语音,静音几乎帮不上忙。
每个候选点只看换话前 2 秒、当前说话人的 28 维特征:9 维脸(MediaPipe Face Mesh 加 Py-Feat)、12 维声学(openSMILE 的 eGeMAPSv02)、7 维语言(词长、音节、是否填充、是否疑问、句法完整度等)。听者那一侧的注视和点头没用上。
任务是二分类。染色体编码 3 到 7 条条件,每条带特征、阈值、比较符和 AND/OR,种群 500、最多 900 代,训练折 F1 当适应度。预测落在标注前后 0.5 秒内算对。交叉验证按会话切 5 折,避免同一段对话同时进训练和测试。两个枢纽说话人出现在每一折,说话人完全不相交做不到,报告数字应看成对未见说话人的上界。
规则在测试折上平均精确率 46.1、召回 74.6、F1 57.0。
| 方法 | Precision | Recall | F1 |
| 永远预测换话 | 33.3 | 100.0 | 50.0 |
| 静音 1.0 s | 10.5 | 40.3 | 16.7 |
| 静音 2.0 s | 20.4 | 35.0 | 25.8 |
| 静音 3.0 s | 22.2 | 10.7 | 14.4 |
| GA 规则 | 46.1 | 74.6 | 57.0 |
相对「永远预测换话」,F1 只高 7 分。作者明确说 11 段对话上不做显著性声明。静音基线全面低于永远预测,因为语料里停顿少、重叠多。全量重训后的可读规则只有三条通路:词时长 ≥0.60 s 且能量变化率 ≥1.00;注视变化 ≥0.35 且平均基频 ≥120 Hz;当前词是填充且词时长 ≥0.80 s。28 维里只用了 5 维,视觉只贡献一条。
对要做土耳其或低资源全双工语音代理的人,价值主要在语料:分轨音频能把重叠算到人,标注把 backchannel 从正例里拿掉。规则本身是给实时系统看的,不是 SOTA 分类器。F1 57 说明可解释规则能过永远预测这条线,离能上线的抢话检测还早。
说话人严重失衡:user 01 和 user 03 合计占 60.8% 的词、60.1% 的说话时间,且每段对话必有其一,说话人泄漏写进了数字。没有和 Random Forest、XGBoost 或 Transformer 对照,所以不知道可解释性代价有多大。没用听者视觉。负例 1:2 事先固定。子集已放到 Hugging Face,全文是否公开未写清。作者自己把 7 分优势写成上限,并计划换成平衡、非枢纽录制设计。