4.2 小时土耳其自然对话,遗传算法换话规则 F1 仅 57

Real-TurnTurk: A Multimodal Turkish Corpus for Turn-Taking Prediction

Ahmet Tuğrul Bayrak, Fatma Nur Korkmaz, Bekir Berker Türker, Mustafa Sertaç Türkel, Alper Kaplan

cs.CL, cs.AI

2026-08-23

11 段无剧本双人土耳其对话共 4.23 小时,遗传算法在视听语言特征上搜可解释换话规则,F1 57.0,只比永远预测换话高 7 分。

这篇在解决什么

语音对话系统仍大量靠静音门限判断用户说完没有。人说话停顿长短差很大,提前抢话会叠音,等太久又像卡死。土耳其几乎没有带真实换话标注的自然对话语料,现有资源偏情感分析或合成数据。Ata Technology Platforms 收了 11 段无剧本双人对话,做成 Real-TurnTurk,并用遗传算法在多模态特征上搜可解释规则,目标是实时系统能看懂、算得起的换话检测。

换话本来就不是单一线索。问完一个问题、音高掉下来、目光挪开,都可以单独触发让话。模型必须能表达「几条路都能到」。

方法

语料共 4.23 小时,同步 1080p 16 fps 视频、多数会话每人一条 48 kHz 音频、带毫秒级时间戳的转写。222.1 分钟在说话,非语音只占 12.4%。换话用半自动规则标:说话人变了、下一段至少 0.5 秒、不是填充词、文本长于 3 个字符。过滤后得到 1,750 个正例,再按会话时长分层抽 3,500 个负例,正例前后各空 1 秒防止泄漏。81.4% 的标注换话里有重叠语音,静音几乎帮不上忙。

每个候选点只看换话前 2 秒、当前说话人的 28 维特征:9 维脸(MediaPipe Face Mesh 加 Py-Feat)、12 维声学(openSMILE 的 eGeMAPSv02)、7 维语言(词长、音节、是否填充、是否疑问、句法完整度等)。听者那一侧的注视和点头没用上。

任务是二分类。染色体编码 3 到 7 条条件,每条带特征、阈值、比较符和 AND/OR,种群 500、最多 900 代,训练折 F1 当适应度。预测落在标注前后 0.5 秒内算对。交叉验证按会话切 5 折,避免同一段对话同时进训练和测试。两个枢纽说话人出现在每一折,说话人完全不相交做不到,报告数字应看成对未见说话人的上界。

结果

规则在测试折上平均精确率 46.1、召回 74.6、F1 57.0。

方法PrecisionRecallF1
永远预测换话33.3100.050.0
静音 1.0 s10.540.316.7
静音 2.0 s20.435.025.8
静音 3.0 s22.210.714.4
GA 规则46.174.657.0

相对「永远预测换话」,F1 只高 7 分。作者明确说 11 段对话上不做显著性声明。静音基线全面低于永远预测,因为语料里停顿少、重叠多。全量重训后的可读规则只有三条通路:词时长 ≥0.60 s 且能量变化率 ≥1.00;注视变化 ≥0.35 且平均基频 ≥120 Hz;当前词是填充且词时长 ≥0.80 s。28 维里只用了 5 维,视觉只贡献一条。

为什么重要

对要做土耳其或低资源全双工语音代理的人,价值主要在语料:分轨音频能把重叠算到人,标注把 backchannel 从正例里拿掉。规则本身是给实时系统看的,不是 SOTA 分类器。F1 57 说明可解释规则能过永远预测这条线,离能上线的抢话检测还早。

局限与存疑

说话人严重失衡:user 01 和 user 03 合计占 60.8% 的词、60.1% 的说话时间,且每段对话必有其一,说话人泄漏写进了数字。没有和 Random Forest、XGBoost 或 Transformer 对照,所以不知道可解释性代价有多大。没用听者视觉。负例 1:2 事先固定。子集已放到 Hugging Face,全文是否公开未写清。作者自己把 7 分优势写成上限,并计划换成平衡、非枢纽录制设计。

术语

原文与代码

相关论文

全部论文解读