SteerDuplex监督微调将全双工语音转向通过率从21%拉到65%

SteerDuplex: Steerable Duplex Speech Dialogue Models

Utkarsh Tyagi, Ramaneswaran Selvakumar, Advait Gosai, Sonal Kumar, Nikhil Barhate, Isabell Sagar, Steven Li, Miheer Bavare, Daniel Quigley, Fabiola Tapia Carrillo, Jose M Patron E, Diego Macías Gutiérrez, Paul Song, Ramani Duraiswami, Dinesh Manocha, Yunzhong He

cs.AI, cs.CL

2026-09-11

Scale AI在Moshi全双工语音模型上做监督微调加两阶段强化学习,SteerBench音频转向全过率从20.55%升至65.10%;RL把打断后正确回应从72.5%拉到82.5%,但会过早让路。

这篇在解决什么

全双工语音对话模型一边听一边说,轮次交接、打断、附和已经能做。Moshi 把用户和助手两条音频流跟一条文本通道钉在同一时间轴上。卡住的是另一件事:用户口头要求改成讽刺语气、换成退休教授人设、放慢语速、换成某种口音时,模型经常继续用原来的嗓音往下讲。

Scale AI 和马里兰大学把这种能力叫 steerability,可转向性。它比普通指令跟随更苛刻:内容要对,声音也要对。同一套题、同一个 Gemini 3.6 Flash 裁判下,Moshi 的音频转向全过率只有 20.55%,已经能条件化音色和角色的 PersonaPlex 只有 16.44%。实时打断做得干净,不等于听得懂「你换成这个声音说话」。

方法

SteerDuplex 不换骨架,直接在公开的 Moshi 7B 上后训练。时间 Transformer 处理双音频流加文本,深度 Transformer 预测分层音频码。系统提示接到助手文本流前面,提示期间两条音频保持静音,提示 token 不进损失。

监督微调混了自然对话和定向合成:指令跟随、转向、双工交互、安全和推理。数据是 504,416 条音频记录加 65,675 条文本记录,采样质量按 88% / 12% 分配,音频时长合计 8,510.9 小时。小时数含重复素材。定向子集包括 25,000 条转向、20,000 条多轮指令、1,200 条双工、1,300 条六轮数学对话。

SFT 负责「说什么、怎么说」。时机交给两阶段强化学习。优化器用 GDPO:同一上下文的一组 rollout 里,每个奖励分量先各自标准化再加权相加,避免某一个标量把梯度吃掉。策略损失只走文本流动作,含表示静音帧的 padding token;音频码本没有直接 policy loss。

打断得分要求助手在被打断前已经在说话,堵住全程沉默拿让路分的捷径。转向评测用的参考音频量规不进这篇报告的 RL 目标。

评测基准 SteerBench 有 390 条口语提示、1,067 条人工二元量规(438 音频、629 文本),覆盖语气、人设、风格/口音、语速/长度。音频量规对照固定参考片段,文本量规看转写。音频转向全过率要求全部音频量规都过,样本全过率还要文本量规全过。四条过三条仍算失败。

结果

转向能力主要来自 SFT,不来自 RL。

模型SteerBench 音频转向全过率Audio MultiChallenge APRFDB-v2 任务均分VoiceBench 总分
Moshi20.55%3.98%2.5938.55
PersonaPlex16.44%6.64%2.6530.51
SteerDuplex-SFT65.10±1.13%13.64±0.28%4.1740.87±0.27

音频转向全过率比 Moshi 高 44.5 个百分点,Audio MultiChallenge 比 PersonaPlex 高 7 个百分点。样本全过率仍只有 32% 到 51.11%,语速/长度最差,人设最好。单条量规通过率 63.10%–77.03%,条款过了不等于任务做完。语音改口几乎做不成:Audio MultiChallenge 的 voice editing 全过率只有 2.56%,两个开源基线都是 0。

RL 改的是时机:

指标SFT+RL
干净源打断后正确回应72.5%82.5%
用户附和后续说71.4%80.6%
合成停顿抢话(越低越好)26.5%9%
SteerBench 量规通过率63.75%65.22%
AudioMC APR13.64%14.38%
VoiceBench40.8741.38
FDB-v2 任务均分4.174.17

FDB-v2 日用任务从 3.74 掉到 3.41,安全从 4.65 升到 4.81。合成打断的语义分从 3.94 滑到 3.88,接管延迟多 40 ms。用户附和时抢话从 9.1% 降到 4.8%,但日常任务里「考官还在说、自己已经停」的比例从 23.6% 升到 32.3%。时机变好,不等于每一种交互都变好。

单独开某一类奖励会训出空语音。96 条 held-out rollout 里,只优化文本量规留下 47 条空输出;只优化及时性留下 25 条空输出,双工诊断分为 0。拼在一起的复合奖励把空输出压到 4 条。第二阶段再往下训,打断奖励从 0.450 升到 0.793,用户附和后续说时长从 3.20 秒掉到 2.00 秒,已经低于 SFT 的 2.60 秒。

为什么重要

这篇把三件常被混在一起的事拆开了:说对内容、发出指定声音、在正确的时刻开口或闭嘴。PersonaPlex 已经能条件化音色和角色,SteerBench 上音频转向仍有八成过不了。控制接口和「听懂口语指令并改自己的嗓音」不是同一项能力。

SFT 是转向增益的主要来源。RL 修时机,同时把「用短回复或沉默刷分」写成可复现的失败模式。训全双工模型时,打断成功率必须和回答是否说完一起看。

落地预期要压低。骨架还是 Moshi 7B。VoiceBench 总分 40.87,对照 Gemini Live 的 63.01、GPT-4o Realtime 的 78.42。Audio MultiChallenge 全过率 13.64%。这是 backbone 内部的后训练改进,不是新的语音模型天花板。

局限与存疑

SteerBench 只覆盖受控英语请求和固定参考片段,不管跨语言、方言和录音条件。部分细粒度风格仍低于更强的开源基线。重复评测从大小不等的候选池里取三个最高分再平均,可能抬高分数;FDB-v1.5 每个 checkpoint 只解一次。监督数据里有 CANDOR 对话,官方 FDB-v1 的轮次和停顿题不能当泛化证据。

报告的 RL checkpoint 在部分 FDB-v2 场景里让路过早。单阶段对照更新步数更少,不能证明「分两阶段」本身带来优势。backbone、数据和奖励设计没有做消融,7B Moshi 的推理、声学表示和延迟就是这组成绩的上限。

裁判是软肋。音频参考量规依赖 LLM 对照目标片段,人工验证之后仍可能偏向那一种风格实现。人机一致性大约 76%(有参考音频)和 62%(无参考)。第二裁判研究在同一批生成上认为 RL 的轮次交接变差(Gemini −0.074,gpt-5.4-mini −0.059),主表却给出微小正差。SteerBench 和 AudioMC 没有第二裁判。复合奖励探针仍留下 4/96 条空输出;探针和正式 RL 跑不是同一套,方向一致:时机奖励单独看会撒谎。

术语

原文与代码

相关论文

全部论文解读