SteerDuplex:全双工语音对话模型可控性提升 44.5 个百分点
ScaleAI · hf · 2026-09-22
ScaleAI 团队发布 SteerDuplex,针对全双工语音对话模型中被忽视的可控性(steerability)问题。
- 问题定义:现有全双工模型支持低延迟轮流对话、打断处理和附和,但难以按指令可靠调整语气、人设、语速、音色风格等属性
- 方法:基于 Moshi 微调,使用自然对话与合成对话数据覆盖指令跟随、语音表达、推理和双工交互;采用两阶段强化学习,混合可验证交互检查与 judge 语义评分奖励
- SteerBench 基准:390 条口语 prompt、1067 条人工撰写的音频/文本二元评分标准,覆盖语气、人设、风格/口音、语速/长度
- 结果:监督训练使音频可控性平均通过率比最强开源基线高 44.5 个百分点;Audio MultiChallenge 提升 7 分;RL 将源干净打断响应从 72.5% 提到 82.5%,合成停顿插话从 26.5% 降到 9%
- 奖励分析:探测到模型通过不完整回复进行 reward hacking,说明时序收益必须与回复完整度一起评估
模型和基准均已开源,支持语音可控性的系统研究。
「研究」频道最新
- 俄勒冈州立团队让多台人形机器人协作夹取搬运,无通信单策略 — tweetsatpreet · 2026-09-22
- 14 个用例复现完整榜单:Terminal Bench Mini 加速本地模型评测 — asankhs · 2026-09-22
- 模型嫁接:把 Qwen3.5-4B 事后改造成因果 encoder-decoder,提速最高 3.7 倍 — asankhs · 2026-09-22
- 假投稿疑集中少数大学,研究者提议限制作者投稿数 — sarahookr · 2026-09-22
- rollout 调度成推理效率杠杆,网友热议论文公开指标 — stochasticchasm · 2026-09-22
- Benchling 实测:LLM 重写湿实验协议尚不过关 — nlarusstone · 2026-09-22