StepAudio 3 Realtime Technical Report
Bin Lin, Bo Zhao, Boyang Zhang, Boyong Wu, Chao Yan, Chen Geng, Chen Wu, Cheng Yi, Chengli Feng, Chenglin Zhu, Chengting Feng, Chengyuan Yao, Daijiao Liu, DanNi Wan, Daxin Jiang, Dongjian Li, Dongqing Pang, Fei Tian, Feng Tian, Future Li, Gang Yu, Guanglong Yang, Haoyang Zhang, Hongyuan Wang, Jia Peng, Jiahao Song, Jialong Xue, Jiamin Fan, Jiangjie Zhen, Jianzheng Gao, Jincheng Wen, Jinghua Liang, Jinglan Gong, Jun Chen, Li Xie, Liang Zhao, Lifang Zhang, Lingli Ji, Lun Cai, Min Xu, Peilin Li, Peng Yang, Pengfei Tan, Qingjian Lin, Qinxin Du, Ruijie Xiong, Runze Li, Shenghua Hu, Shengqian Qin, Shi Qiu, Siqi Tu, Siyi Zhou, Tianjiao Deng, Wanying Lu, Weiming Niu, Wen Sun, WenWen Qu, Xiangyu Zhang, Xianwei Zhang, Xiaosu Su, Xing Chen, Xinyu Liu, Xuerui Yang, Yan Wu, Yang Li, Yang Yang, Yechang Huang, Yibo Zhu, Yifan Zhang, Yinuo Yan, Youjun Chen, Yu Fu, Yu Luo, Yu Zhou, Yujie Chen, Yumang Wang, Yunzhou Ju, Yuxiang Yang, Yuxin Li, Yuxin Zhang, Zekai Liu, Zengwei Yao, Zhaoxin Yuan, Zhenwei Mou, Zhiquan Zhang, Zhiyue Wu, Zichao Li, Zichao Zhou, Ziqi Ren, Zixuan Wang
cs.SD, eess.AS
2026-09-12
阶跃推出 1960 亿 MoE 实时语音模型 StepAudio 3,用 Think-While-Speaking 把推理藏进说话过程。全双工 98.9 压过 Qwen,MMSU 90.6;实时对话宏均 70.4,接近专用推理模型。
实时语音对话要同时做好三件事:听懂用户在说什么、在合适的时机接话或让路、遇到复杂问题还能想清楚。过去的系统往往把这三件事拆开。ASR 负责听,LLM 负责想,TTS 负责说;全双工能让听和说重叠,但一进入长推理就卡顿。工具调用更麻烦,查天气还好,改一张机票可能比这句话还长。
阶跃 StepAudio 3 Realtime 把拆开的流水线收成一条持续转的环:听、聊、想、动手。深度思考和低延迟互相抢时间,这篇用 Think-While-Speaking 把推理塞进说话过程里并行跑。
模型是约 1960 亿总参数、每 token 激活 110 亿的 MoE,语言骨干来自 Step 3.7 Flash,音频前端用 Qwen3-Omni 的 Audio Transformer,经 adapter 接到 LLM。预训练分模态对齐、多模态混合、cooldown 三阶段,序列长度 32K,共 1.2T token,文本占比刻意留高,以免把底座的推理能力冲掉。中训把上下文拉到 128K,并加大音频理解和语音 agent 数据。
四个能力叠在同一条时间线上。
能力整合没有另加路由。四个教师模型分别偏重多轮对话、音频理解、文本推理和混合域,最后按 3:1:1:1 做参数加权平均。
ASR Max 在公开集上很稳。LibriSpeech test-clean WER 1.18,低于 Doubao 2.0 ASR 的 2.94、Seed 2.0 Lite 的 1.47、HY3.0 ASR Preview 的 1.38;AISHELL-1 CER 0.49,四家里最低。WenetSpeech test-net 3.99、test-meeting 4.35,这两项略落后 HY3.0 的 3.71 和 4.12。ContextASR-Bench 不注入热词时,英文宏均错误率 5.67%、中文 1.23%,相对 HY3.0 的 6.60% 和 1.69%。这组数字只描述 ASR 专用分支,不是实时对话模型的转写水平。
音频理解八项宏均 81.3,距 Gemini 3.1 Pro 的 81.8 只差 0.5。MMSU 90.6 对 83.6,MMAR 86.5 对 81.7,拉开最大。AudioMultiChallenge 只有 49.3,Gemini 3.1 Pro 是 67.0,多轮约束跟不住。SFT 从约 200 万随机样本收到约 10 万高质量样本后,MMSU 从 78.78 升到 89.70,MMAR 从 74.70 升到 84.50,数据质量比堆量更管用。
全双工 Artificial Analysis 子集 Overall 98.9,压过 Qwen Audio 3.0 Realtime Plus 的 98.4 和 GPT-realtime-2 High 的 95.3。话轮 100.0,打断 99.0,停顿 98.9,附和 98.0。
| 设置 | 指标 | 结果 |
| ASR Max vs HY3.0 | LibriSpeech test-clean WER | 1.18 vs 1.38 |
| Realtime vs Gemini 3.1 Pro | MMSU | 90.6 vs 83.6 |
| Realtime vs Qwen Audio 3.0 RT Plus | Full-Duplex Overall | 98.9 vs 98.4 |
| Realtime vs Grok Voice | τ-Voice 宏均成功率 | 56.0% vs 56.5% |
对话基准 StepAudioChat 是自家封闭文本评测,用来把「会不会聊、会不会想」从韵律和抢话里拆出来。推理模式宏均 73.0,高于 Doubao 70.5 和 DeepSeek-V4-Flash 71.4,低于 Kimi K3 的 77.1。套上 Think-While-Speaking 的实时模式宏均 70.4,跟 Doubao 的推理模式几乎持平,但指令遵循从推理模式的 66.3 掉到 54.1。τ-Voice 电信 70.2 是四家里最高,零售只有 37.7,Grok 是 49.7。文本侧 HMMT 2026 Feb 86.8,略高于 Gemini 3 Flash 的 85.9;GPQA Diamond 83.0 对 90.3。
Adaptive Thinking 把显式推理调用率压到 51.5%–82.0%,推理分却从全开思考的 71.89 掉到 66.80:思考次数少了,并不等于预算分给了最需要的题。MTP3 配合宽松接受,墙钟大约 2.05 倍;第五个头的严格边际接受率只有 5.7%,加头收益很快见顶。
做语音产品的人最关心的往往不是「会不会说话」,是「能不能边说边想,还不把附和当成打断」。这篇把 Think-While-Speaking 写成可复述的双脑调度,并给出和专用推理模型接近的对话分数,说明低延迟和深度推理可以并行,不必二选一。全双工 98.9 和 MMSU 90.6 是能拿去对标竞品的硬数字。
它仍是一份技术报告,不是开源权重。教师合并、自家封闭基准、Adaptive Thinking 的分配失误,都说明这是一套能打但还在调的系统。指令遵循在实时模式下掉了十多分,谁要把这套接进客服,这一项比全双工分数更值得盯。
论文自己点名:多轮约束跟随落后 17.7 分、零售工具任务弱、Adaptive Thinking 分配不均。实时模式指令遵循掉了 12 分以上,边说边想会牺牲遵旨。
StepAudioChat 是封闭基准,外部无法复核题目。全双工和 τ-Voice 走 Artificial Analysis 的实现,和自家表格口径绑在一起。ASR 数字来自专用 ASR Max,不能直接当成实时对话模型的转写水平。1960 亿 MoE 的推理成本、首包延迟、并发容量,正文几乎没给。合并后的对话宏均 73.0,仍低于最强教师的 74.2,加权平均换来的是均衡,不是每一项都变强。