StepAudio 3 Gen Technical Report
Bin Lin, Bo Zhao, Boyang Wang, Boyang Zhang, Boyong Wu, Chao Yan, Chen Geng, Chen Wu, Cheng Yi, Chengli Feng, Chenglin Zhu, DanNi Wan, Daxin Jiang, Dongqing Pang, Fei Tian, Feng Tian, Future Li, Gang Yu, Guanglong Yang, Jia Peng, Jiahao Song, Jiamin Fan, Jiangjie Zhen, Jianzheng Gao, Jun Chen, Li Xie, Lifang Zhang, Lingli Ji, Liying Shi, Lun Cai, Min Xu, Na Wang, Peilin Li, Peng Yang, Pengfei Tan, Qingjian Lin, Ruijie Xiong, Runze Li, Shenghua Hu, Shi Qiu, Siqi Tu, Siyi Zhou, Tianjiao Deng, Wanying Lu, Weiming Niu, Wen Sun, WenWen Qu, Xiangyu Zhang, Xianwei Zhang, XiaoSu Su, Xing Chen, Xinyu Liu, Xuerui Yang, Yang Li, Yang Yang, Yechang Huang, Yibo Zhu, Yifan Zhang, Yiyang Xu, Yu Fu, Yu Luo, Yu Zhou, Yumang Wang, Yunzhou Ju, Yuxiang Yang, Zekai Liu, Zengwei Yao, Zhenwei Mou, Zheqi Dai, Zhiyue Wu, Zichao Zhou
cs.SD, eess.AS
2026-09-11
阶跃把语音、歌声、音乐和音效放进同一套 12.5Hz、16×2048 的共享 RVQ 离散自回归框架。中文 TTS 人感对打赢率 82.0%,InstructTTSEval 中英均分 85.2 和 77.7。
语音、音效、音乐、歌声一直分头建模。TTS 管可懂度和说话人,文生音管事件,文生乐管结构和音色。要在一条指令里把对白、笑声、背景乐和音效排进同一条时间轴,现成系统得拼好几套表示、条件和生成管线。
最近的统一方案多走连续潜空间加扩散或流匹配。另一路把音频切成离散单元,用语言模型做序列建模。离散路线跟 LLM 的词表、因果目标和交错上下文更合得来,但高保真 RVQ 每个时间帧有多层码本:沿时间轴摊平会把序列拉到用不了的长度,只留最粗的一层又丢掉声学细节。阶跃选了 time-depth 分解,并专门对付「把音频塞进预训练文本 LLM」时的两类干扰:多码本嵌入加和后的统计对不齐,以及 15 层残差损失把骨干梯度淹没。
系统两块。StepAudio Tokenizer 在 12.5Hz 把语音、音乐和通用音频编进共享的 16×2048 残差码空间,解码到 24kHz。做法沿 X-Codec:冻结的自监督编码器出语义特征,卷积编码器从波形出声学特征,通道拼接后再下采样,由同一套 RVQ 一起量化,每一层同时带着语义和声学。量化器用因子化余弦查找。为了流式,解码器全因果:Vocos 风格 Transformer 加 RoPE 和 25 帧滑窗注意力,ISTFT 头出波形,没有前瞻。
生成侧把第 0 层码本升进 LLM 词表,共 2048 个音频 token,主模型沿时间轴自回归预测这一层。每个音频帧的隐藏状态和第 0 层码,再喂给一个四层因果 Transformer,沿码本轴补完其余 15 层。完整 16 层交给 codec 解码。残差预测器的输出不回灌骨干,所以两边只在预测器收敛之后才联合训练。
输入侧 16 张嵌入表的向量先加和,再过 RVQ Adaptor:按 token 作用的、零初始化残差模块,只加在音频位置上。文本位置完全不碰这条通路。Adaptor 零初始化保证起步时是恒等映射。
预训练四段,大约 2.7T token。Stage 1 冻骨干,只训音频嵌入和 Adaptor,做 ASR 和对齐。Stage 2 解冻,音频理解与文本 1:1 混训,仍不监督音频目标。Stage 3 引入生成,文本、TTS、交错对话按 3:1:2 混合,文本仍占一半;残差预测器对隐藏状态 stop-gradient,15 层声学损失先只训预测器。Stage 4 解开梯度,残差损失权重 λ 从 1.0 降到 0.1,上下文从 16,384 拉到 32,768,约 44 分钟音频。从 Stage 2 起每步一半算力给文本。Tokenizer 先在约 70 万小时上训,再冻编码器只打磨解码器。
指令格式三个槽:ROLE 管说话人身份和音色,DIRECTOR 管场景和意图,SCRIPT 按时间轴排对白和「音效/音乐」标记。后训练约 5000 小时全参 SFT,再用 GRPO:每条指令采样 16 条候选,音频理解模型出 caption,文本 LLM 打 0–100 一致性分,有转写的样本再乘 CER/WER 惩罚,识别错误超过 0.5 则奖励直接归零。
RVQ Adaptor 在预训练后全面抬升音频语言能力:
| 设置 | AISHELL-1 CER | LibriSpeech WER | MMAU Acc. | SpeechMMLU T2S |
| 无 Adaptor | 5.25% | 6.00% | 40.70% | 12.13% |
| 有 Adaptor | 3.00% | 3.41% | 51.70% | 58.76% |
CoVoST 英译中 BLEU 从 12.05 到 30.56,中译英从 5.99 到 18.59。
干扰感知预训练相对三阶段基线,文本能力留得更住:MMLU 69.20 对 64.99,MATH 45.07 对 36.62,HumanEval Pass@1 54.27 对 47.56。
TTS 只做人感主观对打,一共 1500 场中文 pairwise。StepAudio 3 Gen 的 Elo 是 1755.33,对 Qwen-Audio-3.0-TTS-Plus、豆包、MiniMax-Speech-2.8-HD、Inworld-TTS-2、StepAudio 2.5 TTS 合计赢率 82.0%,单对手从 73.0% 到 90.0%。报告刻意不报 CER 和说话人相似度,理由是这两项测不出节奏和即兴口吻。
语音设计走完整 InstructTTSEval,6000 条,由 Gemini 3.1 Pro 判风格一致性。中文均分 85.2,对照 Qwen3-TTS-12Hz-1.7B-VoiceDesign 的 74.0;英文 77.7,对照 73.5。盲听 490 场 Elo 1668.5,合计赢率 75.5%。歌声、音乐、音效和 vibe speech 只有能力展示,没有对照表。
对要做统一音频 LLM 的人,这篇把三个工程选择写清楚了:用 time-depth 而不用 MusicGen 那种 delay pattern,因为后者会逼预训练 LLM 直接预测所有残差层;Adaptor 用零初始化残差,不另接一段序列编码器;生成阶段先断开残差梯度,避免 15 层求和把骨干冲掉。离散自回归可以不接扩散声码器就覆盖多域,但这是阶跃自己的栈,2.7T token 加自研 tokenizer,外面很难原样复现。TTS 人感赢了几家商用系统,音乐和音效还停在 demo。
报告没有 Limitations 节。TTS 人评只有中文,每个对手只用一个音色。语音设计的客观分由 Gemini 3.1 Pro 打,评判模型本身会偏。歌声、超过 60 秒的器乐、复合声场都没有定量对照。骨干 LLM 的参数量没写。残差预测器不回灌,帧内声学细节帮不上下一帧的规划。SFT 里音乐和部分歌声用自家 Music Model 合成,存在自我强化。GRPO 的奖励链是「理解模型出 caption,再由文本 LLM 打分」,跟生成模型同家族时容易近亲。