AuK用30.3亿指令对统一语音生成编辑,四步推理快4.5倍

AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing

Ziyang Ma, Zhikang Niu, Wenming Tu, Tianrui Wang, Ruiqi Yan, Junxi Liu, Yanru Huo, Nickk Huang, Yang Liu, Qicong Xie, Zeyu Xie, Hui Wang, Haitao Li, Zixuan Jiang, Yalin Li, Jie Fang, Yifan Duan, Zeyue Tian, Guangzheng Li, Haina Zhu, Shuyi Wang, Jinwen Wang, Mingyu Cui, Tian Tan, Auden, Sen Liang, Steve Yves, Shan Yang, Liefeng Bo, Zilong Zheng, Kai Yu, Eng-Siong Chng, Xie Chen

cs.SD, cs.CL, cs.MM

2026-09-08

AuK把语音生成与五类编辑接到同一接口,Seed-TTS-Eval平均错误率2.65%,Flash四步推理快4.5倍。

这篇在解决什么

语音系统已经能做零样本克隆、指令合成、局部改词、改情绪、降噪、分离说话人,但这些能力散落在专用模型里。用户一次请求经常要串好几件事:按描述造一段声音、改掉半句话、把口音收一收、再把背景噪声拿掉。换模型、换接口,体验碎,训练也重复。

统一并不只是把任务列表拼起来。生成要从零造波形;内容编辑只能动指定区间;副语言和声学编辑必须保住语义;增强和分离要按指令决定留什么扔什么。条件也不一样:有的只有文本,有的要同时读指令和参考音频。评测更分裂,WER 和说话人相似度能自动打,开放式编辑还得看自然度、改动幅度、不该动的属性有没有被顺手改掉。AuK 把这五类能力收到同一套接口:自然语言指令加可选音频上下文,输出目标波形。

方法

数据按五大家族造,约 30.3 亿条指令音频对、195 万小时有效监督。生成占联合预训练 batch 的 28.10%,内容编辑 23.02%,增强分离 23.17%,副语言编辑 21.75%,声学编辑只有 3.96%。零样本 TTS 做成跨句、无转写的 in-context learning:同一说话人不同句子两两配对,prompt 只给波形不给文本,推理也不依赖 ASR。指令 TTS 用 Qwen3-Omni 给每条语音写自由描述。编辑侧大量是合成监督:声学属性用信号处理做确定变换;情绪、音色、去口音、非语言事件、内容填补分别调用 Qwen3-TTS、IndexTTS2、CosyVoice2、OmniVoice、F5-TTS、YingMusic-Singer-Plus 造配对。增强分离则把噪声、混响、信道损伤和多说话人重叠按指令做成「只去掉被点名的那一层」。

模型三件套。语义条件来自冻结的 Qwen2.5-Omni:各层 hidden state 做 LayerNorm 后用可学习标量加权求和,纯文本和带参考音频走同一编码器。声学条件来自 AuK-VAE:24 kHz 波形压到 64 维、50 Hz 的 latent,在约 300 万小时语音、音乐、通用音频上按 6:3:1 训了 124 万步。生成骨干是 FLUX 风格的整流流 Transformer,约 15 亿参数:10 层双流 MMDiT 让语义流和声学流做联合注意力但残差分开,再接 20 层单流 DiT 预测目标 latent 的速度场。MLLM 和 VAE 全程冻结,只训骨干和层融合权重。

训练分四段。先 5 万步只做生成热身,再 60 万步五类任务联合 flow matching,256 卡 ZeRO-2。后训练拆开:开放式编辑没有现成奖励模型,人工对每条指令打 10 或 20 个候选、三级分,筛完剩 818 组、9080 条,用 flow 版 DPO 分数加 LiPO 的 listwise 目标训 104 步;生成侧用 Flow-GRPO,零样本看 ASR 对错和说话人余弦,指令 TTS 另训一个基于 Qwen2.5-Omni-7B 的风格一致性裁判,500 步。最后用一致性蒸馏初始化,再做按任务路由的 Decoupled DMD:分离样本走干净 latent 回归,避免错误分离被教师场拉回混合物。得到的 AuK-Flash 走 4 步、不用 CFG,同等条件下墙钟快 4.5 倍(教师 32 次函数求值、CFG=2.0)。

自由文本请求还要过一层 Prompt Enhancer:ASR、任务路由、把语速音量映射到训练离散档、估时长。没有这层,模型吃不下任意措辞。

结果

VAE 重建在语音、AudioSet、MUSDB18-HQ 的 PESQ、STOI、Mel Dist、STFT 上全是第一。Seed-TTS-Eval 语音 PESQ 4.143,对位 MiniMax-H3-AudioVAE 的 3.633。

零样本 TTS(Seed-TTS-Eval,三次平均):

模型平均错误率↓平均 SIM↑
Qwen3-TTS3.07%0.745
Seed-TTS3.65%0.778
VoxCPM23.65%0.767
AuK-Flash2.85%0.790
AuK2.65%0.795

英文 WER 1.02%,中文 hard 子集 5.91%,都是对照表里最低。指令 TTS 的中文 DSD 83.37%,比 Qwen3-TTS-VD 高 2.27 个百分点;Flash 的英文 DSD 82.40%,与 Qwen3-TTS-VD 持平。中文 APS 83.28 低于 Qwen3-TTS-VD 的 85.20,英文 APS、角色扮演也没有全面超过。

编辑评测里,MMAE-Speech 开了 Prompt Enhancer。IFR/CR 为 48.23%/88.11%,相对最强基线 Step-Audio-EditX 分别高 4.71 和 10.84 个百分点;Flash 的 EMR 13.85%,相对 Ming-UniAudio 的 7.04% 接近翻倍,但「全部评分项同时过」仍然只有一成出头。SpeechEditBench 内容编辑 91.83% 对 Ming-UniAudio 的 76.46%,韵律 71.33% 对 26.50%;情绪编辑只有 9.94%,这块所有对照都低。Ming-Freeform 的 Full 设置上,中文平均 WER 从 10.46% 降到 3.09%,英文从 14.28% 降到 3.96%。

信号级任务能打,但不是全面占优。DNS Challenge 的 dWER 2.66%,低于 RE-USE 的 3.31%;CHiME-4 上 Flash 的 WER 7.84%、UTMOS 3.91。Libri2Mix 上 AuK 的 WER 9.12%,略好于专用分离模型 MossFormer2-SS 的 9.34%,SIM 同为 0.96。Flash 经常在 UTMOS 上更高,完整模型在内容正确率上更稳。

为什么重要

代码和权重挂在 Tencent Hunyuan 名下,是目前开源侧把 TTS、改词、改情绪口音、降噪分离接到同一骨干、并给出完整训练配方的报告。1.5B 骨干加冻结的 Omni 编码器,不是从零训一个巨型音频 LLM。能复现的部分更清楚:数据配方、课程、后训练怎么拆、蒸馏时分离任务为什么要单独路由。

对要做语音产品的人,价值主要在接口和 Flash。同一套「指令加可选参考音频」能覆盖克隆和编辑,Flash 四步无 CFG,延迟更接近能上线。跨句、无转写的克隆也省掉部署时再挂一个 ASR。

它仍然是渐进式的统一,不是新的生成范式。编辑监督大量来自 F5-TTS、IndexTTS2 等教师模型,上限会沾教师的分布。声学编辑只占 batch 的 3.96%。

局限与存疑

论文写得很直:自由措辞的编辑指令,模型原生跟不住,仍然依赖 Prompt Enhancer 做任务识别和改写。他们试过从 Audio-Oscar 改来的 agent 式 SFT,指令变多样了,泛化仍不够。这是能力和调用之间的缝。

人工偏好数据只有 818 组。开放式编辑的对齐规模偏小,EMR 13.85% 也说明「改对且别的都不动」仍然难。情绪编辑成功率个位数,和「统一模型什么都能改」对不上。

合成数据链路长。内容编辑用 F5-TTS 填局部,歌词用 YingMusic-Singer-Plus,去口音用 CosyVoice2 和 OmniVoice。质量门是 ASR WER,韵律不自然、语义擦边的样本可能系统性地漏进训练集。跨语言去口音、从编辑迁移出「直接生成气声」只是定性观察,没有正式测试集。

声学编辑的语速、音量相对误差并不比 Ming-UniAudio 好,有的还更差;表 3 的平均 WER 和 SIM 赢了,控制精度不一定赢。DNS Challenge 的 DNSMOS-OVRL 3.35,低于 AnyEnhance 的 3.41。统一模型在纯信号指标上经常把第一名让给专用系统,论文说 competitive 是准确的。

术语

原文与代码

社区讨论

相关论文

全部论文解读