小鹏把Qwen3-ASR音频塔砍两层,十项基准错误率从5.61%降到5.27%

X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation

Haojun Zhang, Yi Zou, Min Chen, Qize Yu, Lianrui Fan, Xini Ding, Hao Li, Shuchang Zhou, Xianming Liu, Shiyu Huang

cs.SD, cs.AI

2026-09-10

小鹏提出X-AuT:短探针选可恢复层,再用1.7B老师跨尺度蒸馏。Qwen3-ASR-0.6B音频塔从18压到16层,十项中英基准宏平均错误率从5.61%降到5.27%。

这篇在解决什么

语音大模型的音频编码器要对每一帧音频跑一遍,是流式、车载、端侧里 first-token 延迟的主要来源之一。整层砍掉 Transformer 块,架构整齐、部署也好做。代价是送进解码器的音频嵌入会错位,常见后果是提早吐结束符、大段漏转。

已有压缩路线多半在训练期做 LayerDrop、低秩分解,或只压解码器。小鹏面对的是已经训好的 Qwen3-ASR-0.6B:18 层音频塔、186.4M 参数。问题变成两件绑在一起的事。哪几层能在固定恢复预算里拿回来;恢复时既要对齐隐状态,又要对付学生自己滚出来的解码历史。静态重要性分数回答不了第二问,因为一层单独看着冗余,另一层被拿掉之后它可能突然关键。

方法

X-AuT 分三步:筛数据、选层、三阶段恢复。语言模型主干冻结,只训注意力上的 LoRA,蒸馏阶段再放开 tied 输出嵌入。

源库超过 28 万小时。每条带参考转写的样本,用 Qwen3-ASR-1.7B 和 Qwen3.5-Omni 再解一遍,按三方两两编辑距离分成九档一致性。正式实验全程只用最高档 class 1;Stage 2 再按来源重加权,把座舱查询和 AISHELL-4/5 抬上去。

选层不做静态打分。18→16 先去掉原第 1 和第 18 层。16→14 从同一份已恢复的 16 层检查点出发,用 0.3 epoch 的 LoRA 热身,在五个开发集上比单层和成对删除。成对恢复加不出来:{6,8} 是两个最强单删的组合,热身后 TER 7.78%,比选中的相邻对 {5,6}(6.93%)差 0.85 个百分点。

每个剪枝跳用同一套恢复,老师是 Qwen3-ASR-1.7B(24 层、隐宽 2048;学生 1024,中间用 256 维瓶颈 MLP 对齐):

提早 EOS 另有两道闸:tied 头可训练,生成设 minnewtokens=3。消融里两项一起用,开发集 TER 6.75%,空 rollout 窗口从 5 降到 0。

结果

十项公开中英基准等权宏平均,单次 seed 42,没有重复实验。

模型音频塔参数宏平均错误率
Qwen3-ASR-0.6B 18 层186.4M5.61%
X-AuT 16 层 Stage 2167.1M5.27%
X-AuT 14 层 Stage 2147.8M5.75%
自蒸馏 16 层 Stage 1167.1M8.45%
1.7B 老师 16 层 Stage 1167.1M5.55%
直接 18→14147.8M6.73%

16 层相对基线降 0.34 个百分点(相对 −6.1%)。CommonVoice 中文从 9.95% 到 8.12%,英文从 12.35% 到 10.50%,WenetSpeech-meeting 从 8.36% 到 7.06%。Tedlium 最差,升 0.44 点。14 层参数少 20.7%,宏平均 5.75%,比基线差 0.14 点;额外损失主要落在 Fleurs-en(+0.93)以及相对 16 层的 CommonVoice 英文和会议集。

老师尺度差得更明显。同样 16 层配方,1.7B 老师 Stage 1 均误 5.55%,用未剪的 0.6B 自蒸馏是 8.45%,十项全输。直接剪同样四层 {1,18,5,6} 均误 6.73%,渐进路径 5.75%。

车载 PPU 上 14 层编码器时延从 14ms 到 11ms(−21.4%),H800 从 88ms 到 78ms(−11.4%)。端到端只降 4.7% 和 2.6%,自回归解码占大头。

为什么重要

对要上车、上端侧的语音 LLM,这是一条从已有强模型往下压深度的配方:探针测可恢复性,大老师跨尺度对齐,再加一点学生自己生成历史上的蒸馏。16 层是更干净的工作点,错误率还低于原模型。14 层用约 0.14 点宏平均换 20.7% 音频塔参数。

别指望端到端延迟腰斩。编码器剪层只动了流水线前半段。

局限与存疑

主结果全部是单次运行。开发集每个基准只看 25 条做 checkpoint 选择,0.14 点这种差距没有置信区间。只覆盖 Qwen3-ASR 一家,候选层组合也有限。数据九档只用了 class 1。效率数字来自一次保留的基准输出,没有重复测量。自蒸馏对照还夹了 2048→1024 投影模块的差异,不能单独归因于老师能力。

术语

原文与代码

相关论文

全部论文解读