Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners
Umberto Cappellazzo, Xubo Liu, Stavros Petridis, Maja Pantic
eess.AS, cs.AI, cs.SD
2026-08-20
帝国理工与 Surrey 提出 NAPE:用因果 Transformer 预测下一块谱图 embedding,不做重建、不分词、不要教师网络。NAPE-L 在 AudioSet-2M 打到 50.2 mAP,与 88M 的 SSLAM 持平,情绪识别到 68.8%。
音频自监督这些年一直在跟视觉学招式:掩码重建谱图,或者学生-教师蒸馏。想把分数再往上推,配方就越堆越重。重建解码器、声学 tokenizer、EMA 教师、多码本量化、辅助正则,BEATs、EAT、SSLAM 都走这条路。
语言建模和最近的视觉表征换了一条接口:别把编码器当成静态特征提取器,让它预测下一个离散 token 或连续 embedding。音频本来就按时间展开,本该最适合这条因果目标,但音频 SSL 里几乎没人做过「预测下一块 embedding」。帝国理工和 Surrey 的 NAPE 问的是:把预训练砍到只剩因果掩码和 stop-gradient,还能不能打进第一梯队。
16 kHz 单声道波形转成 128 维 log-mel,10 秒对应 128×1008,再切 16×16 不重叠块,得到 504 个 patch。Conv2d 投到 d 维。因果 Transformer 只能吃一维序列,扫描顺序会决定每一步的「过去」是什么。raster 先扫时间再换频率,diagonal 沿反对角线混着走,time-major 先穷尽一个时间柱的全部频率。后一种全面落后,因为序列前段几乎没有时间上下文。主结果同时报 raster 和 diagonal。
编码器是带因果注意力的 ViT,RoPE 在频率轴和时间轴分开加,再配 LayerScale 和 query-key 归一化。三个尺度:Small 19M、Base 85M、Large 303M。上面接一个约 1.8M 参数的 SimSiam 风格三层 MLP,把表征空间和预测空间拆开。损失是预测向量与目标向量的负余弦相似度,目标侧 stop-gradient。
三件事同时成立,训练才稳:
去掉移位或 stop-gradient,预训练直接发散。去掉因果掩码能训下去,但 AS-2M 从 49.6 掉到 41.8 mAP,ESC-50 从 94.2% 掉到 68.9%,损失会在大约 2000 步里饱和到 -1,模型在抄答案。
下游微调关掉因果掩码,改双向注意力,在均值池化 token 上接线性头。附录里因果+last token 只比双向差 0.2 mAP,所以主表用双向主要是习惯对齐,不是能力悬崖。AudioSet 微调仍保留 SpecAugment、Mixup、CutMix 和权重 EMA。预训练极简,迁移协议没有跟着变瘦。
无标签预训练用 AudioSet,约 196 万 unbalanced 片段加 2.1 万 balanced。基线数字摘自各家原论文,不是同一套复现。
| 方法 | 参数 | AS-2M | AS-20K | ESC-50 | IEMOCAP |
| Audio-MAE | 86M | 47.3 | 37.1 | 94.1 | - |
| BEATs iter3 | 90M | 48.0 | 38.3 | 95.6 | 64.5 |
| SSLAM | 88M | 50.2 | 40.9 | 96.2 | - |
| NAPE-B diagonal | 85M | 49.7 | 39.2 | 94.8 | 67.1 |
| NAPE-L raster | 303M | 50.2 | 40.5 | 96.0 | 68.0 |
| NAPE-L diagonal | 303M | 50.0 | 40.4 | 96.2 | 68.8 |
同参数量级,NAPE-B 仍落后 SSLAM:AS-2M 差 0.5,AS-20K 差 1.7。NAPE-L 用 303M 打平 SSLAM 的 50.2,AS-20K 仍差 0.4。情绪识别是更清楚的超额,IEMOCAP 上 NAPE-L diagonal 68.8%,比 BEATs 的 64.5% 高 4.3 点;Base 对角扫描已经 67.1%。关键词检测顶在 98% 附近,区分度不大。
线性探测弱一截。最好探针层在网络中部(Small 第 2 层、Base 第 6 层、Large 第 11 层),NAPE-L 在 AS-2M 只有 27.1 mAP,AS-20K 20.4。顶层再差 3 到 5 个点,更像在专精「下一块」这个预训练目标。注意力图里,查询块会同时看当前时间柱的全频谱,以及同一 mel 频带更早的历史,这是因果目标自己长出来的结构。
给音频 SSL 留了一个极简对照:不用 tokenizer、不用 EMA 教师、不用重建解码器,单靠因果下一 embedding,微调分类就能摸到当前重配方的分数带。要做音频基础编码器、又嫌混合物监督和学生-教师太重,NAPE 是更干净的起点。
同尺寸它并没有赢过 SSLAM。把它写成「更简单所以更强」不准确,更接近「更简单也能走到同一张桌子」。线性探测和微调的落差也说明,冻住特征直接用并不划算,还得把注意力改双向、再加增强。
论文没有单独写 Limitations。设定里能直接读出来的有几条。
「极简」只覆盖预训练。AudioSet 微调仍用权重 EMA 和一整套谱增强,端到端并不瘦。NAPE-L 打平 SSLAM 时参数大约是对方的 3.4 倍,同尺寸对照并不占优。基线未统一复现,0.4 mAP 解释不了训练细节差异。只在 AudioSet 上预训练,没有 LibriSpeech 这类语音数据,IEMOCAP 的优势有多少来自目标、有多少来自规模,拆不开。关键词任务已经饱和。目标是表征不是生成,它不会合成下一段音频。