砍掉重建和教师网,NAPE 用下一谱块预测摸到 50.2 mAP

Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners

Umberto Cappellazzo, Xubo Liu, Stavros Petridis, Maja Pantic

eess.AS, cs.AI, cs.SD

2026-08-20

帝国理工与 Surrey 提出 NAPE:用因果 Transformer 预测下一块谱图 embedding,不做重建、不分词、不要教师网络。NAPE-L 在 AudioSet-2M 打到 50.2 mAP,与 88M 的 SSLAM 持平,情绪识别到 68.8%。

这篇在解决什么

音频自监督这些年一直在跟视觉学招式:掩码重建谱图,或者学生-教师蒸馏。想把分数再往上推,配方就越堆越重。重建解码器、声学 tokenizer、EMA 教师、多码本量化、辅助正则,BEATs、EAT、SSLAM 都走这条路。

语言建模和最近的视觉表征换了一条接口:别把编码器当成静态特征提取器,让它预测下一个离散 token 或连续 embedding。音频本来就按时间展开,本该最适合这条因果目标,但音频 SSL 里几乎没人做过「预测下一块 embedding」。帝国理工和 Surrey 的 NAPE 问的是:把预训练砍到只剩因果掩码和 stop-gradient,还能不能打进第一梯队。

方法

16 kHz 单声道波形转成 128 维 log-mel,10 秒对应 128×1008,再切 16×16 不重叠块,得到 504 个 patch。Conv2d 投到 d 维。因果 Transformer 只能吃一维序列,扫描顺序会决定每一步的「过去」是什么。raster 先扫时间再换频率,diagonal 沿反对角线混着走,time-major 先穷尽一个时间柱的全部频率。后一种全面落后,因为序列前段几乎没有时间上下文。主结果同时报 raster 和 diagonal。

编码器是带因果注意力的 ViT,RoPE 在频率轴和时间轴分开加,再配 LayerScale 和 query-key 归一化。三个尺度:Small 19M、Base 85M、Large 303M。上面接一个约 1.8M 参数的 SimSiam 风格三层 MLP,把表征空间和预测空间拆开。损失是预测向量与目标向量的负余弦相似度,目标侧 stop-gradient。

三件事同时成立,训练才稳:

去掉移位或 stop-gradient,预训练直接发散。去掉因果掩码能训下去,但 AS-2M 从 49.6 掉到 41.8 mAP,ESC-50 从 94.2% 掉到 68.9%,损失会在大约 2000 步里饱和到 -1,模型在抄答案。

下游微调关掉因果掩码,改双向注意力,在均值池化 token 上接线性头。附录里因果+last token 只比双向差 0.2 mAP,所以主表用双向主要是习惯对齐,不是能力悬崖。AudioSet 微调仍保留 SpecAugment、Mixup、CutMix 和权重 EMA。预训练极简,迁移协议没有跟着变瘦。

结果

无标签预训练用 AudioSet,约 196 万 unbalanced 片段加 2.1 万 balanced。基线数字摘自各家原论文,不是同一套复现。

方法参数AS-2MAS-20KESC-50IEMOCAP
Audio-MAE86M47.337.194.1-
BEATs iter390M48.038.395.664.5
SSLAM88M50.240.996.2-
NAPE-B diagonal85M49.739.294.867.1
NAPE-L raster303M50.240.596.068.0
NAPE-L diagonal303M50.040.496.268.8

同参数量级,NAPE-B 仍落后 SSLAM:AS-2M 差 0.5,AS-20K 差 1.7。NAPE-L 用 303M 打平 SSLAM 的 50.2,AS-20K 仍差 0.4。情绪识别是更清楚的超额,IEMOCAP 上 NAPE-L diagonal 68.8%,比 BEATs 的 64.5% 高 4.3 点;Base 对角扫描已经 67.1%。关键词检测顶在 98% 附近,区分度不大。

线性探测弱一截。最好探针层在网络中部(Small 第 2 层、Base 第 6 层、Large 第 11 层),NAPE-L 在 AS-2M 只有 27.1 mAP,AS-20K 20.4。顶层再差 3 到 5 个点,更像在专精「下一块」这个预训练目标。注意力图里,查询块会同时看当前时间柱的全频谱,以及同一 mel 频带更早的历史,这是因果目标自己长出来的结构。

为什么重要

给音频 SSL 留了一个极简对照:不用 tokenizer、不用 EMA 教师、不用重建解码器,单靠因果下一 embedding,微调分类就能摸到当前重配方的分数带。要做音频基础编码器、又嫌混合物监督和学生-教师太重,NAPE 是更干净的起点。

同尺寸它并没有赢过 SSLAM。把它写成「更简单所以更强」不准确,更接近「更简单也能走到同一张桌子」。线性探测和微调的落差也说明,冻住特征直接用并不划算,还得把注意力改双向、再加增强。

局限与存疑

论文没有单独写 Limitations。设定里能直接读出来的有几条。

「极简」只覆盖预训练。AudioSet 微调仍用权重 EMA 和一整套谱增强,端到端并不瘦。NAPE-L 打平 SSLAM 时参数大约是对方的 3.4 倍,同尺寸对照并不占优。基线未统一复现,0.4 mAP 解释不了训练细节差异。只在 AudioSet 上预训练,没有 LibriSpeech 这类语音数据,IEMOCAP 的优势有多少来自目标、有多少来自规模,拆不开。关键词任务已经饱和。目标是表征不是生成,它不会合成下一段音频。

术语

原文与代码

相关论文

全部论文解读