Prototype-Rectified Iterative Self-supervised Manifold Denoising under Severe Acoustic Shift
Ashish Anand Shukla, Rini Smita Thakur, Aryan Das, Vinod K. Kurmi
cs.SD, cs.LG
2026-08-15
把强噪声对 CLAP 嵌入的破坏建模为低秩仿射畸变,闭式校正编译成一个静态矩阵;US8K 准确率比零样本高 12.94 个百分点。
CLAP 这类音频-文本基础模型在干净基准上零样本分类已经很强,但野外部署(光纤声学监测、生物声学识别、水下目标分类)信噪比常常低于 0dB,目标事件被非平稳干扰和混响淹没。零样本直接崩:UrbanSound8K 混入 10 种城市背景噪声后,LAION-CLAP 从干净音频的 78.39% 掉到 58.77%。
现有三条适配路线各有死穴。梯度类测试时适配(TENT、SUTA 的熵最小化)在歧义信号上把高置信错误预测喂回适应回路,等于在噪声底上训练自己;prompt 调优需要推理时拿不到的噪声类型标注,还有迭代反传的延迟;静态几何对齐对每个环境各自的畸变太刚性。论文实测熵最小化类适配与零样本几乎同分(58.83% 对 58.77%),严重噪声下基本白干。
核心是一个可检验的命题:仿射噪声假设。波形上的加性噪声经过 CLAP 编码器的非线性变换后,在潜空间留下的畸变近似低秩仿射,一个旋转 R 加一个平移 Δ。证据是对四个噪声环境分别做「噪声嵌入减干净嵌入」的诊断性 SVD,90% 以上畸变能量集中在前 60 个主成分。既然畸变低秩,梯度微调就不必要,闭式线性代数可以解析求逆。
文本原型是免费的干净锚:每类用 20 个提示模板的平均嵌入,来自完全无噪声的模态。
校准阶段(transductive、批依赖、3 轮迭代)做三件事:
每轮结束后 ABR 用岭回归(λ=0.01)把累计修正蒸馏成单个 (d+1)×d 静态仿射矩阵,回归起点始终固定在原始噪声嵌入上,误差不会逐轮放大。
推理阶段严格批独立:新样本一次矩阵向量乘法完成适配,0.0009 毫秒,无梯度、无批统计、无参数更新。
| 方法 | US8K Acc | ESC-50 Acc |
| 零样本 LAION-CLAP | 58.77 | 88.82 |
| TDA | 62.75 | 91.10 |
| PCA++ | 67.88 | 77.57 |
| PRISM | 71.71 | 93.39 |
| ContextDA(oracle 噪声标注) | 62.30 | n/a |
US8K 为 10 种背景噪声 × 10 折交叉验证、共 87,320 个评测实例。PRISM 比零样本高 12.94 个百分点,比最强免训练基线 PCA++ 高 3.83,比拿到特权噪声标注的 ContextDA 还高 9.41。ESC-50 上 PCA++ 反而比零样本低 11.25 个百分点,论文归因于其投影在高信噪比时把信号方向一起删掉。
SNR 扫描最能说明问题:-6dB 时零样本 32.69%,PRISM 57.45%,差 24.76 个百分点,且从 -6dB 到 clean 全程单调改善。逐类看,频谱稀疏的类受益最大:airconditioner 从 22.06% 到 64.77%,gunshot 从 60.80% 到 92.14%。
组件消融:OPCA +9.58、CCVD +3.09、ABR +0.27 个百分点,跨模态旋转对齐是主力。成本:校准 311 毫秒一次性;单样本推理 0.0009 毫秒,比 PCA++ 快 9 倍,比梯度类方法快几个数量级(CoNMix 约 50 毫秒)。批大小敏感性:校准后单样本 N=1 也有 80.0%,全程稳定在 72.2±0.6%,前提是先用 128-512 个无标注样本暖机。
对比式基础模型的文本侧是一个被低估的资源:冻结、免费、不受目标域噪声影响,可以当几何锚用。这个思路不限于音频,论文的三个基线本来就是从 CLIP 迁移来的,视觉侧同样适用。对边缘部署,闭式解加一次矩阵乘意味着换环境不用回去重训,也不用调 prompt。
低秩假设不普适。DCASE 设备失配数据集(真实录音设备差异,非加性噪声)上,base PRISM 掉到 15.63%,低于零样本的 17.36%:假设失效时硬投影会主动毁信号,只有加 CAR 的版本 17.70% 略高于零样本。部署前得先判断畸变来源是不是加性噪声。
多声陷阱(Polyphonic Trap)是论文自己识别并正面分析的失败模式:streetmusic 这类宽频类的语义方差与噪声子空间几何重叠,CCVD 把信号当噪声删掉,92.53% 掉到 75.33%。CAR 用置信度门控插值救回到 83.49%,代价是整体掉 0.48 个百分点、稀疏类受益缩水(airconditioner 回落到 58.35)。
两点读下来的保留:校准是 transductive 协议,矩阵来自整个无标注测试批或数百样本暖机,不是零成本的在线适配;证据面只有 LAION-CLAP 一家模型、TAU 语料注入的合成噪声、分类一个任务,跨模型与真实野外噪声的验证还缺。