NAPE 音频预训练法开源:无解码器 SOTA

kastnerkyle · x · 2026-08-24

UmbertoSenpai 和 LiuXub 提出了一种新的自监督音频学习方法 NAPE。该方法通过因果预测下一个音频 patch 嵌入并使用 stop-grad 技术,实现了强大且可扩展的音频学习能力。NAPE 在基准测试中达到 SOTA 性能,具有可解释性,且不需要解码器、师生模型或正则化损失。该方法非常简单且可扩展,能将原生音频预训练无缝引入多模态 LLM。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →