合并掩码补丁加速 AST 训练:吞吐提升 13.9% 精度几乎不掉
kastnerkyle · x · 2026-09-16
这篇被 Interspeech 2026 接收的论文提出 SpecAugment-Patch Merging,一种加速 Audio Spectrogram Transformer(AST)训练的简单方法:先用 SpecAugment 在 patch 级别对输入频谱图做掩码,加入位置嵌入后选出 r 对被掩码的 patch 加以合并,从而减少 Transformer 需要处理的 token 数量。
实验显示,把合并对数 r 从 0 提高到 100,AudioSet 上的 mAP 几乎不变(34.07 → 34.08),吞吐却从 43.3 提升到 49.3 samples/sec(相对提升 13.9%)。ESC-50 和 Speech Commands V2 上也呈现相同规律:吞吐稳步提升、精度仅有微小变化,说明这种合并策略能以极小的性能代价换取更快的训练。
「研究」频道最新
- 论文推广新打法:推文当摘要,博客当扩展版 — willcb · 2026-09-21
- RSIAgent 不重训模型,靠三个智能体互相出题记笔记超越 GPT-6 — alex_verem · 2026-09-21
- Google 论文:把工作流写成可编辑程序图,24 组评测 21 组拿第一 — rohanpaul_ai · 2026-09-21
- 机器人公司 Eidon AI 关停,9TB 自我中心视频与 IMU 数据全部开源 — vanstriendaniel · 2026-09-21
- 阿里浙大发布 Astar:从系统进化史自学,工程师新想法效率提 10-100 倍 — jiqizhixin · 2026-09-21
- NGCC 后量子密码候选曝 16 个严重漏洞,官方论坛噤声后研究者自建站点 — jedisct1 · 2026-09-21