零微调把文本 LLM 变音频模型:向 KV 缓存注入音频向量
tkasasagi · x · 2026-09-28
Interspeech 期间,一团队发布 arXiv 论文《Symbiotic Architecture for Post-Hoc Audio Extension of Frozen Language Models》(已投 ICASSP):设计一个注入器模块,把音频条件向量直接写入冻结 LLM 的短期记忆(KV 缓存),无需微调权重即可让文本 LLM 表现为音频语言模型。两大优势:注入成本由注入器宽度而非主干宽度决定,扩展性更好;不更新权重则完全保留 LLM 原有文本能力。在 ASR、音频问答、声学场景分类等任务上,超越常规冻结 LLM 方案、接近微调 ALM,且文本任务性能零损失。
「研究」频道最新
- DeepMind 研究员驳「图像才能带来理解」论:信号皆任意二进制码 — AndrewLampinen · 2026-09-28
- 研究者:自监督学习被严重低估,部分概念已包装成世界模型 — iScienceLuvr · 2026-09-28
- 致敬 Spore:肌肉驱动 3D 骨骼自动求解最低代谢成本步态 — burny_tech · 2026-09-28
- MICCAI 学者发声:NeurIPS 谱理论学习论文忽视斯特拉斯堡 Gamma 演算传统 — PTenigma · 2026-09-28
- AnyMo 论文入选 NeurIPS,跨传感器建模人体运动 — flosalim · 2026-09-28
- MIT《泛函微分几何》开放获取免费公开 — FrnkNlsn · 2026-09-28