零微调把文本 LLM 变音频模型:向 KV 缓存注入音频向量

tkasasagi · x · 2026-09-28

Interspeech 期间,一团队发布 arXiv 论文《Symbiotic Architecture for Post-Hoc Audio Extension of Frozen Language Models》(已投 ICASSP):设计一个注入器模块,把音频条件向量直接写入冻结 LLM 的短期记忆(KV 缓存),无需微调权重即可让文本 LLM 表现为音频语言模型。两大优势:注入成本由注入器宽度而非主干宽度决定,扩展性更好;不更新权重则完全保留 LLM 原有文本能力。在 ASR、音频问答、声学场景分类等任务上,超越常规冻结 LLM 方案、接近微调 ALM,且文本任务性能零损失。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →