STEMMA 论文提出歌曲到分轨多音频推理框架,可微调增强音频大模型

keunwoochoi · x · 2026-10-10

arXiv 论文《STEMMA: Song-to-Stem Multi-Audio Reasoning for Large Audio Language Models》提出面向大型音频语言模型(LALM)的多音频音乐问答框架。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →