STEMMA 论文提出歌曲到分轨多音频推理框架,可微调增强音频大模型
keunwoochoi · x · 2026-10-10
arXiv 论文《STEMMA: Song-to-Stem Multi-Audio Reasoning for Large Audio Language Models》提出面向大型音频语言模型(LALM)的多音频音乐问答框架。
- 核心思路:围绕「制作来源关系」构建——判断片段是否来自同一曲目或段落、哪些分轨(stem)属于哪个混音版本,而现有 LALM 与音乐问答数据集通常只处理单条录音或来源无关的独立片段。
- 关系优先构建:先定义目标关系,再从曲库中检索满足该关系的正例与不满足的难负例;标签直接取自曲库制作元数据,而非用语言模型从元数据生成。
- 产出:构建了评测集 STEMMA-Bench 与曲目不相交的训练集 STEMMA-Instruct。
- 结果:在 STEMMA-Instruct 上微调两个 LALM 可提升多音频推理能力,在由曲库直接决定的结构关系上提升最大,同时保持单音频音乐理解能力。
「多模态」频道最新
- 用 GPT Image 2.5 做角色一致性,CapCut 串起品牌视频工作流 — LearnWithBishal · 2026-10-10
- Flow Matching 速度缩放新解:纠正时间滞后,ImageNet FID 从 28.0 降至 12.2 — francoisfleuret · 2026-10-10
- 用 Claude Code 串 ElevenLabs 与 GPT Image 2,自动生成 8 段多风格卡通对话 — mhmazur · 2026-10-10
- Nano Banana 2.1 上线 Air 平台,本月送无限额度 — azed_ai · 2026-10-10
- Kling 4.0 Flash 单镜头演绎喜怒哀三情绪,表情 tears 唇形同步 — azed_ai · 2026-10-10
- Vivix W1 实时交互视频每秒仅 $0.003,成本约 Seedance 的 1/77 — Scobleizer · 2026-10-10