新研究提出基于本体的目标声音提取,利用层次结构分离音频
carlosheroliv · x · 2026-09-02
- 问题背景:现有的目标声音提取(TSE)系统通常基于固定的类别表示,难以处理环境声音中自然的层次关系(如从“猫/狗”到“动物”的泛化)。
- 新任务:论文提出了“基于本体的 TSE”,单个模型可以在声音本体的任何层级提取声音。
- 方法:提出一个在 AudioSet 衍生本体的所有节点上定义的可学习类嵌入表,并使用共表型相关系数(CPCC)损失进行正则化,使嵌入距离与本体树中的最短路径距离对齐。
- 结论:实验表明,在训练 TSE 系统时考虑本体结构能带来显著收益。
「研究」频道最新
- H3 加速竞技场登顶 Hugging Face 热榜 — multimodalart · 2026-09-02
- GRPO 专家 SLERP 合并:小规模自托管 LLM 扛下一半线上流量 — t-tech · 2026-09-02
- 机器学习进阶书单:从数学基础到大模型LLM全收录 — techNmak · 2026-09-02
- Mambbot:AI 引导环境信号塑造生物组织 — DoctorJosh · 2026-09-02
- Pasqal 展示 AI Agent 自动编排量子实验工作流 — jiqizhixin · 2026-09-02
- Cohere 讲座:Scaling Laws 研究复现性与方法论差异 — Cohere_Labs · 2026-09-02