Adobe TAC 音频描述模型入选 NeurIPS 2026,联合 LLM 达多项 SOTA
justin_salamon · x · 2026-09-30
Adobe Research 的 TAC(Timestamped Audio Captioning)被 NeurIPS 2026 接收。模型能为任意音频/视听内容生成带时间戳的描述,用 [music]/[sfx]/[speech] 类型标签标注重叠声事件。
- TAC-V:将 TAC 输出与视觉语言模型融合,生成时间密集的视听描述,带幻觉校正与视觉定位
- TAC→LLM 级联:TAC 作为文本推理器的"语义桥梁",在 MMAU-Pro、MMSU、MMAR、Daily-Omni、VideoHolmes 等多数音频(-视觉)推理基准上取得 SOTA
- 解决大型音频语言模型难以解耦重叠声事件、时间不连贯的问题
「研究」频道最新
- UMAP 作者发布更新:新增 recursive 初始化,大数据不再卡死 — leland_mcinnes · 2026-09-30
- 研究者直言部分 AA benchmark 有误导性,已失去信心 — tianyin_xu · 2026-09-30
- 阿德莱德大学提出 DCSD:解耦信用方向与幅度,11 项基准领先 GRPO — AdelaideUniversity · 2026-09-30
- NVIDIA 开源 HumanoidMimicGen:1 条遥操作演示自动生成数千条人形数据 — AjayMandlekar · 2026-09-30
- 色编码技巧突破:对称布尔函数获 2^O(√n) 深度-3 电路 — rrwilliams · 2026-09-30
- Epoch AI:AI 从奥数到 Navier-Stokes,进展比基准分数显示的更稳 — TWIML AI Podcast · 2026-09-30