Sony AI 等发布 ST-AudioLM:一次建模声音语义与声源移动轨迹,代码已开源
mittu1204 · x · 2026-10-01
POSTECH 与 Sony AI 等机构发布 ST-AudioLM(EMNLP 2026 Main),代码与 demo 已放出。
- 核心创新:现有音频语言模型把音频当作全局事件处理,缺乏对声源位置和运动的理解;ST-AudioLM 用 1 个语义 token 加 40 个轨迹 token,统一语义理解、空间定位与轨迹建模
- 同时发布 ST-AudioQA 数据集与基准:基于一阶 Ambisonic(FOA)渲染的静态与移动声源场景,每个场景带声源身份、方向、距离、运动等元数据,支持多源定位与组合推理问答
- 提出 ST-Audio Encoder,一种时间解析的 FOA 音频编码器
- 官网提供双耳音频 demo(救护车鸣笛、吹风机移动等场景),工作由 Sony AI 实习生 Hyun-Bin Oh 主导
「多模态」频道最新
- ThinkV2V:先思考再编辑,5B 视频编辑模型在复杂指令上胜过 10B 基线 — Donghao Zhou · 2026-10-01
- 复旦 IDSpect:按偏旁部首拆字给奖励,提升中文文字生成结构准确率 — Fudan-University · 2026-10-01
- Imagine3D-LLM 让多模态模型先「脑补」3D 场景再答题 — kaist-ai · 2026-10-01
- JHU 新作 PowerSim:让重建场景可直接物理交互与形变渲染 — anand_bhattad · 2026-10-01
- 7000 张 Midjourney 图+Suno 配乐,Opus 5.5 全权创作 2 小时成本仅 6.8 美元 — ciguleva · 2026-10-01
- 免费捏 Dot 专属 3D 形象:25 形象 12 材质 32 风格免注册 — yihui_indie · 2026-10-01