WorldSonus为世界模型补声:实时空间立体声生成RTF仅0.41
NoizAI · hf · 2026-10-08
NoizAI 提出 WorldSonus,为世界模型生成的交互视频实时合成空间音频,解决三大挑战:
- 实时性:流式因果自回归扩散架构,实时因子(RTF)低至 0.41,跟上交互视频流
- 交互控制:音频中心的 captioning 管线配合分块索引 prompt 调度,可在生成中途动态操控声音事件
- 空间对齐:利用从立体声与 ambisonic 数据精选的高质量立体声监督,使声音反映场景几何与相机运动
实验显示,WorldSonus 虽为世界模型定制,但在开放域 video-to-audio 基准上也能匹敌或超越最先进的双向模型,声学质量与空间对齐俱佳。
「多模态」频道最新
- 用 Claude 把 198 页 Erdős 猜想证明变成 2 分钟 3D 动画讲解 — imjustnewatai · 2026-10-08
- Reddit 用户用 ComfyUI 加 agent 驱动制作 AI 短片 — TheHollywoodGeek · 2026-10-08
- SGF+分离去噪与上下文写入梯度,5秒训练支持24小时连续视频生成 — Zihan Su · 2026-10-08
- AdSpark:30万条电商广告视频三元组数据集与六维评测基准 — Zhifei Yang · 2026-10-08
- Freeform Motion Transfer LoRA 与工作流发布 — CQDSN · 2026-10-08
- 本地跑 H3 做 DnD 音乐视频:多参考输入实测 — IWillTouchAStar · 2026-10-08