HelixWorld:单GPU实时24FPS的音视频同步交互世界模型
NoizAI · hf · 2026-10-05
NoizAI 发布 HelixWorld,首个实时交互式音视频世界模型,视觉场景与基于相机的空间立体声在用户交互下原生协同演化。
- 现有交互世界模型几乎都「无声」,HelixWorld 补上声学维度:合成声音场可忠实跟踪动态视点运动
- 构建了带真实立体声与度量相机位姿的高保真空间音视频数据集,预训练以 6-DoF 相机轨迹和用户动作为条件的双向教师模型
- 通过在线轨迹蒸馏将教师蒸馏为少步流式学生,实现单 GPU 上 24 FPS 的无漂移音视频联合生成
- 提出空间-声学一致性形式化及 HelixBench 评测;实验显示视觉保真与响应性比肩最先进无声世界模型,空间声学沉浸感显著超越基线
「多模态」频道最新
- UniEvo-VL:多模态模型用自身反馈提升图像生成能力 — StanfordAILab · 2026-10-05
- BabyCast 播客回归:Kling 4.0 Flash 20 秒让虚拟宝宝开口 — CurieuxExplorer · 2026-10-05
- 多视角照片+Blender MCP,10 分钟无经验转出可旋转 3D 模型 — sidahuj · 2026-10-05
- 一条提示词花 200 美元,Opus 5.5 自主做出 36 分钟《光的历史》动画 — FinanceYF5 · 2026-10-05
- AI Agent 在本地电脑全流程自动剪出 1 分 45 秒视频 — tsi_org · 2026-10-05
- 马斯克转发 Grok Imagine 生成视频演示 — elonmusk · 2026-10-05