京东开源 JoyAI-EchoWM:可走进去、视听同步的世界模型
jiqizhixin · x · 2026-09-19
京东探索学院(JD Explore Academy)在 JDD 2026 上发布并开源 JoyAI-EchoWM,一个面向交互式音视频世界生成的模型。
现有世界模型虽能生成惊艳视频,但用户真正「走进去」探索时会崩坏:改变路线或切换视角后,脚步声、环境音、语音与画面难以保持一致,第一人称与第三人称控制的差异会彻底破坏沉浸感。
EchoWM 的核心能力:
- 统一第一人称(镜头随观察者移动)与第三人称(镜头跟随主体、运动与构图协调)两种控制视角
- 不仅生成视频,还同步生成脚步声、环境音、语音等音频,并随用户导航保持音画一致
- 在 JoyAI-Echo 原生音视频生成基础上,构建真正可进入、可控、可探索的视听世界
「多模态」频道最新
- ComfyUI-NodeSnapshots:缓存机制让前端帧率提升 2-3 倍 — External_Quarter · 2026-09-19
- 黏土定格风萌娃提示词分享,一句话生成 Claymation 小人 — azed_ai · 2026-09-19
- MiniMax H3 三段式短片实战:完整多模态提示词公开 — JustLookingForNothin · 2026-09-19
- 15 分钟三步搞定图生视频,同款视频曾获 6000 万播放 — techhalla · 2026-09-19
- 用 MiniMax H3 生成的《鬼魂来访》视频演示 — apoke890 · 2026-09-19
- 不靠视频模型,用 GLM 写代码生成 40 秒动态图形视频 — 9r4n4y · 2026-09-19