智象原生多模态世界模型登顶 WBench 评测
机器之心 · wechat · 2026-08-17
智象未来发布全球首款原生全模态交互式世界模型 HiDream-O1-World。该模型基于自研 UiT 架构,支持文本、图像、交互等多模态输入,能生成具备长时空一致性和物理一致性的动态世界,支持用户实时漫游与编辑。
核心能力
- 漫游模式:支持第一/第三人称视角自由切换,场景随位置实时更新且保持一致。
- 编辑模式:可实时操控角色动作或改变环境(如天气),基于物理模拟。
- 多风格支持:覆盖写实、二次元、3A游戏等多种风格。
评测成绩
在美团与复旦大学推出的 WBench 评测基准中,HiDream-O1-World 首次参评即登顶 Navi 分榜。其物理维度得分 73.3(第一),一致性维度得分 88.0(综合第一),超越了腾讯混元 1.5、阿里 HappyOyster 等模型。
技术架构
- UiT (Unified Transformer):摒弃传统拼接逻辑,将图像像素、文本 Token、视频体素等统一映射到共享空间,在同一 Transformer 网络中交互,强化跨模态因果理解。
- Geometry-then-Appearance:两阶段生成框架,先推理几何结构保证空间一致性,再生成外观纹理,解决大视角切换下的畸变问题。
- Memory 3D + TTT:通过空间记忆注入和推理时在线自适应(Test-Time Training),确保长时交互中的场景记忆与物理规律符合性。
应用前景
该技术不仅用于互动影游和游戏开发,还将与诺亦腾机器人合作,规模化生成具身智能训练数据,解决真实采集成本高、仿真与真实分布差异大的难题。
「多模态」频道最新
- SPARGen:统一空间感知与推理的原生多模态生成模型 — Jinsheng Quan · 2026-08-17
- Marionette:预测世界状态并用扩散渲染修复一致性 — Zian Meng · 2026-08-17
- 2D 照片变 3D 全息图:地理空间记忆宫殿成真 — bilawalsidhu · 2026-08-17
- 因 LTX 2.5 不识人,回退 2.3 恶搞 Tony Soprano — Unluckiestfool · 2026-08-17
- MiniMax H3 实测:8 种商业玩法,动漫风格视频生成性价比之选 — 卡尔的AI沃茨 · 2026-08-17
- 用Minimax H3生成20分钟动漫视频,附完整工作流 — shoryoucant · 2026-08-17