智象发布全模态视频模型 HiDream-V1,双榜跻身全球前十
新智元 · wechat · 2026-09-22
智象(HiDream.ai)发布原生全模态视频模型 HiDream-O1-Video-1.0,首次参评即在 Artificial Analysis 图生视频榜(含音频)排全球第四、Arena 图生视频盲测榜第八,与 MiniMax、字节 Seedance、阿里万相同列全球第一梯队。
- 主打物理合理性:官方演示覆盖多普勒效应、自由落体、太空水球、不同材质落地变形等场景;5–20 秒任意时长,时长由叙事而非固定秒数决定
- 生成前前置多模态意图理解模块,把口语化提示转写为结构化分镜(镜头、场景、角色、光影、音效等)
- 原生全模态架构对文本、视频、音频联合建模,音画同步、中文口型与情绪切换为宣传重点
- 后训练采用 Diffusion RL + 多模态 Reward,由三项论文支撑:DMSampler(ICML 2026,降低采样成本)、DiffusionCompass(ECCV 2026,防奖励过拟合)、EvoID(CVPR 2026,身份保持)
- 智象的 UiT 统一底座已长出图像、交互世界模型、具身世界模型和视频四类模型,形成原生全模态闭环。注:内容带有明显宣传色彩,物理能力结论以官方 demo 为准
「多模态」频道最新
- 用 Opus 5.5 做像素风游戏动画:几分钟出 Pitfall 式小样 — technollama · 2026-09-23
- 网友用 Claude Opus 5.5 生成「Fear The Foom」动画,配合 AI 诗写成片 — repligate · 2026-09-23
- Polyfork 把 3D 资产变成可重混的小程序,AI agent 全流程搭建已周周有收入 — PeterDiamandis · 2026-09-23
- ghost-2.0 全头换脸项目被修复升级,效果仍有差距 — Working-Art-3746 · 2026-09-23
- 用户首试 GPT-6 Astra 剪视频:称这活儿从此不用再想 — debreuil · 2026-09-23
- 两个月重度实测:图像生成离「艺术指导级」精准控制还很远 — Professional-Cap-377 · 2026-09-23