VideoCoCo:用Blender代码做思维链提升视频物理一致性
Haodong Li · hf · 2026-07-31
文本生成视频模型虽画质惊人,但在生成物理一致性的动态画面时常显吃力。本文提出 VideoCoCo,一个智能体双引擎框架,核心创新是使用可执行的Blender代码作为过程级思维链。
工作流程如下:
- 代码生成:编码Agent根据文本提示合成Blender程序,显式指定场景及其时间演变。
- 物理模拟:执行模拟引擎生成确定性的时空草稿。
- 视觉渲染:生成式视频引擎将草稿转化为逼真视频。
该方法将过程推理与高保真视觉实现分离,在PhyGenBench和VBench-2.0基准上大幅提升了基线分数。
「多模态」频道最新
- 曝 MiniMax H3 模型曝光:支持原生多模态,最多混合 12 种输入 — bennash · 2026-07-31
- H3-Omni 架构解析:原生 2K 分辨率与上下文重绘技术 — bdsqlsz · 2026-07-31
- Flux 3 与 Minimax H3 宣布开源权重,视频生成再起波澜 — cocktailpeanut · 2026-07-31
- Runway 视频生成实测:图生 15 秒孟买雨季延时摄影 — CurieuxExplorer · 2026-07-31
- 实测 Hailuo-03 模型的参考图生成能力 — chrisfirst · 2026-07-31
- MiniMax-H3 登顶视频编辑榜,文生视频并列全球第二 — bdsqlsz · 2026-07-31