港中文VideoCoCo:代码当思维链,文生视频懂物理

机器之心 · wechat · 2026-08-16

香港中文大学与中国科学技术大学团队提出 VideoCoCo,针对文生视频的「因果不透明性」问题——一句提示词只交代「发生了什么」,却省略变化速度、先后次序与物体作用关系。方案采用双智能体架构:Coding agent 先把提示词写成可执行的 Blender 程序并在沙箱中运行,得到确定性白模视频,把镜头、运动与事件节奏固定下来;Visual agent 再参考白模与编辑指令,将粗糙仿真画面重绘为具有真实质感的视频。代码在此充当一条可执行、可检查的「过程级思维链」。

量化结果:在 PhyGenBench(GPT-4o 评判)上把基线 OmniWeaving 从 0.475 提升至 0.558,超过开源基线 Wan2.2-TI2V-5B 的 0.544,mechanics、optics、material 三类第一;VBench-2.0 平均分从 52.18% 升至 77.88%(提升 25.7 个百分点),mechanics 达 92.31%。消融实验显示:不微调编辑器、仅以白模视频为生成条件,成绩就能从 0.475 升到 0.506,说明物理一致性的主要增益来自可执行草稿本身,而非额外训练「刷分」。

该工作延续了团队被 ECCV 2026 收录的 CoCo 思路,把「先写代码渲染预览」从静态图扩展到连续动力学。作者认为可执行代码有望成为视频生成的中间语言:比文本计划更具体、比关键帧更完整,且错误可定位、可修正,是神经符号融合的一种具体形态;局限在于 Blender 能表达的物理范围、脚本稳定性以及白模与最终画面的对齐质量。论文与代码均已开源。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →