VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement
Wenzhuo Xu, Yuchen Zhu, Chongjian Ge, Xuan Shen, Jing Shi, Jason Kuen, Yongxin Chen, Molei Tao, Christopher McComb, Noelia Grande Gutiérrez, Jiuxiang Gu
cs.CV
2026-09-03
把提示词编译成类型化物理义务,用冻结专家工具核验生成视频。149 条核心片段上找到 228/304 处人工缺陷,高于问题分解基线的 164。
生成视频好看,不等于物理上靠得住。一个标量质量分说不出这条片子违了提示词里的哪条义务,也标不出坏在哪一帧。现有评测把能力拆开了:有的做规则级对错,有的做时间定位,有的在受控场景里测量,有的查音画是否对得上。缺的是一条把这些接到一起、每条判决都能回溯证据的链。
更麻烦的是开放提示词往往不带评分细则。评测器得自己从文本里编译出「该检查什么」,再在像素上量,而不是对着一组预写好的现象打勾。
VeriPhy 把规划和学习判决拆开。文本规划器在看任何一帧之前,把提示词里的原句编成类型化物理主张,再写成一份静态校验过的执行计划。计划用受限的表面语言:存在、计数、时间先后、空间关系、轨迹、声音、屏幕文字,以及一条兜底的语义判断。编译器会补上依赖闭包。比如「A 在 B 之前」会自动加上两次事件是否发生的门控和两次计时。
执行按拓扑序走。观测只允许激活、跳过或收窄计划里已经声明的调用,不能现场发明新检查。底层专家全部冻结:SAM 3 做分割和跟踪,TAPNext++ 在轨迹上做 11 种物理测量,再加上单目深度、OCR 和声音事件检测。每条动作吐一份带出处的证据记录,载荷要么是类型化测量,要么显式标成学出来的状态;测不到就弃权,基础设施挂了单列,不会把「没量着」写成「视频里没有」。
判决是三值的。子检查合成主张,主张再合成片段:一条矛盾就判 implausible,全支持才是 plausible,其余 abstain。规划器与稠密语义核验共用 Qwen3-VL-30B-A3B,过关的主张还会再交给闭源兜底模型 gpt-5.6-sol 复审。生成侧另有一条解耦管线:MuJoCo 先模拟并校验运动,渲染成深度控制视频,再条件到冻结的 Wan 2.2-VACE 上。运动由求解器定,提示词只负责外观。本报告把生成和核验分开评,闭环改写只做了初步试验。
人工标注语料有 1500 条生成片段、2582 条缺陷记录。评测核心是 149 条、304 处缺陷(开发集,不是泛化测试)。
| 评测器 | 找到的缺陷 | 召回 |
| 问题分解(同一骨干) | 164 / 304 | 53.9% |
| 单次过完整视频的 VLM | 222 / 304 | 73.0% |
| VeriPhy | 228 / 304(191 整段 + 37 部分) | 75.0% |
228 条命中里,有 83 条是兜底模型把稠密核验的「通过」改成矛盾。按类别,计数最低(49%),因为它把逐帧序列收成众数,间歇检到的目标会被当成不存在;屏幕文字 84%,因为识别头按字形抄,不帮生成器把错字修成提示词要的那句。物理专家被调用 227 次,弃权 166、判矛盾 61。CLIPScore 和严重度、缺陷条数几乎不相关。
在开发语料里另划 502 处缺陷做课表试验:从 miss 里蒸馏 33 条规划课,权重不动。有课表找到 375 / 502(74.7%),无课表 340(67.7%)。从 25 条经验片段蒸出的课已经够用,再加经验只是换哪些缺陷被找到。闭环改写在未见过的 Cosmos3-Nano 上,对自判有缺陷的 87 / 589 条重写提示词再生成:72.4% 的自评分上升,65 条 implausible 里 49 条翻成 plausible,未标记片段里只有 1.6% 变差。同一批片子交给 VideoPhy-2 的独立 AutoRater,语义和物理两个维度都几乎不动。
Physion-Eval 上只报了前 601 条的期中数字。证据条件下的「物理不合理」标记率 26.8%,未训练人类参考是 52.7%,Gemini 3.0 Pro 是 16.9%。样本和协议都不同,只能当描述性对照。
和同一骨干的一次性提问相比,召回几乎持平(75.0% 对 73.0%)。VeriPhy 多出来的是每条判决带着测量、时间窗和出处,可以一条一条审计,也给「把判决写回生成」留了接口。对做视频世界模型评测的人,这条证据链比再刷一个标量分有用。
闭环目前还站不住。提升只出现在它自己打的分上,独立评分器没有跟上。论文把两种读法都写了:改写改到了 AutoRater 量不到的物理质量,或者只是在刷自己的分。现有实验分不开。
作者列得很清楚。控制信号来自模拟器,场景多样性被模拟器卡住;语料全是有缺陷的片段,只能报召回,报不了精度;标注是单人,没有一致性;核心集是开发集,问题分解基线是看过系统输出之后才定的。物体绑定是中心失败模式:编译器能保证符号名一致,保证不了不同工具盯的是同一个物理实例。计数路径会把「多数帧没 grounding 到」收成零。规划器没有「在……上面」这类谓词,否定测量会回退到通用语义核验。
课表试验关掉了本该挡住坏课的验收门;教过的规划器从提示词里读出的主张数是未教过的 1.76 倍,召回增益里混进了「问得更多」。gpt-5.6-sol 是闭源兜底,83 / 228 的命中过了它,开源复现会矮一截。