视频模型结果达成最高仅37.8%,SemComp专测结果与语义接地

SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation

Keyu Tu, Zhuowei Chen, Mengqi Huang, Yuxin Wang, Jiahao Zhu, Zhendong Mao, Yongdong Zhang

cs.CV, cs.AI

2026-08-18

中科大提出结果导向视频生成评测SemComp:1273条真实视频样本,VLM二元问答打OA与GR。七个模型里HunyuanVideo图生视频结果达成最高37.8%,Seedance 2.0生成可靠性最高91.8%。

这篇在解决什么

视频生成模型现在能出好看、时间连贯的片子。现有榜也跟着盯画质、主体一致、物理常识。用户真正常要的却是另一件事:给一张参考图加一句指令,生成视频必须把指定结果做出来,而且结果还得语义上接得上那张图。

举论文里的例子。图是一张钞票,指令是「把钞票折成乌龟」。折纸过程可以不演,但画面里必须出现用这张钞票折成的乌龟,不能换成另一只无关乌龟。中间步骤完整与否、外观是否逐像素贴住参考图,都不是成功条件。现有基准很少把「结果达成」和「任务相关语义接地」绑在一起测,于是模型可以靠保住外观、演一段动作交差。

方法

任务被定成 Semantic Task Completion Video Generation。成功只看两件事:意图结果出现了,以及参考图里与任务有关的语义关系还在。

数据集 SemComp-Data 从 Koala-36M 抽约 2 万条视频,四段流水线做成图-文-视频三元组。标题关键词先滤掉访谈、新闻这类靠旁白才能判完成的片子。VLM 把视频摘要归到六个域:艺术精细、美妆时尚、手工 DIY、烹饪、园艺宠物、运动健身。每类预先写好参考态和结果态,定位时间戳,再用无标签问答核对哪一帧才是结果,对不上就丢掉。随后按镜头切出平均约 4.03 秒的结果中心片段。最后写出不超过 30 词的短指令,以及带接地约束的详指令。参考帧和结果片段来自同一条完整视频,任务在视觉上是可实现的。全库 1273 条;评测子集 SemComp-Core 每域 10 条,共 60 条。

评测协议 SemComp-Bench 用 Doubao-Seed-1.8 做证据锚定的二元问答。OA 四个门全过才算一条成功:结果实现、语义接地、关键实体一致、全局视觉连续。GR 是五项可靠性的平均:物理合理性、清晰度、无伪影、场景内时空连贯、文字与界面完整。每条视频均匀抽 27 帧,三次独立打分再取平均。

结果

详指令、图生视频设定下,HunyuanVideo-1.5-720P 的 OA 最高,37.8%;Wan2.2-I2V-A14B 第二,28.3%。Seedance 2.0 单项不弱,结果实现 0.839、语义接地 0.744,但关键实体一致只有 0.444,联合 OA 掉到 20.0%。Phantom-1.3B 的 OA 仅 3.9%。最高分仍低于 40%,四个门要同时过关很难。

模型OA ScoreGR Score
HunyuanVideo-1.5 I2V37.8%79.1%
Wan2.2-I2V-A14B28.3%89.0%
Seedance 2.020.0%91.8%
Phantom-1.3B3.9%76.8%

GR 上 Seedance 2.0 以 91.8% 居首,开源里 Wan2.2-A14B 89.0%。所有模型最弱的一项都是场景内时空连贯,通过率从 0.328 到 0.739。画面单帧可以很像,场景内部仍会闪、重影、局部形变。

条件消融更清楚。三个模型家族里,同规模图生视频全面压过纯文生视频:HunyuanVideo 详指令 I2V 37.8%,T2V 掉到 4.4%,短指令 T2V 只剩 1.7%。T2V 有时更能「做出一个结果」,但实体和场景接不上参考图。短指令更接近用户习惯,也更难。

为什么重要

这是一把结果导向的尺子,不是又一张画质榜。OA 和 GR 会错位:Seedance 画面稳,过不了结果关;HunyuanVideo 结果更好,可靠性更差。做产品不能只看单帧好看。参考图条件几乎是刚需,纯文本很难保住任务相关身份。用这批数据做任务训练能不能把 OA 拉上去,论文写明还没验证。

局限与存疑

主榜只有 60 条,域均衡但样本很小。评判绑在一个闭源 VLM 上,三次调用的 OA 标准差最高到 4.41 个百分点。评测不问中间过程对不对,物理门也只抓明显违规。数据来自网络视频的结果片段,不是受控实验。没有用 SemComp-Data 训过生成模型,所以这是诊断榜,不是训练闭环。

术语

原文与代码

相关论文

全部论文解读