SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation
Keyu Tu, Zhuowei Chen, Mengqi Huang, Yuxin Wang, Jiahao Zhu, Zhendong Mao, Yongdong Zhang
cs.CV, cs.AI
2026-08-18
中科大提出结果导向视频生成评测SemComp:1273条真实视频样本,VLM二元问答打OA与GR。七个模型里HunyuanVideo图生视频结果达成最高37.8%,Seedance 2.0生成可靠性最高91.8%。
视频生成模型现在能出好看、时间连贯的片子。现有榜也跟着盯画质、主体一致、物理常识。用户真正常要的却是另一件事:给一张参考图加一句指令,生成视频必须把指定结果做出来,而且结果还得语义上接得上那张图。
举论文里的例子。图是一张钞票,指令是「把钞票折成乌龟」。折纸过程可以不演,但画面里必须出现用这张钞票折成的乌龟,不能换成另一只无关乌龟。中间步骤完整与否、外观是否逐像素贴住参考图,都不是成功条件。现有基准很少把「结果达成」和「任务相关语义接地」绑在一起测,于是模型可以靠保住外观、演一段动作交差。
任务被定成 Semantic Task Completion Video Generation。成功只看两件事:意图结果出现了,以及参考图里与任务有关的语义关系还在。
数据集 SemComp-Data 从 Koala-36M 抽约 2 万条视频,四段流水线做成图-文-视频三元组。标题关键词先滤掉访谈、新闻这类靠旁白才能判完成的片子。VLM 把视频摘要归到六个域:艺术精细、美妆时尚、手工 DIY、烹饪、园艺宠物、运动健身。每类预先写好参考态和结果态,定位时间戳,再用无标签问答核对哪一帧才是结果,对不上就丢掉。随后按镜头切出平均约 4.03 秒的结果中心片段。最后写出不超过 30 词的短指令,以及带接地约束的详指令。参考帧和结果片段来自同一条完整视频,任务在视觉上是可实现的。全库 1273 条;评测子集 SemComp-Core 每域 10 条,共 60 条。
评测协议 SemComp-Bench 用 Doubao-Seed-1.8 做证据锚定的二元问答。OA 四个门全过才算一条成功:结果实现、语义接地、关键实体一致、全局视觉连续。GR 是五项可靠性的平均:物理合理性、清晰度、无伪影、场景内时空连贯、文字与界面完整。每条视频均匀抽 27 帧,三次独立打分再取平均。
详指令、图生视频设定下,HunyuanVideo-1.5-720P 的 OA 最高,37.8%;Wan2.2-I2V-A14B 第二,28.3%。Seedance 2.0 单项不弱,结果实现 0.839、语义接地 0.744,但关键实体一致只有 0.444,联合 OA 掉到 20.0%。Phantom-1.3B 的 OA 仅 3.9%。最高分仍低于 40%,四个门要同时过关很难。
| 模型 | OA Score | GR Score |
| HunyuanVideo-1.5 I2V | 37.8% | 79.1% |
| Wan2.2-I2V-A14B | 28.3% | 89.0% |
| Seedance 2.0 | 20.0% | 91.8% |
| Phantom-1.3B | 3.9% | 76.8% |
GR 上 Seedance 2.0 以 91.8% 居首,开源里 Wan2.2-A14B 89.0%。所有模型最弱的一项都是场景内时空连贯,通过率从 0.328 到 0.739。画面单帧可以很像,场景内部仍会闪、重影、局部形变。
条件消融更清楚。三个模型家族里,同规模图生视频全面压过纯文生视频:HunyuanVideo 详指令 I2V 37.8%,T2V 掉到 4.4%,短指令 T2V 只剩 1.7%。T2V 有时更能「做出一个结果」,但实体和场景接不上参考图。短指令更接近用户习惯,也更难。
这是一把结果导向的尺子,不是又一张画质榜。OA 和 GR 会错位:Seedance 画面稳,过不了结果关;HunyuanVideo 结果更好,可靠性更差。做产品不能只看单帧好看。参考图条件几乎是刚需,纯文本很难保住任务相关身份。用这批数据做任务训练能不能把 OA 拉上去,论文写明还没验证。
主榜只有 60 条,域均衡但样本很小。评判绑在一个闭源 VLM 上,三次调用的 OA 标准差最高到 4.41 个百分点。评测不问中间过程对不对,物理门也只抓明显违规。数据来自网络视频的结果片段,不是受控实验。没有用 SemComp-Data 训过生成模型,所以这是诊断榜,不是训练闭环。