Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination
Shuo Liang, Yixing Ma, Pengfei Zhou, Xingyan Chen, Zihan Mei, Manting Li, Feihan Chen, Zhiwen Wang, Bin Xu, Haotian Zhang, Jiajun Song, Shiya Su, Run Liu, Zhenghang Ni, Yifa Yu, Jintao Hong, Bolong Feng, Yifei Liu, Zirui Zhang, Jingxuan Zhang, Songlin Zhao, Yifan Bai, Kang Tan, Yizhe Liu, Junhao Du, Yongtao Ge, Zhaopan Xv, Xinyuan Zhang, Mengru Ma, Chunhua Shen, Wei Wang, Yang You, Zheng Zhu, Kaipeng Zhang, Wangbo Zhao
cs.CV, cs.AI
2026-08-14
1,830 条真实危机视频配 16,056 条 AI 生成视频建基准,三类检测器全部泛化失败,转码加台标后微调检测器报假率从 46% 塌到 1.4%。
视频生成模型已经能编造看起来真实的战乱、灾害、事故画面。一条用真实照片续出来的「现场视频」在社交平台传播时,用户和平台各有一道防线:人眼和自动检测器。这篇论文问的是这两道防线在危机场景里到底靠不靠谱。
已有的 AI 生成视频检测基准拿的是网络通用视频,生成方式以文生视频为主。危机场景的造假有两个特殊点:常见手法是拿真实事件的首帧做图生视频,让画面锚在真实场景上;这类内容到达观众前会经历转码、降采样、加新闻台标。现有基准对这两点都没测。
RA-Bench 的构造分五步。从公开平台收集 675 条真实危机与社会事件视频,归入 10 个社会风险大类、44 个子类;按场景切分出 5,774 条候选,经两轮人工评审(先两人独立评,分歧再仲裁)留下 2,426 条;再做时长归一到 3–15 秒、统一 H.264 编码、去重,最终 1,830 条真实锚点,平均 10.08 秒。
生成侧模拟真实造假手法:用 Gemini 给每条真实视频写结构化描述转成 prompt,把真实视频的首帧连同 prompt 喂给 4 个开源和 5 个闭源生成器,产出 16,056 条生成视频。生成视频同样 H.264 编码、去音频,堵住检测器靠编码参数猜标签的捷径。真实锚点与生成视频一一配对,报告的是配对 AUC,也就是同一条真实视频和它的伪造版本放在一起比高低。
评测沿三个维度:19 种检测方法的跨源泛化;生成质量、条件信息、采样种子如何影响可检测性;人类判断与社交传播模拟。
传统检测器掉得最狠。7 个传统检测器在公开基准上 AUC 67.6%–98.6%,到 RA-Bench 上源级均值只剩 43.9%–57.3%;63 个检测器与生成源的配对里 26 个 AUC 低于 50%,生成视频拿到的假分数比配对真实视频还低。公开排名也作废:与 RA-Bench 排名的 Spearman 相关只有 0.26,UnivFD 从第二掉到第六。5% 误报率下,七检测器均值只能抓出 2.8%–7.5% 的生成视频。
零样本多模态模型对 prompt 格式高度敏感。Gemini-3.1-Pro 最强,Binary 设定 63.4% BAcc,但在 Seedance2.0 上掉到 54.3%。Qwen3.5-0.8B 换个 prompt 格式,假召回从 19.7% 一路跳到 100%。GPT-5.5 的显式判决几乎全预测为真。
专门微调的检测器靠的是捷径。Skyra 两个版本在官方时间戳 prompt 下均值 68.5%/69.5% BAcc,把时间戳换成帧序号立刻掉到 54.4%–54.9%。BusterX++ 假召回只有 4.1%–9.1%,接近一个「全预测真」的分类器。
| 设定 | 指标 | 结果 |
| 传统 7 检测器(公开参考 → RA-Bench 闭源源级) | 平均 AUC | 84.2% → 48.7% |
| Skyra-SFT(时间戳 → 帧序号) | 平均 BAcc | 68.5% → 54.4% |
| 微调检测器,传播模拟全操作前后 | 平均假召回 | 46.0% → 1.4% |
| HumanProof 子集,Gemini Binary | BAcc | 54.7%(源匹配参照 61.2%) |
人类研究有 20 位评审。开源生成视频 68.6% 被识破,闭源只有 52.9%,Seedance2.0 低到 40.7%。反方向,22.8% 的真实视频判断被误标为生成。五人全判真的 633 条生成视频构成 HumanProof 子集,上面 Gemini 三种 prompt 全部接近随机,传统检测器均值 47.5% AUC。
社交传播模拟(LastMile)在 150 个锚点上叠四种操作:VP9 转 H.264、空间降采样一半、降到 8 帧、加合成新闻台标。全叠上之后,五个微调检测器配置的假召回从 46.0% 塌到 1.4%,预测整体滑向「真」。单加一个台标就把假召回从 29.9% 压到 14.0%。传统检测器均值 AUC 从 51.4% 降到 47.3%,且排名大洗牌,操作前后排名相关只有 0.07:ForgeLens 从 61.6% 掉到 35.6%,DeCoF 反而从 59.9% 升到 62.3%。
这篇的价值不在提出新检测器,在于把「检测器靠不靠谱」拆成能单独测的四件事:跨源泛化、prompt 敏感、协议依赖、类别偏好。对做内容审核和平台风控的人,结论很直接:目前不能靠单个检测器给危机视频下结论,论文也据此建议用多检测器证据融合的模块化流程。
对生成侧,种子间检测模式稳定这个发现说明检测难度是生成器属性,不是抽样运气;作者还提出强检测器可以反过来当生成模型训练的奖励模型。
作者自列三条:基准是当前九个生成器的快照,需要版本化更新;只测视觉通道,而 Seedance2.0 已能原生生成音画同步内容;生成与传播是分开的受控阶段,没测生成加局部编辑加配文的多阶段伪造管线。人类判断也在受控界面收集,没有真实社交上下文。
读下来另有两点存疑:造假手法只覆盖首帧图生视频这一种,音频伪造与局部编辑完全没碰;LastMile 的四种操作是人工合成的,与真实平台的处理链路有多接近没有验证。