四视角分工的开源小模型群,换脸检测泛化反超 GPT-5.5

Multi-Agent Forensic Reasoning for Generalizable Deepfake Video Detection

Xuechao Zou, Shun Zhang, Kai Li, Yi Zhou, Xinyu Sun, Yuhui Chen, Zhe Wu, Congyan Lang, Junliang Xing

cs.CV, cs.AI, cs.MA

2026-08-07

提出纹理/光照/动作/物理四专家 agent 加裁判的开源小模型换脸检测框架,配 10 万视频、33 种生成法的基准,在未见生成器上以 69.9% 准确率超 Gemini-2.5-Pro。

这篇在解决什么

新一代视频生成器(Seedance 2.0、Sora 一类)造出的换脸视频已经没有明显拼接边界,逐帧看也挑不出低级瑕疵。传统检测器和多模态大模型(MLLM)如果只用一个模型、一个视角去看,往往会漏掉这些微弱痕迹,换一批没见过的生成方法就失灵。

现有基准也偏旧:覆盖的生成方法有限,大多只给「真/假」二值标签,没有可解释的取证说明。这篇同时补两块:一个 10 万规模、覆盖 33 种生成方法的新基准 FaceVid-Forensics-100K,以及一套全用开源小模型搭出来、却在跨生成器泛化上反超闭源 GPT/Gemini 的检测框架 ARGUS。

方法

核心是把「一张脸是真是假」拆成四个互不干扰的取证视角,各交给一个专家 agent:

四个 agent 各自只输出「观察到的现象」,不下真假结论。这步刻意分开,是为了防止单一瑕疵带偏整个判断。最后由一个裁判 agent 汇总四份报告,权衡相互印证或冲突的证据,给出真假判定加一段取证解释。

训练分两段:先对四个观察 agent 和裁判做监督微调(SFT),再用 GRPO(一种策略优化)单独打磨裁判的判定准确率,观察 agent 冻结。

配套的标注管线同样关键:五个 MLLM(GPT-4o、Gemini 3.5 Flash、Qwen2.5-VL 等)各自给观察,DeepSeek-V4 Pro 在四个维度上分别做冲突消解,产出与最终判定一致的取证解释。

结果

最关键的是跨生成器(OOD)测试,即在训练时没见过的生成方法上评测:

方法类别准确率召回率F1
小型视觉模型(最佳)64.28%42.97%45.20%
闭源 MLLM(最佳,Gemini-2.5-Pro)63.78%75.29%47.45%
ARGUS(裁判不看视频)67.41%65.00%51.01%
ARGUS(裁判看视频)69.87%81.82%53.28%

F1 比最强的闭源单模型基线(Gemini-2.5-Pro 的 47.45%)高 5.83 个百分点,而这套框架全部由 7B-8B 级的开源小模型组成。让裁判 agent 直接看视频帧,F1 从 51.01% 再升到 53.28%。

两组数要诚实看。在见过的生成方法上(域内),专门的视觉检测器 TFCU 仍以 98.66% 准确率碾压这套框架的 87.34%。这套框架赢的是泛化和可解释性,不是域内最高分。另外 53% 的 F1 意味着召回虽高(81.82%),但误报不少,这反映未见生成器检测本身极难。解释质量上,DeepSeek-V4 Pro 给它打 6.37 分(满分 10),GPT-5-mini 给同类方法打 6.25 分。单视频推理延迟 5.79 到 6.13 秒。

为什么重要

对从业者来说,这套框架的价值在两点。一是可解释:它不只吐一个真假标签,还给出「光照不自洽」「头发缺乏发丝级运动」这种取证理由,适合需要向人交代的场景,比如内容审核、取证、投诉处理。二是用小模型打败大模型:7B-8B 开源模型的组合在泛化上超过了 GPT-5.5、Gemini 这类闭源大模型,说明「分工」这条路在检测这类需要多视角的任务上,比单纯堆大模型更划算。

如果你做的是已知生成方法的离线检测,专门训练的小视觉模型更准更快;如果面对源源不断的新生成器、且要给出理由,这套思路值得借鉴。10 万视频带细粒度标注的基准本身也是个可直接用的资产。

局限与存疑

术语

原文与代码

相关论文

全部论文解读