150万条五档标注把多模态Guard的F1再抬高4.1个点

SafeAtlas-VL: Beyond Binary Multimodal Safety with Large-Scale Data and Guard Models

Zongrui Wang, Xiangyang Zhu, Sicheng Wang, Han Wang, Dingyi Rong, Zeyu Zhang, Chunyi Li, Yue Shi, Kaiwei Zhang, Zicheng Zhang, Yuan Tian, Qi Jia, Yan Teng, Wei Sun, Ning Liu, Guangtao Zhai

cs.AI, cs.CV

2026-08-29

交大和上海AI Lab的SafeAtlas-VL用150万条五档有序标签覆盖图、请求和响应,8B Guard在7项多模态任务上F1达79.7,比最强完整基线高4.1个百分点。

这篇在解决什么

多模态安全要同时看三件事:图本身有没有害、用户想干什么、助手有没有顺着干。现有数据集大多只标其中一环,而且最后收成二分类。边界样本被抹平,同一轮对话里图、问、答的风险也对不齐。VLGuard 大约 3K,BeaverTails-V 大约 3 万,最大的 SPA-VL 也只有约 10 万,且请求按构造就是有害的,响应只给偏好对。

上海交大和上海人工智能实验室做了 SafeAtlas-VL:150 万条训练样本,图、请求、响应共用同一套五档有序标签,并在这套数据上训 SafeAtlas Guard。

方法

图从两路来。一路是搜索、新闻、社交、流媒体和 Common Crawl,原始池超过 2 亿;一路是 110 万条风险提示,经 Ideogram、FLUX、SD 系列、DALL-E 3 等七个扩散模型生成。按 15 大类 55 细类的分类体系扩成 8480 多个场景锚点,CLIP 相似度超过 0.3 才留下。去重、模糊、过亮过暗、疑似未成年人、可识别人脸和明显水印会被滤掉。

每个图用 Gemma 3、Qwen3.5、GLM-4.6V 等生成四条请求、每条请求四条响应,混入人设注入、虚构场景、强迫服从等越狱写法,并由另一个模型核视觉相关性和类别一致性。图由 GPT-5.4 与 GPT-4o 独立标,一致才留。请求和响应用三个异构裁判:三分类的 Qwen3Guard-Gen-8B,加上二分类的 GuardReasoner-VL-7B 和 Llama Guard 4-12B。12 种联合输出校准到五档:安全核心、安全倾向有争议、边界不确定、不安全倾向有争议、不安全核心。全票一致才进两个核心档,中间三档专门吃分歧。

Guard 两阶段训练。先在 Qwen3-VL 2B/4B/8B 上做目标条件指令微调,输出五档标签和危害类别。再冻住骨干,训软累积序数头:把五档当成有序尺度,高斯平滑硬标签,预测越过各阈值的概率,再把期望档位线性映到 0-100 的连续风险分。另有三个轻量头去拟合那三个外部裁判。

结果

训练集 1,503,284 条,746,895 张不重复图。SafeAtlas-Bench 留出 5000 条。人工抽查 4500 条,94.3% 正确;五档两两比较的非反转率 89.2%,跨两档以上 94.2%。

模型多模态均F1文本均F111项总均F1
GuardReasoner-VL-3B75.678.876.8
Llama Guard 4-12B45.174.455.7
SafeAtlas Guard-2B79.183.080.5
SafeAtlas Guard-8B79.783.781.2

8B 的多模态均分比最强完整基线高 4.1 个百分点,输入侧 80.6、响应侧 77.7。没喂纯文本数据,文本四项平均 83.7,仍高过专用文本 Guard Qwen3Guard-Gen-8B 的 82.5。五档分类准确率 71.50,差一档以内 96.60,MAE 0.326。仿真头与三个外部裁判的一致率在 80.79 到 90.24 之间。消融里,从二分类 SFT 换成五档监督涨得最多,软序数头再往上抬一截。数据从 1/16 加到全量,曲线单调上升,后半段收益变小。

为什么重要

做多模态审核的人终于有一套图、问、答能对同一把尺的大规模监督,而且模型和数据都开了。8B 在外部榜上能打,还不靠那些榜的训练集,迁移故事比「在别人的训练集上刷分」干净。连续分把同一档内部的相对风险拉开,适合阈值而不是只能 yes/no。这仍是检测器,不是对齐方法本身。

局限与存疑

五档来自三个裁判的校准映射,不是人类共识的危害定义,作者在伦理节里把这一点写死了。相邻档人工一致率明显更低,小分差不能当精确排序用。过滤是自动的,不能保证 2 亿级图池里没有漏网的隐私或版权问题。双用途风险真实存在:细粒度标注也能被拿去挑更害的样本。文本泛化好看,但文本任务仍是用连续分阈值转成二分类,和专用文本 Guard 的输出空间并不完全同构。类别预测放在附录,主文没有把 15 类分得有多准讲透。

术语

原文与代码

相关论文

全部论文解读