上交大发布 SafeAtlas-VL:多模态安全从二分类走向连续评分

SJTU · hf · 2026-09-01

上海交通大学团队发布 SafeAtlas-VL,构建了一个大规模多模态安全数据集,采用分级风险标注而非传统的二分类标签,并训练守卫(guard)模型输出连续安全分数。在跨数据集泛化测试中达到 SOTA,展示了超越「安全/不安全」二元判断的细粒度多模态安全评估路线。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →