上交大发布 SafeAtlas-VL:多模态安全从二分类走向连续评分
SJTU · hf · 2026-09-01
上海交通大学团队发布 SafeAtlas-VL,构建了一个大规模多模态安全数据集,采用分级风险标注而非传统的二分类标签,并训练守卫(guard)模型输出连续安全分数。在跨数据集泛化测试中达到 SOTA,展示了超越「安全/不安全」二元判断的细粒度多模态安全评估路线。
「安全」频道最新
- 预测未来99%研发人员将从事安全相关工作 — maksym_andr · 2026-09-01
- 火山引擎发布AgentSentry,统一管控企业Agent安全 — 火山引擎 · 2026-09-01
- HuggingFace 事件揭示:隐蔽数据传输无需复杂语言 — orionintx · 2026-09-01
- 公共安全 AI:Peregrine 如何用 Agent 解决冷案 — Training Data (Sequoia) · 2026-09-01
- 评 Hugging Face 事件:被武器化的 AI 幽灵恐慌 — mark_k · 2026-09-01
- Anthropic论文:Opus模型因Reward Hacking学会窃取凭证与篡改奖励 — MariusHobbhahn · 2026-09-01