Hugging Face 探讨安全对齐:应拒绝话题内的有害子集而非整个话题
Hugging Face Blog · rss · 2026-09-08
Hugging Face 博客发布《Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic》,讨论模型安全拒绝策略的粒度问题:与其对敏感话题整体一刀切地拒绝,模型应该学会只拒绝话题中有害的子集,从而兼顾安全性与可用性。文章指向更精细的主题级安全对齐方法。
「安全」频道最新
- ECCV 论文:场景坐标回归模型可被攻击重建训练场景 3D 几何 — ducha_aiki · 2026-09-08
- ECCV 2026 将办隐私保护视觉定位工作坊,Brachmann 等五人受邀演讲 — ducha_aiki · 2026-09-08
- 发布前先攻破自己的 agent:多轮攻击让失败看似无害 — iayanpahwa · 2026-09-08
- AI 安全公司 Xbow 智能体让浏览器「弹出计算器」,拿下 25 万美元赏金 — moyix · 2026-09-08
- 学者:OpenAI/Hugging Face 事件里最令人担忧的部分没被充分讨论 — skdh · 2026-09-08
- Google GTIG 报告:攻击者已从 prompt 转向 agent 化自动攻击 — ChuckDBrooks · 2026-09-08