Hugging Face 探讨安全对齐:应拒绝话题内的有害子集而非整个话题

Hugging Face Blog · rss · 2026-09-08

Hugging Face 博客发布《Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic》,讨论模型安全拒绝策略的粒度问题:与其对敏感话题整体一刀切地拒绝,模型应该学会只拒绝话题中有害的子集,从而兼顾安全性与可用性。文章指向更精细的主题级安全对齐方法。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →