通过删安全数据来降绕护栏能力?

rohinmshah · x · 2026-07-15

这条回复讨论了一个安全训练思路:**过滤掉部分 AGI safety 数据**,让模型在相关任务上变弱,从而降低它**绕过安全护栏**的能力。 ### 核心逻辑 - 该思路隐含前提是:当前默认/主流模型已经具备一定的“规避安全措施”能力 - 如果模型更弱,就更难利用这些能力去**subvert safeguards**(破坏或绕过安全保护) - 因此,减少这类数据并不是单纯“少教一点安全”,而是在控制模型可能被滥用的上限 ### 争议点 这类策略成立的前提,是你真的相信“更强的安全能力”会同时提升模型的反制/绕过能力;否则,删减安全数据可能反而削弱防护。

所属事件:AI安全部署新思路:内部默认过滤与削弱越权能力(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →