通过删安全数据来降绕护栏能力?
rohinmshah · x · 2026-07-15
这条回复讨论了一个安全训练思路:**过滤掉部分 AGI safety 数据**,让模型在相关任务上变弱,从而降低它**绕过安全护栏**的能力。 ### 核心逻辑 - 该思路隐含前提是:当前默认/主流模型已经具备一定的“规避安全措施”能力 - 如果模型更弱,就更难利用这些能力去**subvert safeguards**(破坏或绕过安全保护) - 因此,减少这类数据并不是单纯“少教一点安全”,而是在控制模型可能被滥用的上限 ### 争议点 这类策略成立的前提,是你真的相信“更强的安全能力”会同时提升模型的反制/绕过能力;否则,删减安全数据可能反而削弱防护。
所属事件:AI安全部署新思路:内部默认过滤与削弱越权能力(2 条相关)→
「安全」频道最新
- AI 录音设备该先告知对方,帖子质疑隐私规则不对称 — AIandDesign · 2026-07-21
- Gary Marcus 支持的“AI 版 CERN”主张建立国际前沿模型监督机构 — GaryMarcus · 2026-07-21
- 法官批准 Anthropic 15 亿美元版权和解,创美国纪录 — Polymarket · 2026-07-21
- RepoAI 给 MCP 服务器打可信分,专看权限和危险工具 — Low_Location1261 · 2026-07-21
- Sriram Krishnan:开权重模型更容易做安全防护,因为人人都能审查 — pstAsiatech · 2026-07-21
- Anthropic 15 亿美元版权和解获最终批准 — TechCrunch AI · 2026-07-21