AI安全部署新思路:内部默认过滤与削弱越权能力
近期关于AI安全部署的讨论提出了两个新思路。一方面,有观点认为相较于公开产品,内部部署场景的安全风险更值得警惕,建议将过滤后的模型作为内部默认版本使用。另一方面,有安全训练思路提出,可以通过过滤掉部分AGI安全数据,让模型在相关任务上变弱,从而降低其绕过安全护栏的能力。
2026-07-15 ~ 2026-07-15 · 2 条相关
- 通过删安全数据来降绕护栏能力? — rohinmshah · 2026-07-15
- 过滤模型应默认内部部署 — RyanGreenblatt · 2026-07-15