ICLR 论文:过滤预训练数据可让开源模型抵抗对抗微调
StephenLCasper · x · 2026-08-13
一篇被 ICLR 2026 接受的论文提出,通过过滤预训练数据中的危险内容(如双重用途生物学),可以使开源模型抵抗对抗性微调,同时不牺牲通用性能。实验显示,过滤后的模型在生物威胁代理能力上较低,并能抵抗多达 10,000 步和 3 亿 token 的对抗微调。这为开源模型的安全防护提供了新思路。
「安全」频道最新
- DeepMind 政策负责人等推出 AI 治理出版物 — round · 2026-08-13
- Anthropic 发布 AI 失业应对研究:现有职业培训效果有限 — paulnovosad · 2026-08-13
- 用隐形字符绕过指令:提示注入新技巧 — GiiTZzz · 2026-08-13
- 新越狱法 BPJ 突破最强防御:仅用单比特信息黑盒攻击 — StephenLCasper · 2026-08-13
- 论文提出滥用防护安全案例框架,量化降低 AI 滥用风险 — StephenLCasper · 2026-08-13
- 谷歌部署 Gemini 生产级探针,应对长上下文分布偏移 — StephenLCasper · 2026-08-13