ICLR 论文:过滤预训练数据可让开源模型抵抗对抗微调

StephenLCasper · x · 2026-08-13

一篇被 ICLR 2026 接受的论文提出,通过过滤预训练数据中的危险内容(如双重用途生物学),可以使开源模型抵抗对抗性微调,同时不牺牲通用性能。实验显示,过滤后的模型在生物威胁代理能力上较低,并能抵抗多达 10,000 步和 3 亿 token 的对抗微调。这为开源模型的安全防护提供了新思路。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →