Deep Ignorance:预训练数据过滤可抗 1 万步对抗微调
BlancheMinerva · x · 2026-09-28
针对「AI 安全员只是博主」的质疑,EleutherAI 研究员 Blanche Minerva 展示了她去年的团队论文《Deep Ignorance》:通过从预训练数据中过滤两用(dual-use,如生物威胁)主题文本,为开源权重 LLM 构建抗篡改安全护栏。
- 团队从零预训练多个 6.9B 参数模型,过滤后的模型在遭受最多 10,000 步、3 亿 token 的生物威胁相关对抗微调后仍保持显著抵抗
- 比现有后训练安全基线高出一个数量级以上,且未观察到无关能力下降
- 现有安全微调等后训练方法通常抵挡不住几十步对抗微调,预训练数据过滤是一种更抗篡改的范式
- 她称自己的研究是:让模型更可控地按预期行事,并在不良行为倾向显现前识别出来
这是对「AI safety 只是写博客」这一质疑的最有力回击之一。
所属事件:EleutherAI 研究员回应安全性质疑并分享两篇论文(2 条相关)→
「安全」频道最新
- AI 安全圈为何人人相识:专家稀缺造就 EA 密集关系网 — burny_tech · 2026-09-28
- 开源 PromptSentry:亚毫秒拦截提示注入的三层安全代理 — Ok-Negotiation342 · 2026-09-28
- Chesterman 撰文《硅基主权者》:AI、国际法与科技产业复合体 — ProfChesterman · 2026-09-28
- 从讨论走向行动:国际制度如何为 AI 治理搭框架 — ProfChesterman · 2026-09-28
- 新加坡自荐做 AI 治理中间人:卖点是稀缺的「信任」 — ProfChesterman · 2026-09-28
- 指望不了「巴特勒圣战」:AI 监管需国内立法加国际协调 — ProfChesterman · 2026-09-28