Deep Ignorance:预训练数据过滤可抗 1 万步对抗微调

BlancheMinerva · x · 2026-09-28

针对「AI 安全员只是博主」的质疑,EleutherAI 研究员 Blanche Minerva 展示了她去年的团队论文《Deep Ignorance》:通过从预训练数据中过滤两用(dual-use,如生物威胁)主题文本,为开源权重 LLM 构建抗篡改安全护栏。

这是对「AI safety 只是写博客」这一质疑的最有力回击之一。

所属事件:EleutherAI 研究员回应安全性质疑并分享两篇论文(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →