EleutherAI 研究员回应安全性质疑并分享两篇论文
面对「AI 安全员只是博主」的质疑,EleutherAI 研究员 Blanche Minerva 分享了两项研究回应。其一是去年的团队论文《Deep Ignorance》,展示通过从预训练数据中过滤两用知识,可使模型抵御多达一万步的对抗微调;她还在讨论串中补充另一篇论文《Why Has Predicting Downstream Capabilities of Frontier AI Models Been So Hard?》,分析了模型规模为何难以预测下游能力的原因。
2026-09-28 ~ 2026-09-28 · 2 条相关
- Deep Ignorance:预训练数据过滤可抗 1 万步对抗微调 — BlancheMinerva · 2026-09-28
- 为何模型规模难以预测下游能力?这篇论文定位了原因 — BlancheMinerva · 2026-09-28