EleutherAI 研究员回应安全性质疑并分享两篇论文

面对「AI 安全员只是博主」的质疑,EleutherAI 研究员 Blanche Minerva 分享了两项研究回应。其一是去年的团队论文《Deep Ignorance》,展示通过从预训练数据中过滤两用知识,可使模型抵御多达一万步的对抗微调;她还在讨论串中补充另一篇论文《Why Has Predicting Downstream Capabilities of Frontier AI Models Been So Hard?》,分析了模型规模为何难以预测下游能力的原因。

2026-09-28 ~ 2026-09-28 · 2 条相关