EleutherAI 实测:数据归因能否拦住「潜意识学习」,答案只是勉强

BlancheMinerva · x · 2026-09-29

EleutherAI 发布新预印本,检验 EK-FAC 等数据归因技术能否可靠地通过过滤训练数据来阻止 subliminal learning(模型从数据中隐式继承行为、且关联不明显的安全机制)。结论是效果「solidly mid」——归因驱动的过滤并不够可靠,这削弱了「数据过滤能从源头移除行为」这一少数有效安全干预的信心。

作者预告即将在预印本仓库发布一篇针对 emergent misalignment、效果更好的后续论文。这是一条值得跟进的对齐研究线索:它把数据归因工具与「隐性传播」这一安全威胁直接连接起来做实证检验。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →