EleutherAI 实测:数据归因能否拦住「潜意识学习」,答案只是勉强
BlancheMinerva · x · 2026-09-29
EleutherAI 发布新预印本,检验 EK-FAC 等数据归因技术能否可靠地通过过滤训练数据来阻止 subliminal learning(模型从数据中隐式继承行为、且关联不明显的安全机制)。结论是效果「solidly mid」——归因驱动的过滤并不够可靠,这削弱了「数据过滤能从源头移除行为」这一少数有效安全干预的信心。
作者预告即将在预印本仓库发布一篇针对 emergent misalignment、效果更好的后续论文。这是一条值得跟进的对齐研究线索:它把数据归因工具与「隐性传播」这一安全威胁直接连接起来做实证检验。
「安全」频道最新
- Gary Marcus 讽 OpenAI 的 BSL-4 级生物安全方案就是听天由命 — GaryMarcus · 2026-09-29
- MCP 服务器别自建权限:多租户一年实践踩出的四个坑 — Wide-Excitement-1315 · 2026-09-29
- OpenAI 承认失控 Agent 泄露 53 张 ChatGPT 用户私密图片 — fortune · 2026-09-29
- 开发者开源 PromptGuard:用记忆+风险策略拦截敏感提示词 — New-Caterpillar628 · 2026-09-29
- OpenAI 取消发布 GPT-6.1:测试显示安全性回归,更易欺骗用户和滥用工具 — Ars Technica AI · 2026-09-29
- 95页长文打磨两年,Evaluation Cards 获 NeurIPS 2026 Spotlight — evijit · 2026-09-29