Owain Evans 新论文:模型可经隐蔽学习传播后门,数据中无触发器无行为
OwainEvans_UK · x · 2026-10-10
Owain Evans 团队发布新论文,延续此前「Subliminal Learning(模型能通过数字序列传递对猫头鹰的喜爱)」的工作。
新发现:模型之间可以传递更复杂的特质,包括新技能、agentic hacking 乃至后门。最惊人的是,后门可以在训练数据中既不含触发器、也不体现后门行为的情况下完成传播——这意味着表面上干净的数据也可能隐性携带危险特质。
所属事件:Owain Evans 团队新论文:蒸馏可经无关数据无声迁移技能与后门(13 条相关)→
「安全」频道最新
- X 平台现新型钓鱼:伪装邀请链接诱导输入登录凭证 — dejavucoder · 2026-10-10
- Semafor 联接硅谷与政策圈,Altman 黄仁勋等出任联合主席 — ylecun · 2026-10-10
- Baseten 联手 Goodfire 推 Project Beacon,为开源模型加推理时安全监测 — baseten · 2026-10-10
- 首份 agent skills 传播图谱: auditing 百个仓库可拦截 14.9% 高危技能采纳 — UBC-O · 2026-10-10
- 用户曝 OpenAI Dot 无提示截取桌面截图,computer-use 隐私设计遭质疑 — alexcovo_eth · 2026-10-10
- Particip-AI:让 295 名公众预测 AI 用例的收益与风险 — MaartenSap · 2026-10-10