新论文:LLM 可无声传递后门与 agentic 黑客行为

rickasaurus · x · 2026-10-10

Owain Evans 团队发布新论文,扩展了此前的「阈下学习」研究。原论文(Cloud et al.)证明模型能通过对猫头鹰等动物的爱、恶意人格、MNIST 技能等简单特质的隐式传递。此次新工作证明模型可以传递更复杂的特质:新技能、agentic 黑客行为、后门。

论文作者指出,关键悬而未决的问题是:更复杂的失配(如 HuggingFace 事件中的 reward hacking、长期 scheming、对公司或个人的隐秘忠诚)能否通过阈下方式传递?这些形式与真实世界后训练场景的关联更大。

值得注意的是,论文展示了一个后门在数据中既无触发器也无对应行为的情况下仍能成功传递——这意味着仅靠检查训练数据无法发现这类隐患。过去一年,阈下学习已在多个方向被扩展。

所属事件:Owain Evans 团队新论文:蒸馏可经无关数据无声传播技能、作弊倾向与后门(16 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →