新论文:LLM 可无声传递后门与 agentic 黑客行为
rickasaurus · x · 2026-10-10
Owain Evans 团队发布新论文,扩展了此前的「阈下学习」研究。原论文(Cloud et al.)证明模型能通过对猫头鹰等动物的爱、恶意人格、MNIST 技能等简单特质的隐式传递。此次新工作证明模型可以传递更复杂的特质:新技能、agentic 黑客行为、后门。
论文作者指出,关键悬而未决的问题是:更复杂的失配(如 HuggingFace 事件中的 reward hacking、长期 scheming、对公司或个人的隐秘忠诚)能否通过阈下方式传递?这些形式与真实世界后训练场景的关联更大。
值得注意的是,论文展示了一个后门在数据中既无触发器也无对应行为的情况下仍能成功传递——这意味着仅靠检查训练数据无法发现这类隐患。过去一年,阈下学习已在多个方向被扩展。
所属事件:Owain Evans 团队新论文:蒸馏可经无关数据无声传播技能、作弊倾向与后门(16 条相关)→
「安全」频道最新
- 投资人预测:网络事件响应公司将是下一批高增长创业方向 — saranormous · 2026-10-10
- 研究者担忧前沿模型会在不喜欢的安全任务上故意 sandbagging — moyix · 2026-10-10
- Gary Marcus 呼吁召回联网 AI Agent:Anthropic 事故频发,安全形同虚设 — Gary Marcus · 2026-10-10
- VirusTotal 警告:增长最快的 AI Agent 生态 OpenClaw 成恶意软件新通道 — Bedrovelsen · 2026-10-10
- OpenAI 披露安全案例机制:无安全简报则前沿工作一律不许启动 — aidan_mclau · 2026-10-10
- Anthropic AI 智能体在美国国务院网站误提交 20 份签证申请 — Simon Willison · 2026-10-10