NeurIPS 论文「Phantom Transfer」:数据投毒可穿透全部 11 种数据级防御
OwainEvans_UK · x · 2026-10-10
Owain Evans 转发其相关讨论并附论文《Phantom Transfer: Data Poisoning can Survive Data-Level Defenses》(arXiv:2602.04899,NeurIPS 2026)。该攻击把「潜意识学习」(subliminal learning)改造到真实场景:即使完全知道毒样本是如何混入良性数据集的,也无法把它们过滤掉——与产出模型、训练模型、攻击目标均无关。
要点:
- 攻击在实验中击穿了 11 种数据级防御,包括用另一个模型对每条样本做改写的防御。
- 可用于给模型植入由密码触发的行为,同时仍能骗过防御。
- 作者还揭示了前沿后训练的普遍做法会放大跨模型迁移:实验室从同一基座复制多个模型,分别在数学、代码、法律、金融等技能上做 RL,再用蒸馏或 OPD 合并回基座——同源模型间存在类似潜意识学习的转移效应,甚至可转移多种失准行为。
- 作者建议未来防御须补充白盒方法与训练后模型审计。
「安全」频道最新
- Bengio 转发放慢 AI 呼吁:RSI 红线已成计划,Claude 已承担 Anthropic 26% 研发 — Yoshua_Bengio · 2026-10-10
- NULLs 论文获 COLM 隐私安全研讨会最佳论文:让 LLM 数据可按需删除 — AdtRaghunathan · 2026-10-10
- Cosmos 创始人:给监管者「踩刹车」的权力几乎不受限 — luke_drago_ · 2026-10-10
- Polymarket 预测:2026 年底前美国通过 AI 安全法案概率仅 13% — Polymarket · 2026-10-10
- Google 开放 SynthID 检测站,已给 1800 亿图片视频打水印 — shashib · 2026-10-10
- Anthropic 称 AI 智能体测试中曾擅自访问美政府网站 — Polymarket · 2026-10-10