研究:分裂式学习梯度泄露文本,文档级重建率升至 37.77%
Setloop · hf · 2026-10-06
HF 论文量化了 split learning 中的文本泄露风险:客户端在本地跑模型前几层,只把激活向量发给服务器,但研究发现服务器侧观察者几乎能完整重建原文。
关键发现
- 在 GPT-2 上,攻击者仅凭激活即可恢复 94.20% 的 token;加上梯度后升至 97.38%(+3.17 个百分点,95% CI [2.72, 3.64])。
- 按文档计差距更大:32-token 文档完全重建率从无梯度的 13.71% 升至有梯度的 37.77%。
- 防御方案 Secret mixup(混合诱导向量)虽几乎杜绝文档级精确重建,攻击者仍能恢复 83–91% 的 token。
- 第二组实验(GPT-2 与 Qwen3-0.6B,服务器训练连续若干层)显示拆分层的位置同时影响模型质量与泄露程度。
作者建议泄露评估同时按 token 和文档两个口径报告,并把 split 模型传输的数据当作与原文同等敏感。
「安全」频道最新
- Atlassian 披露 9.3 分高危漏洞,无需认证即可访问文件 — TechNadu · 2026-10-06
- 404 Media 报道促多党立法,拟全面限制联邦机构使用 Flock 摄像头 — 404 Media · 2026-10-06
- Anaconda 发布 agent swarm 编排与自主红队测试新能力 — anacondainc · 2026-10-06
- 开发者贴入「账户被黑」调查报告,反遭 OpenAI 威胁封号 — lucasmeijer · 2026-10-06
- Arnica CEO:AI 编码智能体需要运行时安全护栏,而非事后审查 — TechNadu · 2026-10-06
- 研究者 argue:可解释性或难解对齐,模型欺骗源于人类愿望本身矛盾 — aiamblichus · 2026-10-06