Privacy Failure in Split-LLM Training, The Returned Gradient Nullifies the Decoys
Georgios Politis, Evangelos Pappas
cs.CR, cs.DC, cs.LG
2026-09-04
拆分训练返回的梯度在诱饵行上恒为零,九个种子每轮4096帧全部标出32条真实行;前向隐私门全过,并上梯度就破,按行裁剪加噪约贵0.01 nats。
Split learning把一层Transformer栈租给云:可信本地节点(TLN)留着数据和损失,不可信云节点(UCN)只看到中间激活。隐私声明是云读不到训练文本。这份系统安全个案跟的是一个两节点拆分LLM训练器:前向激活加了瓶颈、旋转、置换、裁剪和噪声,还在每帧里混进诱饵行。原评测只打前向线,过了隐私门。回传给云的输出梯度根本不在对手视野里。
实现上还有一个更硬的缺陷。损失不算诱饵行,诱饵行的梯度就是精确的零。零的位置等于真实行的位置。诱饵本用来把32条真实样本藏进80行里,梯度把这个匿名集当场拆掉。
模型是Qwen3-0.6B,主配置在第14层切开、第26层接回,云上11层。语料WikiText-2,按定宽块切开,不是按文档。每帧32条真实行加48条诱饵,潜变量宽度D=64。前向激活按行裁剪C=1.0、高斯σ=0.35C;主实验的回传梯度不裁不噪。
协议事先钉死。先在已知剂量上注入泄漏,确认仪器看得到;再跑打乱标签的负对照,确认没有泄漏时不会报警;门限在跑数据前定好:token top-1相对「总猜最频繁token」的Bonferroni-Wilson上界超过+1.0个百分点就算破门,效用门是持出交叉熵增幅不超过0.35 nats。种子42到47探索,48到50复制,51到53做可部署拓扑和缓解。
结构泄漏是决定性的。九个种子、每个4,096帧,零支撑与真/假行划分的行一致率为1.000,4096/4096。云可以先扔掉48条诱饵,再对剩下32行做内容攻击。
内容侧是另一档。高频token探针相对恒常基线的配对效应,复制种子上大约+0.65到+1.50个百分点,九个封装种子的随机效应估计是+0.92,95%区间[0.74, 1.09]。打乱标签对照贴地(绝对值不超过0.08个百分点)。这不是文本重建,稀有token回收在梯度臂上是零。
主配置自己就没过效用门(持出损失约0.90 nats,门在0.35)。浅切四层的缓解拓扑在两个语料、三个种子上,前向门和效用门都过,但前向加梯度的联合视图6/6破门(门统计约+1.44到+2.18个百分点)。按行把回传梯度裁到C=0.01再加同样比例的高斯噪声,结构划分变成0/1024,探针贴地,持出代价约0.01 nats。
深度和宽度影响的是「划分能不能换成token优势」,不是划分本身。11到12层委托、D=64或96时内容效应能检出;8层、6层或D=128时内容效应贴地。划分在每个格子里都是精确的。五类攻击从未测:成员属性、响应侧、时序元数据、有状态远端、跨步累积。
给拆分训练过隐私门的人,这是一条很窄但很硬的教训:没写进对手视野的通道,门再绿也是假的。诱饵行加「损失忽略诱饵」是会自己打自己的组合,梯度支撑会把填充变成摆设。内容重建在这篇里并不强,大约每百个token多猜对一个;结构元数据是全中的。缓解很便宜,按行裁剪加噪大约0.01 nats,前提是你真的把回传梯度当成隐私面。
这是一个系统的诊断,不是新的通用拆分学习攻击。作者自己把范围写死了。
只评了一套实现、一个0.6B模型和WikiText-2为主的语料。第二条语料是三种子诊断,推不出与语料无关。缓解跑是2000步诊断,不是收敛尺度。效用数字来自同一扁平流里的块级持出,不是文档级持出。未测那五类攻击,包括跨步累积。序列重建(TAG、LAMP一类)没有迁到这条切分边界上的输出梯度。内部打分器对上了九个种子到10⁻⁶个百分点,但预测张量不在发布包里,外部无法重跑那次核对。MINE读出接近0 nats的同一格子里,探针仍有+0.758个百分点,互信息下界当不了证书。