Apple 论文:模型 top-k logits 也能泄露任务无关信息

sineadwilliamso · x · 2026-10-07

Apple 团队在 COLM 发表论文《What do your logits know?》,以视觉语言模型为实验对象,系统比较了信息从残差流经过两个自然瓶颈(tuned lens 得到的低维投影、最终 top-k logits)后被保留的程度。

核心发现:即使是最容易获取的瓶颈——模型 top logit 值——也可能泄露图像查询中与任务无关的信息,某些情况下泄露量与直接投影完整残差流相当。作者指出这对隐私、公平性、模型蒸馏和可解释性都有直接影响:最终 logits 远非最小信息瓶颈,模型拥有者以为不可访问的信息可能被用户无意或恶意提取。

所属事件:研究:视觉语言模型 top-k logits 泄露远超预期的图像信息(8 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →