研究:视觉语言模型 top-k logits 泄露远超预期的图像信息
@sineadwilliamso 及其 Apple 团队将在 COLM 2026 展示论文《What do your logits know?》,研究一个简单但重要的问题:当用是/否问题查询视觉语言模型对图像的判断时,输出会泄露多少与任务无关的信息?答案是远超预期——最终 logits 远非最小信息瓶颈,这一发现对隐私、公平、蒸馏和可解释性都有直接影响,值得 API 提供方与研究社区警惕。
已确认
- 论文系统比较了视觉语言模型不同表征层级保留的信息:从信息丰富的残差流,经过 tuned lens 投影和最终 top-k logits 两个自然瓶颈。
- 残差流几乎编码了场景的一切信息,无论是否被询问;即便只有 top-2 logits 也会泄露与任务无关的信息——例如问"有没有蓝色球?",logits 就能暴露从未提及的球体材质和尺寸。
- 在维度匹配后,top-k logits 泄露的信息量与 tuned lens 轨迹相当,而前者对终端用户更容易获取。
- 量化结论:当 top-k 的 k 达到约 10-13 时,目标属性已可稳定恢复;随着 k 增大,连背景物体的属性也变得可解码。
- 仅凭 API 暴露的 top-20 logits,约 100 次查询即可恢复未被询问的属性。
为什么重要
- 许多推理 API 都会向终端用户暴露 top-k logits,这意味着普通用户即可在少量查询内提取模型未被询问感知的属性,构成实际的隐私泄露风险。
- 对模型蒸馏方而言,top-k logits 是比内部表征更易得的信号来源;对可解释性研究而言,也需重新评估最终输出层的信息含量。
2026-10-07 ~ 2026-10-07 · 8 条相关
一手来源
- COLM 2026 论文:是/否查询的 logits 泄露远超预期的图像信息 — sineadwilliamso ·
- COLM 2026 论文系统对比视觉语言模型各级表征的信息泄露 — sineadwilliamso ·
- 仅凭 top-20 logits 约 100 次查询即可恢复未询问属性 — sineadwilliamso ·
- 【源头】COLM 2026 论文:是/否查询的 logits 泄露远超预期的图像信息 — sineadwilliamso · 2026-10-07
- 【源头】COLM 2026 论文系统对比视觉语言模型各级表征的信息泄露 — sineadwilliamso · 2026-10-07
- 问球是不是蓝的,logits 却泄露了球的材质和尺寸 — sineadwilliamso · 2026-10-07
- k≈10-13 即可稳定恢复目标属性,k 越大背景物体也可解码 — sineadwilliamso · 2026-10-07
- 【源头】仅凭 top-20 logits 约 100 次查询即可恢复未询问属性 — sineadwilliamso · 2026-10-07
- 研究警告:最终 logits 远非最小信息瓶颈,涉隐私与蒸馏 — sineadwilliamso · 2026-10-07
- Apple 论文:模型 top-k logits 也能泄露任务无关信息 — sineadwilliamso · 2026-10-07
- 研究发现:top-k logits 泄露的信息量与 tuned lens 相当 — sineadwilliamso · 2026-10-07