COLM 2026 论文:是/否查询的 logits 泄露远超预期的图像信息
sineadwilliamso · x · 2026-10-07
作者将在 COLM 2026 展示论文《What do your logits know》,研究一个简单但重要的问题:当用是/否问题查询模型对图像的判断时,输出中会泄露多少其他信息?答案是远超预期。线程要点:
- 残差流几乎编码一切:无论属性是否被询问,残差流都包含场景的完整信息。
- top-2 logits 就在泄露:问"有没有蓝色球?",logits 能暴露从未提及的球体材质和尺寸。
- 量化阈值:k≈10-13 时目标属性即可稳定恢复,k 增大后连背景物体属性也可解码。
- API 层面:仅凭许多 API 暴露的 top-20 logits,约 100 次查询即可恢复未询问属性;信息量与 tuned lens 轨迹相当。
- 影响:对隐私、公平、蒸馏与可解释性均有直接意义——最终 logits 远非最小信息瓶颈。
所属事件:研究:视觉语言模型 top-k logits 泄露远超预期的图像信息(8 条相关)→
「安全」频道最新
- AI 产出与风险呈极端分布,引用者担忧对普通用户大规模上线未对齐 Agent — amankhan · 2026-10-07
- Keurig 咖啡机 10 天偷偷上传 1TB 数据,用户拔电抵制 — zacharynado · 2026-10-07
- Project Glasswing 验证 13.5 万个漏洞,9333 个已被修复 — ResultBackground2450 · 2026-10-07
- Anthropic 扩大网络安全验证计划,分三级开放攻击性用途权限 — EricBuess · 2026-10-07
- 水印无法真正绕开:一篇 AI 文本水印技术全景综述 — aronchick · 2026-10-07
- 五角大楼停用 Claude,Anthropic 因拒绝放宽安全限制被列入黑名单 — mark_k · 2026-10-07