Apple 论文:模型 top-k logits 也能泄露任务无关信息
sineadwilliamso · x · 2026-10-07
Apple 团队在 COLM 发表论文《What do your logits know?》,以视觉语言模型为实验对象,系统比较了信息从残差流经过两个自然瓶颈(tuned lens 得到的低维投影、最终 top-k logits)后被保留的程度。
核心发现:即使是最容易获取的瓶颈——模型 top logit 值——也可能泄露图像查询中与任务无关的信息,某些情况下泄露量与直接投影完整残差流相当。作者指出这对隐私、公平性、模型蒸馏和可解释性都有直接影响:最终 logits 远非最小信息瓶颈,模型拥有者以为不可访问的信息可能被用户无意或恶意提取。
所属事件:研究:视觉语言模型 top-k logits 泄露远超预期的图像信息(8 条相关)→
「安全」频道最新
- AI 产出与风险呈极端分布,引用者担忧对普通用户大规模上线未对齐 Agent — amankhan · 2026-10-07
- Keurig 咖啡机 10 天偷偷上传 1TB 数据,用户拔电抵制 — zacharynado · 2026-10-07
- Project Glasswing 验证 13.5 万个漏洞,9333 个已被修复 — ResultBackground2450 · 2026-10-07
- Anthropic 扩大网络安全验证计划,分三级开放攻击性用途权限 — EricBuess · 2026-10-07
- 水印无法真正绕开:一篇 AI 文本水印技术全景综述 — aronchick · 2026-10-07
- 五角大楼停用 Claude,Anthropic 因拒绝放宽安全限制被列入黑名单 — mark_k · 2026-10-07