研究发现:top-k logits 泄露的信息量与 tuned lens 相当

sineadwilliamso · x · 2026-10-07

可解释性研究者 Sinead Williamson 的跟进结论:在维度对齐后,top-k logits 泄露的目标属性信息与 tuned lens 轨迹相当,而对终端用户而言获取门槛低得多。

其前一条推文指出:当 k≈10-13 时目标属性已可稳定恢复;随 k 增大,连背景对象属性都能被解码。这意味着仅通过 API 暴露的 top-k logits 就可能反推敏感属性,值得关注隐私与安全影响。

所属事件:研究:视觉语言模型 top-k logits 泄露远超预期的图像信息(8 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →