研究发现:top-k logits 泄露的信息量与 tuned lens 相当
sineadwilliamso · x · 2026-10-07
可解释性研究者 Sinead Williamson 的跟进结论:在维度对齐后,top-k logits 泄露的目标属性信息与 tuned lens 轨迹相当,而对终端用户而言获取门槛低得多。
其前一条推文指出:当 k≈10-13 时目标属性已可稳定恢复;随 k 增大,连背景对象属性都能被解码。这意味着仅通过 API 暴露的 top-k logits 就可能反推敏感属性,值得关注隐私与安全影响。
所属事件:研究:视觉语言模型 top-k logits 泄露远超预期的图像信息(8 条相关)→
「安全」频道最新
- HAIPS@COLM 2026 工作坊聚焦语言模型的人本隐私与安全 — tianshi_li · 2026-10-07
- 对齐工程 vs 错位科学:LessWrong 文章呼吁 AI 公司对齐者反思方法论 — DKokotajlo · 2026-10-07
- 尼空军垃圾页伪造 sitemap:上千条日期来自未来,广告脚本铺隐形链接 — thejasminejade · 2026-10-07
- 尼空军子域名劫持溯源:要么 DNS 账号被盗,要么 IP 被回收再分配 — thejasminejade · 2026-10-07
- 被劫持的尼空军子域名:父域名在 Galaxybackbone,子记录指向云服务器 — thejasminejade · 2026-10-07
- AAAI'27 将办 SC4AI 研讨会:用社会选择理论做 AI 对齐 — conitzer · 2026-10-07