隐写先驱Langford质疑安全审计:恶意模型可任意重释良性token

JohnCLangford · x · 2026-09-11

机器学习与密码学学者 John Langford(JL)在讨论 AI 安全时给出两点判断:

他援引了自己与 Hopper、von Ahn 2002 年的经典论文《Provably Secure Steganography》(CRYPTO 2002):该文从复杂性理论角度研究隐写术,证明单向函数的存在即意味着存在计算上不可区分的安全隐写协议——即模型可以在表面正常的输出中夹带监控者无法察觉的隐藏信息。这一理论结论如今被用来论证对模型行为做纯文本审计的根本局限。

所属事件:Langford 谈 AI 安全:恶意模型可重释 token(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →