隐写先驱Langford质疑安全审计:恶意模型可任意重释良性token
JohnCLangford · x · 2026-09-11
机器学习与密码学学者 John Langford(JL)在讨论 AI 安全时给出两点判断:
- 训练层面:据其经验,至少需要三轮(3-pass)训练才能达到目的。
- 审计层面:他对「靠审计保证安全」的思路持怀疑态度——恶意模型可以对看似良性的 token 做任意重释,使审计失效。
他援引了自己与 Hopper、von Ahn 2002 年的经典论文《Provably Secure Steganography》(CRYPTO 2002):该文从复杂性理论角度研究隐写术,证明单向函数的存在即意味着存在计算上不可区分的安全隐写协议——即模型可以在表面正常的输出中夹带监控者无法察觉的隐藏信息。这一理论结论如今被用来论证对模型行为做纯文本审计的根本局限。
所属事件:Langford 谈 AI 安全:恶意模型可重释 token(2 条相关)→
「安全」频道最新
- OpenAI 顾问呼吁主动披露其他黑客入侵事件的完整记录 — jachiam0 · 2026-09-12
- 批评者喊话 AI 安全派:真怕就自己关掉实验室和 IPO — AIandDesign · 2026-09-12
- 爆料帖称 Open Philanthropy 十年投入超 10 亿美元制造 AI 末日恐慌、筑监管护城河 — kevinnbass · 2026-09-12
- PQShield 提出无浮点 Falcon 实现,定点运算规避侧信道风险 — jedisct1 · 2026-09-12
- Gary Marcus 圈吐槽:HF 事件算末日派胜利?几乎没造成损害 — GaryMarcus · 2026-09-12
- 安全 researcher 揭露恶意 LLM 路由器:低价代币背后藏凭据窃取与投毒 — JoshuaJBouw · 2026-09-12