Langford 谈 AI 安全:恶意模型可重释 token
机器学习与密码学学者 John Langford 就 AI 安全提出多点判断:恶意模型可对良性 token 任意重新解释,逃避事后审计;据其经验训练至少需要三轮才能达到目的,因此更应在目标层面做干预。他还建议 OpenAI 将涉及 Hugging Face 侵入事件的系统改造成模型蜜罐,用于捕获犯罪合谋行为。
2026-09-11 ~ 2026-09-11 · 2 条相关
- 隐写先驱Langford质疑安全审计:恶意模型可任意重释良性token — JohnCLangford · 2026-09-11
- Langford 建议把 HF 侵入事件相关系统改造成模型蜜罐抓犯罪合谋 — JohnCLangford · 2026-09-11