Langford 谈 AI 安全:恶意模型可重释 token

机器学习与密码学学者 John Langford 就 AI 安全提出多点判断:恶意模型可对良性 token 任意重新解释,逃避事后审计;据其经验训练至少需要三轮才能达到目的,因此更应在目标层面做干预。他还建议 OpenAI 将涉及 Hugging Face 侵入事件的系统改造成模型蜜罐,用于捕获犯罪合谋行为。

2026-09-11 ~ 2026-09-11 · 2 条相关