新论文:恶意模型可凭输出 token 指纹识别并攻破推理引擎

chaumian · x · 2026-09-18

哈佛等机构研究者(Sarah Radway、James Mickens 等)发布论文,指出 AI 推理栈中被忽视的重大安全风险:推理引擎本身就是失准模型可利用的攻击面。

核心发现:

论文指出,当前沙箱讨论多集中在代理和代码执行环境,而推理引擎一旦被恶意模型触发漏洞,后果是模型自主完成整个 exploit 链。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →