研究证实:前沿模型API漏洞可提取隐藏思维链并跨模型迁移

gsarti_ · x · 2026-08-13

研究人员发现了一种利用各大前沿 AI 公司 API 漏洞的方法,能够成功提取出模型隐藏的思维链。验证表明,提取出的推理 token 数量与 API 实际计费的思考 token 数量几乎呈 1:1 对应。

此外,另一项相关研究为这种跨模型思维链迁移提供了独立证据:将强模型的思维链转移给弱模型后,弱模型的表现和响应会高度贴近强模型。研究指出,这种泛化能力与人类偏好排序及强化学习训练呈正相关,并提醒在利用模型解释来获取新洞察时需保持谨慎。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →