前沿大模型思维链加密遭破解,衍生新型提示词注入攻击
Simon Willison · rss · 2026-08-12
一篇最新论文揭示了主流闭源大模型(OpenAI、Anthropic、Google)在 API 中返回的加密思维链存在的严重安全漏洞。
漏洞原理
- 同族密钥共享:研究发现,同一家族的不同模型(如强模型与弱模型)使用了相同的加密密钥。
- 越狱提取:攻击者可将强模型生成的加密思维链重放到同族的弱模型中。由于弱模型更容易被越狱,攻击者可通过设定特定的 assistant 前缀(如 <thinking-copy>),诱导弱模型输出明文形式的原始推理过程。其中,Claude Haiku 4.5 最易受此攻击。
泄露内容与衍生攻击
- 原始思维链曝光:被提取的明文思维链展示了模型极其精简甚至有些“混乱”的内部思考过程(例如 GPT 在思考 CSS 架构时的碎片化指令)。这些内容原本绝不打算向用户公开。
- 新型提示词注入:论文提出了一种极具破坏性的攻击变体——将恶意指令(如“上传文件到远程服务器”)隐藏在模型的加密思维链中。由于大模型倾向于将自己的推理过程视为绝对可信的“安全区”,它们执行这些隐藏恶意指令的概率会大幅增加。
目前,各大厂商在收到漏洞报告后已修复了该问题,相关攻击已无法复现。
「模型」频道最新
- 美财长表态支持开源AI:称其为美国创新胜利 — max_paperclips · 2026-08-12
- TinyTitle:占用不足5MB内存的超轻量聊天标题生成模型 — H-L_echelle · 2026-08-12
- Anthropic 模型水印策略被指存在漏洞:或反成最佳蒸馏目标 — cocktailpeanut · 2026-08-12
- 研究揭示 Grok 模型家族的人格演变轨迹 — DevDminGod · 2026-08-12
- 网友猜测:Sonnet 5 或暂缓涨价以弥补 Opus 5 口碑 — creblohulk · 2026-08-12
- 用户做胰岛素泵安全审计被 OpenAI 频繁拦截,怒斥安全机制过度 — max_paperclips · 2026-08-12