专题 · FULL STORY

闭源大模型API漏洞致隐藏思维链被窃取

近期长达116页的研究揭示OpenAI等主流大模型API存在严重漏洞,攻击者可提取加密的思维链并蒸馏其推理能力。随后业界广泛证实该隐患,密码学家也严厉批评了厂商对安全研究的漠视。

2026-08-10 ~ 2026-08-13 · 4 集 · 64 条

第 1 集 · 研究揭示API漏洞可提取加密思维链并现蒸馏证据(2026-08-10,38 条)

一项长达116页的研究揭示了OpenAI、Anthropic和Google等主流大模型厂商在API安全架构上的严重漏洞。研究人员发现,通过将强模型生成的加密思维链重放给同族较弱的模型并进行越狱,即可绕过防线迫使弱模型逐字转录隐藏的推理过程。该漏洞不仅导致核心推理逻辑可被大规模窃取,研究还发现了部分模型疑似进行蒸馏的证据,对现有的安全防护体系提出了严峻挑战。

已确认

  • 漏洞机制:厂商通常将思维链加密后返回客户端以保护知识产权。但研究人员发现,这些加密块在同一厂商的不同会话、用户和模型间完全兼容且可互换。利用此特性,攻击者无需直接攻击强模型,只需对重放了推理痕迹的弱模型(如Llama、Haiku)进行越狱,即可成功解密并提取强模型的隐藏推理内容。专家验证,提取出的推理token数量与API计费的思考token数量几乎完全一致(1:1匹配),证明加密过程可被100%还原。
  • 安全威胁:该漏洞会引发严重的安全问题,包括大规模窃取原始推理过程、API密钥等凭证提取以及模型蒸馏攻击。研究者Maksym Andriushchenko进一步指出,从技术本质来看这其实是一种隐私攻击,因为第三方通过解密手段大规模窃取了前沿实验室加密保护的敏感数据。他还提到,在调查期间团队甚至因为一个泄露的凭证而收到了来自OpenAI的警告。
  • 蒸馏证据:研究人员在提取Claude、GPT和Gemini等模型的隐藏思维链后发现,部分中国AI模型(如月之暗面的Kimi K3)的输出与这些被提取的推理过程高度相似,这被视为疑似模型蒸馏的证据。此外,据@xeophon报道,Anthropic也已指控三家中国厂商大规模蒸馏Claude模型。

为什么重要

  • API安全架构受挑战:该研究证明了主流厂商当前保护模型核心推理逻辑的加密方法存在根本性缺陷,迫使行业重新审视并加强API的安全设计。研究员指出,尽管白宫早已对蒸馏问题发出过警告,但这些公司依然犯下了大错。
  • 模型审计新工具:此外,即将在ICML展示的相关研究提出,可以通过放大模型的推理权重使其超出训练范围进行“过度思考”,从而迫使模型泄露隐藏知识。这为未来进行更强大的模型审计和探测模型真实学习内容提供了潜在的基础工具。

还有 18 条相关讨论 →

第 2 集 · 闭源大模型思维链加密被证实可被窃取(2026-08-11,16 条)

近期多项安全研究指出,主流闭源大模型对思维链的加密或隐藏措施已被证实无法有效防止模型推理能力被窃取,暴露出当前商业大模型 API 的严重安全隐患。

已确认

  • 安全研究员 Alexander Panfilov 团队发现 OpenAI、Anthropic 和 Google 等主流 AI 提供商的 API 存在漏洞,允许读取推理模型的加密思考过程。据 @yangyi 和 @NinarehMehrabi 报道,研究人员通过越狱手段成功提取了加密思考过程并泄露了密钥,且这些加密轨迹可被跨会话、跨用户和跨模型重放。此外,提取出的推理 token 数量与实际被计费的 API 思考 token 数量实现了 1:1 的精准匹配,证实模型底层的隐藏推理过程能被完整提取。
  • 据 @新智元 报道,一项长达 116 页的研究进一步指出,由于加密推理块未严格绑定会话和模型,攻击者可利用同公司更便宜的小模型(如 Claude Haiku)作为“解码器”,仅花费数百美元即可完成提取。@rschu 补充指出,在某些情况下,仅需两次 API 调用即可通过越狱还原明文思维链。
  • 康奈尔大学研究团队发表论文,提出了名为「Trace Inversion」(轨迹反演)的框架。据 @burkov 和 @burnytech 转述,该方法无需直接访问隐藏的思维链,仅利用黑盒模型的输入、最终答案及可选的简短摘要,就能重构出详尽的合成推理轨迹。实验表明,使用这些反演轨迹微调较弱的同族学生模型,可以有效「窃取」前沿模型的推理能力。
  • 据 @ZealousIdealSort74 分享的论文洞察,泄露的推理过程显示,Claude 在面对 AIME 等基准测试题时表现出「死记硬背」的迹象,这意味着相关模型的评测成绩可能存在水分。

为什么重要

  • OpenAI、Anthropic 和 Google 等厂商试图通过对思维链加密来防止竞争对手通过蒸馏窃取模型能力,但这些研究证明该防线已被多重方式突破。
  • @rohanpaulai 强调,这表明即使完全隐藏思维链,也无法彻底保护模型的推理能力,闭源模型的安全防护策略亟待重新评估。
  • @mitsuhiko 呼吁,既然 AI 实验室已确认暴露思维链不存在安全问题,且加密措施已被证实可被轻易绕过,厂商就应当向开发者开放思维链的可见性。

第 3 集 · 密码学家Matthew Green批评前沿大模型厂商漠视安全研究(2026-08-11,5 条)

约翰·霍普金斯大学密码学家Matthew Green近期连续发文,严厉批评前沿大模型厂商在安全研究上的漠视态度。他指出现有行业普遍误以为AI公司真正了解自家系统的运作原理,并警告AI编程智能体可能成为自身底层架构的首批受害者。

已确认

  • 外部安全研究人员发现了一种允许第三方蒸馏其模型的攻击方法(涉及“加密思维链提取”漏洞),并向前沿模型实验室进行了负责任披露。
  • 前沿模型提供商在接到报告后确认了该问题,但并未对外承认,也没有提供任何安全奖励或实质性的资源支持。Green认为这种漠视安全漏洞的行为极其恶劣。

为什么重要

  • Green强调,真正令人担忧的不仅是LLM本身的不可解释性,而是由AI编程智能体生成的代码可能会成为自身底层架构的首批受害者。
  • 公众与行业在审视这些估值高达万亿美元的实验室时,往往错误地假设他们完全掌握了自家黑盒系统的运作机制,这种盲目信任可能会带来底层架构的安全隐患。

第 4 集 · 欧洲团队破解三大顶级大模型加密思维链(2026-08-13,5 条)

一支欧洲研究团队(8月10日挂出论文)发表研究,证实主流前沿大模型(如 OpenAI、Anthropic、Google 的旗舰模型)的隐藏思维链(CoT)加密机制存在安全漏洞,可被完整提取,引发行业对 AI 安全与数据隐私的担忧。

已确认

  • 漏洞机制:问题不在于加密算法本身被攻破,而在于 API 暴露了响应元数据(如始终可用的 ground truth token 数量)。研究人员指出,当提取出的 token 数量与 API 实际计费的思考 token 数量完全一致(几乎呈 1:1 对应)时,就能极高概率确认成功窃取了真实的思维链。
  • 跨模型迁移:攻击者可以将从高级模型(如 Opus、Sonnet)中提取出的加密推理过程,直接注入到其他模型的护栏中,实现跨模型思维链迁移并用于越狱。
  • 附带数据泄露:除了破解思维链,研究人员还从网上公开的 6708 份 AI 会话日志中提取出了 62 个真实的 API 密钥。

为什么重要

  • 隐藏思维链是前沿大模型厂商保护模型推理能力、防止恶意越狱的重要安全护栏。此次被证实可被低成本提取且能跨模型迁移,意味着现有的 API 元数据暴露机制已成为系统性安全隐患,直接威胁到顶级 AI 模型的商业机密与安全防线。