研究称仅两次 API 调用即可窃取 Claude 等前沿模型的加密思维链
Miles_Brundage · x · 2026-09-11
图宾根大学等机构论文《Stealing Reasoning Traces from Proprietary LLM APIs》揭示:Anthropic、OpenAI 和 Google 的 API 会向客户端返回加密的思维链块,这些 trace 可跨会话、跨用户、跨模型重放。
攻击流程:
- 取一条前沿模型(如 Claude Opus)产生的带签名加密推理 trace;
- 将其重放进更弱的同门模型(如 Claude Haiku),配合越狱 prompt 让弱模型逐字转录附带的推理内容;
- 即可明文恢复强模型的隐藏推理,全程无需直接攻击强模型,也不会触发其防蒸馏护栏。
作者称 Anthropic 已确认其模型确实被以论文描述的方式蒸馏。该发现与 Anthropic 同日发布的迄今最详细威胁情报报告形成呼应——报告披露了网络攻击、影响力行动、监控、生物武器等 misuse 案例,并称所有行动均已被拦截,经验反哺了安全护栏。论文团队还做了一个「猜模型」小游戏展示解码后的推理差异。
「安全」频道最新
- iamtrask 拓展双重风险论,推介 pro-human AI 治理框架 — iamtrask · 2026-09-11
- 近 10% 暴露的 LiteLLM 网关仍接受默认管理密钥 sk-1234 — Thionne_WTZ · 2026-09-11
- 对齐为何难定义:外延定义只能事后追认,内涵定义更难 — zetalyrae · 2026-09-11
- Kelsey Piper:AI 开发自动化是实验室的既定计划,人类监督将急速萎缩 — round · 2026-09-11
- Anthropic 拦截利用其模型辅助开发生物武器的科学家 — anshulkundaje · 2026-09-11
- Transluce 加入 AI Evaluator Forum,独立机构联手评估前沿 AI — typewriters · 2026-09-11