研究称仅两次 API 调用即可窃取 Claude 等前沿模型的加密思维链

Miles_Brundage · x · 2026-09-11

图宾根大学等机构论文《Stealing Reasoning Traces from Proprietary LLM APIs》揭示:Anthropic、OpenAI 和 Google 的 API 会向客户端返回加密的思维链块,这些 trace 可跨会话、跨用户、跨模型重放。

攻击流程:

作者称 Anthropic 已确认其模型确实被以论文描述的方式蒸馏。该发现与 Anthropic 同日发布的迄今最详细威胁情报报告形成呼应——报告披露了网络攻击、影响力行动、监控、生物武器等 misuse 案例,并称所有行动均已被拦截,经验反哺了安全护栏。论文团队还做了一个「猜模型」小游戏展示解码后的推理差异。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →