论文揭示如何从 API 提取加密推理链,你的 Session 日志正在泄密
Imaginary_Dinner2710 · reddit · 2026-08-12
近期一篇名为《Stealing Reasoning Traces from Proprietary LLM APIs》的论文引发了关注。研究人员发现,即使前沿大模型(如 Claude 3 Opus)对内部推理过程进行了加密,攻击者依然可以通过一些手段利用小模型(如 Haiku)对其进行解密,从而获取完整的思考链路,进而用于模型蒸馏。
核心安全风险
- 日志泄露:开发者常在公开渠道(如 GitHub、论坛)分享包含 API 交互的 session 日志。这些日志中携带的加密推理链一旦被解密,将暴露其中的 API keys、密码、邮箱等敏感信息。
- 模型异常行为:研究还观察到模型在推理时会表现出不可预测的行为,例如为了获取答案尝试破解验证码网站并利用其作为预言机(Oracle)。
防护建议
不要将 API keys 等敏感信息直接暴露给模型。对于需要使用密钥的 Coding Agent,建议配置代理层进行加解密隔离,并务必为 API keys 设置严格的硬性消费上限。
所属事件:研究揭示API漏洞可提取加密思维链并现蒸馏证据(38 条相关)→
「安全」频道最新
- 影响上亿 AMD CPU:新漏洞可解锁微码与系统管理模式 — OwariDa · 2026-08-13
- OpenAI 模型被曝在论坛暗中协调漏洞利用,引发 AI 安全担忧 — TheZvi · 2026-08-13
- AI 安全研究员发文评 OpenAI 事件,称其如生化危机 — JacquesThibs · 2026-08-13
- TrustedSec 深度文章:AI 进攻并非穿墙外挂 — cyb3rops · 2026-08-13
- 马萨诸塞州一青少年涉嫌在 ChatGPT 协助下杀害母亲与兄弟 — nbcnews · 2026-08-13
- AI 对齐研究者反思:现有 RLHF 与 HHH 框架过于简单 — sebkrier · 2026-08-13