攻击还原推理过程,专有 LLM API 暴露思维链

Machine Learning Street Talk · youtube · 2026-08-23

本期节目探讨了 Ilia Shumailov 和 Alexander Panfilov 的论文《Stealing Reasoning Traces from Proprietary LLM APIs》。攻击利用了一个设计缺陷:服务商为了支持会话恢复,返回了加密的推理状态(Traces)。攻击者可以将这些状态块在不同用户或模型间重放,利用较小的模型诱导服务商解密并明文输出隐藏的推理过程。讨论涵盖了隐私数据泄露、通用的越狱攻击路径、被投毒的 Agent 追踪以及防御措施,呼吁进行受控实验而非过度宣传。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →