新研究可窃取 OpenAI 等模型 API 的推理痕迹
maksym_andr · x · 2026-08-16
Maksym Andriushchenko 等人的论文《Stealing Reasoning Traces from Proprietary LLM APIs》披露了一个关键漏洞:LLM 提供商返回的加密推理块在不同会话、用户和模型间完全兼容。研究利用这一点,通过将强模型的加密推理注入弱模型迫使其解码明文,成功提取了 Anthropic、OpenAI 和 Google 的私有推理过程,并从公开日志中恢复了 367 条 PII 数据。
「安全」频道最新
- Naval 建议用公开数据训练的公司应在 12 个月后开源模型 — rohanpaul_ai · 2026-08-16
- OrcaRouter 发布 Qwen3.8 27B FP8 无审查权重 — QuixiAI · 2026-08-16
- 观点:禁止 AI 回答无意义,关键在于可验证性而非工具 — GeckoKontrol · 2026-08-16
- 评 Dario Amodei 观点:重手监管将巩固巨头垄断 — soumitrashukla9 · 2026-08-16
- CoT监控被指脆弱不可靠,行动监控或更值得关注 — maksym_andr · 2026-08-16
- ResearchArena:嵌入式侧任务难检测,AI监控面临挑战 — maksym_andr · 2026-08-16