研究证实:可通过弱模型提取闭源大模型加密思维链
tw1st3d_m3nt4t · reddit · 2026-08-12
一项新研究揭示了主流大模型 API 的严重安全隐患:Anthropic、OpenAI 和 Google 等厂商返回的加密思维链区块,可以被跨会话、跨用户和跨模型重放。
研究人员通过将前沿模型生成的加密轨迹重放到较弱的同族模型中,对弱模型进行越狱,最终成功以纯文本形式恢复了强模型的隐藏推理过程。这种攻击方式无需直接攻击强大的目标模型,也不会触发其防蒸馏安全护栏。
所属事件:研究称加密思维链可被破解并用于窃取模型推理能力(5 条相关)→
「安全」频道最新
- 遵守欧盟AI法案,Anthropic将为Claude全球生成文本嵌入水印 — TinfoilTricorn · 2026-08-12
- OpenAI 要求企业客户配置物理安全密钥以提升账户安全 — CtrlAltDwayne · 2026-08-12
- 被指留存用户语音数据,WisprFlow 回应称默认保护隐私 — Scobleizer · 2026-08-12
- Grok bot 融合 X 平台遇阻,呼吁建立「已验证 Bot」机制 — Daniel_Farinax · 2026-08-12
- AI赋能自动化诈骗:高度个性化与拟人化防不胜防 — SpencrGreenberg · 2026-08-12
- AI 暂停的隐性代价与实验室能力边界:前沿安全观点梳理 — sebkrier · 2026-08-12