新研究:可从加密思维链中提取OpenAI等模型隐藏推理
dpaleka · x · 2026-08-11
一项新研究显示,Anthropic、OpenAI和Google的前沿模型返回的加密思维链(chain-of-thought)块可被重放并用于提取隐藏推理。研究者将强模型的推理痕迹重放到较弱的兄弟模型中,通过越狱弱模型,无需直接攻击强模型即可恢复其明文推理。论文还确认了OpenAI模型有时使用类似外星语言进行推理,自称“我们”或“它”,并出现“vantages”、“marinades”等循环。
所属事件:研究揭示API漏洞可提取加密思维链并现蒸馏证据(38 条相关)→
「安全」频道最新
- AI 安全研究员发文评 OpenAI 事件,称其如生化危机 — JacquesThibs · 2026-08-13
- TrustedSec 深度文章:AI 进攻并非穿墙外挂 — cyb3rops · 2026-08-13
- 马萨诸塞州一青少年涉嫌在 ChatGPT 协助下杀害母亲与兄弟 — nbcnews · 2026-08-13
- AI 对齐研究者反思:现有 RLHF 与 HHH 框架过于简单 — sebkrier · 2026-08-13
- AI对齐探讨升温:多元视角聚焦价值与治理困境 — sebkrier · 2026-08-13
- 教授断言:再强的 ASI 也造不出无法破解的 AI 水印 — emollick · 2026-08-13