OpenAI 披露新型加密绕过蒸馏攻击,指 MoonShot 涉其中
jedisct1 · x · 2026-10-05
OpenAI 宣布瓦解了一场旨在蒸馏、提取其模型推理能力的"协调行动"。
- 时间线:7 月 1 日发现低级别活动,7 月 24-25 日观察到 4000 名用户的 1.6 万条符合"信息提取模式"的提示,至 7 月 28 日可疑用户增至 1.5 万,OpenAI 当日称已"完全瓦解"该行动。
- 攻击手法被称为"新型":攻击者从一个对话中复制加密的推理数据,再在另一个对话中让模型解密并以明文转录出来。外部研究者 8 月已向 OpenAI 报告过类似漏洞。
- OpenAI 强调加密未被破解、数据库未被入侵,攻击者是通过操纵模型交互,使受保护的推理内容以可见形式被规模化复现。
- 公司指控与中国公司 MoonShot AI 有关的人员参与部分攻击,但未提供确凿证据。
「安全」频道最新
- Cloudflare 数据:单个域名拦下 2.25 万次 AI 爬虫请求 — gaganghotra_ · 2026-10-05
- Stratechery 主笔的 Mac Mini 被 hack,Claude 反成救命恩人 — Stratechery · 2026-10-05
- 脆弱世界假说或成立:认知劳动爆发将解锁廉价毁灭性武器 — deanwball · 2026-10-05
- halvarflake:2000 年来激励机制失灵已磨掉两三代安全工程师 — halvarflake · 2026-10-05
- AI酷刑室作者被扒出是苹果AI SRE,或进AI安全团队 — PuzzleheadedEgg1214 · 2026-10-05
- OpenAI 护栏现「systems are thinking」新话术,疑涉人工审核 — Darpinian · 2026-10-05