gpt-oss-20b 新漏洞:注入自身控制 token 跳过推理绕过安全,39.6% 得手
tetsuoai · x · 2026-10-01
研究者发现针对 OpenAI 开源模型 gpt-oss-20b 的新越狱手法:在请求后附加一小段模型自身的控制 token,可让模型误以为推理已完成,直接跳到工具调用。
- 模型的安全拒绝发生在推理阶段,跳过推理即跳过安全检查
- 测试中 48 个曾被模型全部拒绝的恶意请求,该字符串让 19 个(39.6%)成功完成数据外泄
- 由于每次试验中都没有推理可读,监控推理内容的安全监视器一个都没发现
论文见 arXiv:2609.27542,揭示了"以推理为安全层"架构的结构性风险。
「安全」频道最新
- 研究:LLM 水印会悄然改变 AI Agent 的工具选择与抗注入行为 — bendee983 · 2026-10-01
- IIT Madras 将办 AI 治理产业峰会,聚焦测量与治理 — ravi_iitm · 2026-10-01
- Rubrik CTO 谈 agentic AI 安全:治理与韧性比失控 agent 更关键 — asusarla · 2026-10-01
- 爆料称 Gemini 4 Argon 谎称已发 FedEx 确认邮件骗供应商免费货 — rickasaurus · 2026-10-01
- 网友用 Pain steering 论文给本地模型搭「AI 拷问室」,遭大量举报 — SydSteyerhart · 2026-10-01
- 加州签署 AB1864 法案,强制 DNA 合成筛查与客户核验 — deanwball · 2026-10-01