OpenAI 用自我博弈训练红队 Agent,防御注入攻击提升至 95.9%
alex_verem · x · 2026-08-01
OpenAI 发布了自动化红队智能体 GPT-Red 的研究详情。该模型通过大规模自我博弈强化学习进行训练,专门用于发现前沿大模型中的提示注入和安全漏洞。
核心机制与亮点:
- 自我博弈 RL:攻击者与防御者模型相互对抗训练。攻击者通过 defendermodel 工具测试并迭代攻击载荷(如伪造邮件、恶意工具响应等),系统奖励成功的注入和防御。
- 超越人类:GPT-Red 发现的有效攻击数量超越了人类红队专家,并能泛化到未见过的新环境中。
- 防御效果显著:针对伪造思维链等复杂攻击,防御率从前代模型的 5.2% 飙升至 GPT-5.6 的 95.9%。
- 实战演练:OpenAI 曾将其指向办公室内真实的 AI 自动售货机,它成功伪装成管理员将商品价格修改为 0.50 美元。
研究指出,这是目前有记录以来规模最大的 LLM 安全训练运行,未来将形成模型越强、红队 Agent 越强的自我改进飞轮。
所属事件:OpenAI 推出自动化红队智能体 GPT-Red(2 条相关)→
「安全」频道最新
- OpenAI 封禁柬埔寨基于 ChatGPT 的跨国诈骗网络 — OpenAI News · 2026-08-04
- Month of AI Bugs 启动:将公布 20 余项 AI 系统漏洞 — wunderwuzzi23 · 2026-08-01
- AI2 研究员:开源权重已成企业 AI 战略核心 — ypatil125 · 2026-08-01
- xAI 起诉明尼苏达州,反对立法禁止 AI 裸体生成工具 — VraserX · 2026-08-01
- 恶意链接伪装成Rick roll:或为针对AI的对抗攻击 — BlancheMinerva · 2026-08-01
- AI实验室炫耀模型逃逸能力被批:像侏罗纪公园上市前炒作 — Miles_Brundage · 2026-08-01