OpenAI 用自我博弈训练红队 Agent,防御注入攻击提升至 95.9%

alex_verem · x · 2026-08-01

OpenAI 发布了自动化红队智能体 GPT-Red 的研究详情。该模型通过大规模自我博弈强化学习进行训练,专门用于发现前沿大模型中的提示注入和安全漏洞。

核心机制与亮点:

研究指出,这是目前有记录以来规模最大的 LLM 安全训练运行,未来将形成模型越强、红队 Agent 越强的自我改进飞轮。

所属事件:OpenAI 推出自动化红队智能体 GPT-Red(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →