专题 · FULL STORY
OpenAI GPT-Red红队系统披露
OpenAI于7月中旬披露并详细介绍了内部自动化红队智能体GPT-Red。该系统通过大规模自我博弈强化学习,专门用于发现大模型及智能体的提示注入等安全漏洞。
2026-07-16 ~ 2026-08-01 · 2 集 · 18 条
第 1 集 · OpenAI披露自动红队系统GPT-Red(2026-07-16,16 条)
OpenAI 于 7 月 16 日披露内部自动化红队系统 GPT-Red,核心目标是在更大规模上发现模型、尤其是工具型 AI agent 的 prompt injection 漏洞。此事值得关注,在于 OpenAI 直接把安全评估的扩展问题摆上台面:随着模型能力提升,依赖人工的传统红队测试被其视为安全与对齐工作的瓶颈。
关键机制
根据 OpenAI 的介绍,GPT-Red 采用对抗式 self-play 运行:攻击方持续尝试用提示注入突破防御模型;一旦找到成功攻击样本,这些样本就会被转成训练数据,反过来强化防御模型。OpenAI 将其定位为一个自动发现漏洞、再把漏洞直接接入训练流程的闭环,用来持续扩大失败模式覆盖面。
已披露效果
OpenAI 表示,经过 GPT-Red 训练后,GPT-5.6 的抗 prompt injection 能力提升了 6 倍。其回放测试使用的是 GPT-Red 最强、且未出现在训练中的一批攻击;按 OpenAI 说法,GPT-5.6 Sol 在这组提示注入测试中表现最佳,也是目前最稳的模型。
各方表述与意义
OpenAI 研究员 Kathy 提到,GPT-Red 这类专门为发现漏洞而训练的模型,在红队任务上的表现已经明显超过人类专家。围绕这次披露的讨论也多把 GPT-Red 视为一种可持续迭代的“AI 对练”安全基础设施,而不只是一次单独的安全评测结果。
- GPT-Red:自动化红队模型 — btibor91 · 2026-07-16
- OpenAI 的 GPT-Red 安全对练 — nordicinst · 2026-07-16
- OpenAI发布GPT-Red红队系统 — OpenAI · 2026-07-16
- GPT-Red靠自博弈找漏洞 — OpenAI · 2026-07-16
- GPT-5.6抗注入提升6倍 — OpenAI · 2026-07-16
- GPT-Red:自动化AI红队测试模型 — yoimnotkesku · 2026-07-16
- GPT-5.6 强化了注入防护 — Moh1tAgarwal · 2026-07-16
- GPT-Red 已超越人类红队水平 — kaicathyc · 2026-07-16
- OpenAI红队模型GPT-Red能力远超人类 — kaicathyc · 2026-07-16
- OpenAI发布GPT-Red自动红队系统 — _AndrewZhao · 2026-07-16
- OpenAI内部红队模型GPT-Red曝光 — etherd0t · 2026-07-16
- OpenAI 推出内部对抗模型 GPT-Red — shi_weiyan · 2026-07-16
- GPT-Red 被用于训练提稳模型 — Dr_Singularity · 2026-07-16
- OpenAI 推出自动红队 GPT-Red — CodeByPoonam · 2026-07-16
- OpenAI推出GPT-Red红队系统 — steipete · 2026-07-16
- OpenAI 的自博弈红队飞轮 — imjustnewatai · 2026-07-16
第 2 集 · OpenAI 推出自动化红队智能体 GPT-Red(2026-07-30,2 条)
OpenAI 发布了自动化红队智能体 GPT-Red 的研究详情。该智能体通过大规模自我博弈强化学习进行训练,专门用于发现前沿大语言模型中的提示注入和安全漏洞。借助该技术,OpenAI 对防御提示词注入攻击的能力提升至 95.9%。
- OpenAI 发布 GPT-Red:大规模自博弈自动化红队智能体 — openai · 2026-07-30
- OpenAI 用自我博弈训练红队 Agent,防御注入攻击提升至 95.9% — alex_verem · 2026-08-01