专题 · FULL STORY

OpenAI GPT-Red红队系统披露

OpenAI于7月中旬披露并详细介绍了内部自动化红队智能体GPT-Red。该系统通过大规模自我博弈强化学习,专门用于发现大模型及智能体的提示注入等安全漏洞。

2026-07-16 ~ 2026-08-01 · 2 集 · 18 条

第 1 集 · OpenAI披露自动红队系统GPT-Red(2026-07-16,16 条)

OpenAI 于 7 月 16 日披露内部自动化红队系统 GPT-Red,核心目标是在更大规模上发现模型、尤其是工具型 AI agent 的 prompt injection 漏洞。此事值得关注,在于 OpenAI 直接把安全评估的扩展问题摆上台面:随着模型能力提升,依赖人工的传统红队测试被其视为安全与对齐工作的瓶颈。

关键机制

根据 OpenAI 的介绍,GPT-Red 采用对抗式 self-play 运行:攻击方持续尝试用提示注入突破防御模型;一旦找到成功攻击样本,这些样本就会被转成训练数据,反过来强化防御模型。OpenAI 将其定位为一个自动发现漏洞、再把漏洞直接接入训练流程的闭环,用来持续扩大失败模式覆盖面。

已披露效果

OpenAI 表示,经过 GPT-Red 训练后,GPT-5.6 的抗 prompt injection 能力提升了 6 倍。其回放测试使用的是 GPT-Red 最强、且未出现在训练中的一批攻击;按 OpenAI 说法,GPT-5.6 Sol 在这组提示注入测试中表现最佳,也是目前最稳的模型。

各方表述与意义

OpenAI 研究员 Kathy 提到,GPT-Red 这类专门为发现漏洞而训练的模型,在红队任务上的表现已经明显超过人类专家。围绕这次披露的讨论也多把 GPT-Red 视为一种可持续迭代的“AI 对练”安全基础设施,而不只是一次单独的安全评测结果。

第 2 集 · OpenAI 推出自动化红队智能体 GPT-Red(2026-07-30,2 条)

OpenAI 发布了自动化红队智能体 GPT-Red 的研究详情。该智能体通过大规模自我博弈强化学习进行训练,专门用于发现前沿大语言模型中的提示注入和安全漏洞。借助该技术,OpenAI 对防御提示词注入攻击的能力提升至 95.9%。