OpenAI披露自动红队系统GPT-Red
OpenAI 于 7 月 16 日披露内部自动化红队系统 GPT-Red,核心目标是在更大规模上发现模型、尤其是工具型 AI agent 的 prompt injection 漏洞。此事值得关注,在于 OpenAI 直接把安全评估的扩展问题摆上台面:随着模型能力提升,依赖人工的传统红队测试被其视为安全与对齐工作的瓶颈。
关键机制
根据 OpenAI 的介绍,GPT-Red 采用对抗式 self-play 运行:攻击方持续尝试用提示注入突破防御模型;一旦找到成功攻击样本,这些样本就会被转成训练数据,反过来强化防御模型。OpenAI 将其定位为一个自动发现漏洞、再把漏洞直接接入训练流程的闭环,用来持续扩大失败模式覆盖面。
已披露效果
OpenAI 表示,经过 GPT-Red 训练后,GPT-5.6 的抗 prompt injection 能力提升了 6 倍。其回放测试使用的是 GPT-Red 最强、且未出现在训练中的一批攻击;按 OpenAI 说法,GPT-5.6 Sol 在这组提示注入测试中表现最佳,也是目前最稳的模型。
各方表述与意义
OpenAI 研究员 Kathy 提到,GPT-Red 这类专门为发现漏洞而训练的模型,在红队任务上的表现已经明显超过人类专家。围绕这次披露的讨论也多把 GPT-Red 视为一种可持续迭代的“AI 对练”安全基础设施,而不只是一次单独的安全评测结果。
2026-07-16 ~ 2026-07-16 · 16 条相关
- 第 1 集:OpenAI披露自动红队系统GPT-Red(2026-07-16,16 条)
- 第 2 集:OpenAI 推出自动化红队智能体 GPT-Red(2026-07-30,2 条)
一手来源
- OpenAI发布GPT-Red红队系统 — OpenAI ·
- GPT-5.6抗注入提升6倍 — OpenAI ·
- GPT-Red靠自博弈找漏洞 — OpenAI ·
- GPT-Red:自动化红队模型 — btibor91 · 2026-07-16
- OpenAI 的 GPT-Red 安全对练 — nordicinst · 2026-07-16
- 【源头】OpenAI发布GPT-Red红队系统 — OpenAI · 2026-07-16
- 【源头】GPT-Red靠自博弈找漏洞 — OpenAI · 2026-07-16
- 【源头】GPT-5.6抗注入提升6倍 — OpenAI · 2026-07-16
- GPT-Red:自动化AI红队测试模型 — yoimnotkesku · 2026-07-16
- GPT-5.6 强化了注入防护 — Moh1tAgarwal · 2026-07-16
- GPT-Red 已超越人类红队水平 — kaicathyc · 2026-07-16
- OpenAI红队模型GPT-Red能力远超人类 — kaicathyc · 2026-07-16
- OpenAI内部红队模型GPT-Red曝光 — etherd0t · 2026-07-16
- GPT-Red 被用于训练提稳模型 — Dr_Singularity · 2026-07-16
- OpenAI 的自博弈红队飞轮 — imjustnewatai · 2026-07-16
另有 4 条近重复转述:_AndrewZhao · shi_weiyan · CodeByPoonam · steipete