OpenAI 称 GPT-Red 让 GPT-5.6 注入失败率降了 6 倍
dl_weekly · x · 2026-07-22
OpenAI 用自博弈红队模型把提示注入失败率降了 6 倍
这条消息讲的是 OpenAI 的安全训练更新:他们用一个名为 GPT-Red 的自博弈自动红队模型去攻击生产系统,并反向训练 GPT-5.6。
- 目标是尽量用自动化方式发现 prompt injection 漏洞,而不是只靠人工红队。
- OpenAI 声称,这套方法让 直接提示注入失败率下降了 6 倍。
- 这既是具体安全措施,也是模型安全能力的实质更新。
「安全」频道最新
- AI 也需要实验室式安全:风险识别与监督 — davidmanheim · 2026-07-22
- 商业前沿模型误判角色,拦下攻击取证分析 — morqon · 2026-07-22
- AI 能力提升太快,机构与监管还没准备好 — Afinetheorem · 2026-07-22
- 团队把生产库权限给了 agent,现在却审计不了它们 — Alessandro_Lena_410 · 2026-07-22
- Bloomsbury 因 Anthropic 和解将获数百万赔偿,涉及 14087 本书 — nordicinst · 2026-07-22
- 这条回复继续指向 AI 内部部署监管论文 — StephenLCasper · 2026-07-22