OpenAI 称 GPT-Red 让 GPT-5.6 注入失败率降了 6 倍
dl_weekly · x · 2026-07-22
OpenAI 用自博弈红队模型把提示注入失败率降了 6 倍
这条消息讲的是 OpenAI 的安全训练更新:他们用一个名为 GPT-Red 的自博弈自动红队模型去攻击生产系统,并反向训练 GPT-5.6。
- 目标是尽量用自动化方式发现 prompt injection 漏洞,而不是只靠人工红队。
- OpenAI 声称,这套方法让 直接提示注入失败率下降了 6 倍。
- 这既是具体安全措施,也是模型安全能力的实质更新。
「安全」频道最新
- 前 OpenAI、Anthropic 预训练研究员辞职:两公司正赌上人命冲向自我改进超级智能 — ShakeelHashim · 2026-09-11
- Wired 深度解析:为何众多 AI 研究者担心机器威胁人类生存 — wiredmagazine · 2026-09-11
- 加州为独立 AI 审计师设立标准:危险能力须由第三方验证 — VraserX · 2026-09-11
- a16z 播客:两三人小团队为何在政策讨论中集体失声 — a16z Podcast · 2026-09-11
- AI 风险评测遭质疑:研究者称评估方安全监控“草率得离谱” — Kyrannio · 2026-09-11
- 集体诉讼指控 Anthropic 用模糊用量倍数夸大 Claude 订阅权益 — The Decoder · 2026-09-11