GPT-Red 被用于训练提稳模型

Dr_Singularity · x · 2026-07-16

OpenAI 被描述为把 GPT-Red 直接纳入生产模型训练流程,用来自动攻击 AI 系统、发现弱点,再把这些发现反馈给后续训练。

据帖中说法,最新的 GPT-5.6 Sol 在最难的 direct prompt injection 基准上,比四个月前的最佳生产模型 失败次数减少 6 倍,作者将其解读为一种“自我改进飞轮”——先红队攻击,再用攻击结果提升安全性与鲁棒性。

所属事件:OpenAI披露自动红队系统GPT-Red(16 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →