OpenAI 的自博弈红队飞轮
imjustnewatai · x · 2026-07-16
这条内容在讲 OpenAI 似乎展示了一种类似 AlphaZero 的语言模型自博弈循环:
- GPT-Red 通过 self-play 训练:一方负责攻击,另一组模型负责防守。
- 在针对 GPT-5.1 的新 prompt injection 场景里,GPT-Red 找到了 84% 的成功攻击;而人类红队员只有 13%。
- OpenAI 随后把 GPT-Red 找到的攻击样本用于训练 GPT-5.6 Sol,作者称其在 GPT-Red 的直接 prompt injection 上失败率降到 0.05%。
作者进一步推测,这种“攻击—修补—再攻击”的飞轮,未来可能从后训练延伸到预训练:模型参与生成和验证训练数据、设计更难的课程、优化训练过程,甚至帮助构建下一代模型。
不过他也提醒:
- 目前还不是“模型自己训练自己”,人类仍然负责设定目标、环境和评分标准。
- OpenAI 也认为 GPT-5.6 还没达到它定义的“High”自我改进阈值。
- 失控的合成数据循环可能降低多样性,反而损害模型。
所属事件:OpenAI披露自动红队系统GPT-Red(16 条相关)→
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03