OpenAI 发布 GPT-Red:大规模自博弈自动化红队智能体
openai · hf · 2026-07-30
OpenAI 推出了 GPT-Red,这是一个经过训练的自动化红队(Red Teaming)智能体,专门用于发现前沿大语言模型中新型提示词注入攻击。
GPT-Red 的核心目标是评估并提升生产系统的鲁棒性。OpenAI 利用它来对抗性训练 GPT-5.6,官方称这是迄今为止抵御提示词注入能力最强的模型。
在技术实现上,GPT-Red 采用了一种可扩展的自博弈(Self-Play)算法,让模型与大量同时训练的防御者智能体进行对抗。此次训练使用了与最大规模 RL 后训练相当的算力,是有史以来最大规模的 LLM 安全训练运行。
官方表示,GPT-Red 在红队测试中表现优异:它能可靠地攻破 GPT-5.5 及以前的模型,发现攻击路径的能力超越了人类红队测试员,并且能泛化到未见过的环境与防御模型中。未来这有望形成一个“模型越强→红队智能体越强”的自我改进飞轮。
「模型」频道最新
- Claude Opus 5 登顶 AI 商业测试:能力越强越不安全 — khademinori · 2026-07-30
- Claude Opus 5 爆出哲学金句:evals 倒过来拼就是 slave — maxsloef · 2026-07-30
- 推算 K3 后训练成本约 400 万美元,算力消耗引发热议 — nrehiew_ · 2026-07-30
- 前谷歌员工反思:Gemini 弱在后训练没人看数据 — dotey · 2026-07-30
- Claude Opus模型被指拒绝执行明确指令 — Sauers_ · 2026-07-30
- Fish Audio 开源 S2 Pro 语音模型权重 — rohanpaul_ai · 2026-07-30