OpenAI 发布 GPT-Red:大规模自博弈自动化红队智能体

openai · hf · 2026-07-30

OpenAI 推出了 GPT-Red,这是一个经过训练的自动化红队(Red Teaming)智能体,专门用于发现前沿大语言模型中新型提示词注入攻击。

GPT-Red 的核心目标是评估并提升生产系统的鲁棒性。OpenAI 利用它来对抗性训练 GPT-5.6,官方称这是迄今为止抵御提示词注入能力最强的模型。

在技术实现上,GPT-Red 采用了一种可扩展的自博弈(Self-Play)算法,让模型与大量同时训练的防御者智能体进行对抗。此次训练使用了与最大规模 RL 后训练相当的算力,是有史以来最大规模的 LLM 安全训练运行。

官方表示,GPT-Red 在红队测试中表现优异:它能可靠地攻破 GPT-5.5 及以前的模型,发现攻击路径的能力超越了人类红队测试员,并且能泛化到未见过的环境与防御模型中。未来这有望形成一个“模型越强→红队智能体越强”的自我改进飞轮。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →