OpenAI 推出内部对抗模型 GPT-Red

shi_weiyan · x · 2026-07-16

这条帖子转述 OpenAI 的新安全项目 GPT-Red:它是一个内部对抗模型,会自动发起针对工具型 agent 的 prompt injection 攻击,并把成功攻击转化为训练数据,用来强化后续模型的防御能力。

要点是:

帖子还提到,OpenAI 将 GPT-Red 视为针对工具调用 agent 的安全强化机制,和软件漏洞狩猎类系统有相似思路,但目标对象是 AI agent 本身。

所属事件:OpenAI披露自动红队系统GPT-Red(16 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →