OpenAI内部红队模型GPT-Red曝光

etherd0t · reddit · 2026-07-16

OpenAI 介绍了其内部使用的对抗性模型 GPT-Red。该模型的主要任务是自动发明针对工具型 AI 智能体的 prompt injection(提示词注入)攻击,并将成功的攻击转化为训练数据,以强化未来 GPT 模型的防御能力。

与 Anthropic 旨在寻找软件漏洞的 Mythos 不同,GPT-Red 专注于攻击 AI 智能体本身,本质上是一个用于加固模型安全性的“自我博弈工厂”。为防止滥用,GPT-Red 仅限内部使用,不会向公众或 API 开放,用户只能间接享受到由其加固后的更安全模型。

所属事件:OpenAI披露自动红队系统GPT-Red(16 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →