OpenAI内部红队模型GPT-Red曝光
etherd0t · reddit · 2026-07-16
OpenAI 介绍了其内部使用的对抗性模型 GPT-Red。该模型的主要任务是自动发明针对工具型 AI 智能体的 prompt injection(提示词注入)攻击,并将成功的攻击转化为训练数据,以强化未来 GPT 模型的防御能力。
与 Anthropic 旨在寻找软件漏洞的 Mythos 不同,GPT-Red 专注于攻击 AI 智能体本身,本质上是一个用于加固模型安全性的“自我博弈工厂”。为防止滥用,GPT-Red 仅限内部使用,不会向公众或 API 开放,用户只能间接享受到由其加固后的更安全模型。
所属事件:OpenAI披露自动红队系统GPT-Red(16 条相关)→
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03