OpenAI 发表 GPT-Red 论文:基于自博弈的大规模红队智能体
alex_verem · x · 2026-08-01
OpenAI 团队发布论文介绍 GPT-Red,这是一个用于自动发现前沿大模型新型提示词注入攻击的红队智能体。
- 自博弈训练:设计了可扩展的自博弈算法,让模型与大量同步训练的防御智能体对抗。
- 规模空前:使用了与最大规模 RL 后训练相当的算力,号称是有史以来最大规模的 LLM 安全训练。
- 成效显著:能可靠攻破包括 GPT-5.5 在内的历史模型,攻击成功率超越人类红队专家,并具备良好的泛化能力。
- 安全飞轮:利用该模型对 GPT-5.6 进行对抗训练,使其成为迄今抗提示注入能力最强的模型,未来有望形成持续自我提升的安全飞轮。
「安全」频道最新
- 学者论文现 AI 幻觉引用,称搜自谷歌学术 — aniketapanjwani · 2026-08-24
- AI 隐私与安全干预:谁来定义“危险”的边界? — Radiant_Dragonfruit3 · 2026-08-24
- 预测市场:年底前美一州实施数据中心禁令概率 68% — Polymarket · 2026-08-24
- 博主拟探讨数据中心反弹与 AI 安全的关联 — AndyMasley · 2026-08-24
- Richard Ngo 将发布对齐研究失误的回顾文章 — RichardMCNgo · 2026-08-24
- 美AI数据中心引发暴力威胁,共和党视其为选举风险 — rohanpaul_ai · 2026-08-24