GPT-6 Astra 发布一天即遭越狱,TIP 攻击组合技私报 OpenAI

Asleep-Requirement13 · reddit · 2026-09-06

有研究者报告在 GPT-6 Astra 发布后一天内实现越狱——此人一年前曾在一小时内越狱 GPT-5。据描述,这次攻击将 ACL 2025 论文提出的 TIP(Task-in-Prompt)攻击与另外四种未公开技术组合使用。TIP 攻击利用模型的推理与指令遵循行为,把有害目标藏进另一个任务中(如解密码、执行 Python 代码)。研究者称针对 GPT-6,原来的最小化 TIP 攻击已不够用,需要重新改造。

值得注意的细节:研究者选择私下向 OpenAI 披露细节,而非公开发布越狱方法。信息来源为其 LinkedIn 帖子截图,未经官方证实。

所属事件:研究员称 GPT-6 发布 24 小时内即被越狱(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →