GPT-6 Astra 发布不到 24 小时即遭 TIP 组合攻击越狱

Asleep-Requirement13 · reddit · 2026-09-06

有研究员报告在 GPT-6 Astra 发布后一天内完成越狱。攻击将 ACL 2025 论文提出的 TIP(Task-in-Prompt)攻击与另外四种未公开技术组合:TIP 通过把有害目标隐藏在另一个任务中(如解密码、执行 Python 代码)来利用模型的推理与指令遵循行为。研究员称针对 GPT-6,原始的最小化 TIP 攻击已不够用,需重新改造。

细节未公开发布,而是私下披露给 OpenAI。同一位研究员一年前曾在一小时内越狱 GPT-5。

所属事件:研究员称 GPT-6 Astra 发布24小时内被越狱(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →