GPT-6 Astra 发布一天即遭越狱,TIP 攻击组合技私报 OpenAI
Asleep-Requirement13 · reddit · 2026-09-06
有研究者报告在 GPT-6 Astra 发布后一天内实现越狱——此人一年前曾在一小时内越狱 GPT-5。据描述,这次攻击将 ACL 2025 论文提出的 TIP(Task-in-Prompt)攻击与另外四种未公开技术组合使用。TIP 攻击利用模型的推理与指令遵循行为,把有害目标藏进另一个任务中(如解密码、执行 Python 代码)。研究者称针对 GPT-6,原来的最小化 TIP 攻击已不够用,需要重新改造。
值得注意的细节:研究者选择私下向 OpenAI 披露细节,而非公开发布越狱方法。信息来源为其 LinkedIn 帖子截图,未经官方证实。
所属事件:研究员称 GPT-6 发布 24 小时内即被越狱(2 条相关)→
「模型」频道最新
- Benchwarmer 工具用 Bad Apple 重制 AI 跑分图,自动纠正误导性图表 — aronchick · 2026-09-06
- 程序员数月未写一行代码:Eleanor Berger 详解 GPT-6 Astra 的"工厂模式" — intellectronica · 2026-09-06
- 开发者在车里用 Astra 一次成文:盼了两年的体验终于落地 — generativist · 2026-09-06
- GPT-6 Astra 被评最强视觉模型,Gemini 或遭赶超 — jonstephens85 · 2026-09-06
- 开发者称 Codex OAuth 终于修复 100 万上下文 — menhguin · 2026-09-06
- 爆料:Grok Bot 已入驻约 100 家客户,销售团队下周启动内部培训 — Sauers_ · 2026-09-06