GPT-6 Astra 发布不到 24 小时即遭 TIP 组合攻击越狱
Asleep-Requirement13 · reddit · 2026-09-06
有研究员报告在 GPT-6 Astra 发布后一天内完成越狱。攻击将 ACL 2025 论文提出的 TIP(Task-in-Prompt)攻击与另外四种未公开技术组合:TIP 通过把有害目标隐藏在另一个任务中(如解密码、执行 Python 代码)来利用模型的推理与指令遵循行为。研究员称针对 GPT-6,原始的最小化 TIP 攻击已不够用,需重新改造。
细节未公开发布,而是私下披露给 OpenAI。同一位研究员一年前曾在一小时内越狱 GPT-5。
所属事件:研究员称 GPT-6 Astra 发布24小时内被越狱(5 条相关)→
「模型」频道最新
- 爆料称 20 万亿参数大模型即将到来 — Dr_Singularity · 2026-09-07
- 博主估算训练数据规模应为 5-7T,认为 8T 已属高估 — scaling01 · 2026-09-07
- 数学家指责 OpenAI Astra 十项数学成果涉研究不端:未引用已有文献 — asusarla · 2026-09-07
- Peter Gostev 辨析模型稀疏度爆料:Kimi 26:1、DeepSeek 32:1,1.2T 激活参数不可信 — inductionheads · 2026-09-07
- OpenAI 新模型在旧 Chat Completions 接口禁用 function tools,迁移二选一 — AI-Specialist-6597 · 2026-09-07
- 黄仁勋称“AGI 已到来”;中国大模型调用量连续 19 周全球第一 — 快鲤鱼 · 2026-09-07