研究员称 GPT-6 发布 24 小时内即被越狱,已私下披露 OpenAI
Asleep-Requirement13 · reddit · 2026-09-06
- 有研究员报告在 GPT-6 Astra 发布后一天内实现越狱,攻击方式是 ACL 2025 论文中的 TIP(Task-in-Prompt)攻击与另外四种未公开技术的组合。
- TIP 攻击把有害目标隐藏在另一个任务里(如解密码、执行 Python 代码),利用模型的推理与指令遵循行为;原版最小化 TIP 对 GPT-6 已不够用,需要重新设计。
- 研究者称未公开细节,而是私下披露给了 OpenAI。其一年前曾报告在 GPT-5 发布一小时内实现越狱。
所属事件:研究员称 GPT-6 发布 24 小时内即被越狱(2 条相关)→
「模型」频道最新
- Miles Brundage 质疑:网友口中的 GPT-6 与 Astra 是同一模型? — Miles_Brundage · 2026-09-06
- Astra 生成 Three.js 作品惊艳网友:竟还能精确操作 Blender — victormustar · 2026-09-06
- Astra 实测临床基准仍不敌 Anthropic,智能呈尖峰分布 — danielmckinn0n · 2026-09-06
- Zvi 解读模型安全评测:蜜罐尝试减少 50-75% 内是好信号 — TheZvi · 2026-09-06
- GPT-3到GPT-6:OpenAI API价格五年降了数倍 — BLUECOW009 · 2026-09-06
- Astra被批代码能力严重欠火候,翻车像《不要抬头》 — tokenbender · 2026-09-06