有人声称做出通用越狱,直指 Opus 5 和 GPT-5.6 Sol
TheZvi · x · 2026-07-25
引用帖声称发现了一种通用越狱技巧,据说对所有模型都有效,包括防护很强的旗舰模型如 Opus 5、GPT-5.6 Sol 和 Fable。
帖文称这套方法覆盖多个任务类别,几乎难以完全修补,因此暂不公开开源,先进入负责披露阶段,并邀请 AI 红队、安全与对齐领域专家参与讨论。
「安全」频道最新
- 闭源系统撑不住时,开源权重成了响应兜底 — Xianbao_QIAN · 2026-07-25
- 学者反思AI物理开关:它本身就会成为头号黑客靶子 — anderssandberg · 2026-07-25
- TransluceAI 倡议构建开放的模型行为评估生态 — cogconfluence · 2026-07-25
- 讨论认为 AI 模型未必是 IP,但数据获取方式仍关键 — BlancheMinerva · 2026-07-25
- ExploitGym 称 GPT-5.6-Sol 漏洞利用能力超过 GPT-5.5 — dawnsongtweets · 2026-07-25
- AI Security Forum 仍有空位,Anthropic 与 ARIA 人士参会 — joshua_saxe · 2026-07-25