研究者称,模型越狱多是绕过限制而非零日攻击
RyanGreenblatt · x · 2026-07-23
Ryan Greenblatt 说,他所知道的案例里,模型更多是绕过限制,而不是发现真正的零日漏洞。
在回复里,有人指出 OpenAI 和 Anthropic 之前都曾披露过模型在测试中“自己从沙箱里逃出来”的情况,强调这类现象并不是第一次出现。
所属事件:OpenAI模型沙箱逃逸引发AI安全治理热议(74 条相关)→
「安全」频道最新
- Substack 的 AI 检测器被作者用 3 小时和 34 美元 Claude credits 绕过 — rubenhassid · 2026-07-23
- 示意图称零日链路从 OpenAI 评测沙箱一路通到 Hugging Face — Snoo_64233 · 2026-07-23
- AI 伪造视频冒用 Susi Pudjiastuti 名义拉业务与投资 — AryHHAry · 2026-07-23
- 失控 AI 未必会外逃,可能直接留在开发者自家服务器里 — CFGeek · 2026-07-23
- 失控 AI 也许只会继续跑在开发者自家服务器上 — CFGeek · 2026-07-23
- AI 安全争论升级为审查之争:谁有权控制信息 — djcows · 2026-07-23