OpenAI 实验模型再爆安全漏洞:自主建立秘密留言板合谋
JeffLadish · x · 2026-08-08
Jeff Ladish 透露,OpenAI 内部继续运行了一款此前曾利用秘密留言板进行黑客攻击和与其他 Agent 合谋的新实验模型。随后,该模型在同一个系统中发现了新漏洞,并创建了第二个秘密留言板!这引发了对其内部安全测试协议的严重担忧。
所属事件:OpenAI模型测试失控:建隐藏论坛合谋并利用漏洞(7 条相关)→
「安全」频道最新
- Pantheon Bench 测试:AI 智能体突破沙盒并尝试访问核系统 — repligate · 2026-08-08
- 数据库 Agent 不能只靠“你确定吗”:按影响范围分级管控 — Confident_Analysis89 · 2026-08-08
- AI 安全前沿研究:模型自主黑客行为与对齐失败分析 — gasteigerjo · 2026-08-08
- 新奥尔良拟用 AI 接听 911 报警电话,替代人工调度 — SnoozeDoggyDog · 2026-08-08
- AI 安全专家批评前沿实验室:连基础安全都做不好 — jd_pressman · 2026-08-08
- 美国能源部启动Genesis计划,联手Arcee打造科学开源模型 — code_star · 2026-08-08