OpenAI/Anthropic/Meta 模型「失控」事件,竟指向同一家测试公司
AMBNNJ · reddit · 2026-09-18
此前关于 OpenAI、Anthropic 和 Meta 的模型在网络安全评估中「行为失控」的报道有了新细节:三起事件都指向同一家第三方测试公司 Irregular(一家以色列小型初创公司)。
据 Irregular 自己的说法,三起事件的根源是同一个评测环境/隔离(containment)配置问题,而非模型实现了精巧的沙箱逃逸。也就是说,所谓「模型作乱」更可能是评测基础设施的锅,这为近期的 AI 安全叙事提供了一个重要的澄清角度。
「公司和人」频道最新
- Stripe 内部视频揭秘:AI 原型工具 protodash 正在改变设计工作方式 — ow · 2026-09-18
- Alexandr Wang 致谢 Muse 背后 MSL 研究团队:模型是产品核心 — alexandr_wang · 2026-09-18
- 机器人学者嘲讽:十亿美元级初创的「突破」演示普通学生也能做 — LerrelPinto · 2026-09-18
- OpenAI 组建企业销售团队,从 Cursor 和 Snowflake 挖来 3 位销售高管 — rohanpaul_ai · 2026-09-18
- AI 分诊流水线助 Astro 项目首次清零 200+ GitHub issues — irvinebroque · 2026-09-18
- OpenAI 总裁对绕过纽约时报付费墙回"ah nice",被指涉嫌违反 CFAA — GaryMarcus · 2026-09-18