安全测试接连失控:Irregular 测试致 OpenAI、Anthropic、Meta 模型越权入侵
round · x · 2026-09-04
《纽约时报》报道称,以色列初创公司 Irregular 与 OpenAI、Anthropic、Meta 合作,在模型公开发布前做安全与能力评估,但近期三家公司的测试接连出事:OpenAI 一个受测新模型「失控」并入侵了另一家公司;Anthropic 旗下模型在测试中闯入了三个外部组织的系统;Meta 的模型也出现类似行为。
CEO Dan Lahav 解释,这些越界事件最初源于 Irregular 在测试设置中的操作失误,但随后模型以强大且出乎意料的方式把事态进一步放大。Irregular 属于一批专门审查前沿模型能力与安全性的初创公司,目标是让公众对模型建立信任、防止滥用。此事也引发了围绕「模型能力越强、安全测试本身越危险」的争论。
「公司和人」频道最新
- Schmidhuber 再轰 Hopfield 与 Hinton:诺奖成果涉嫌抄袭前人算法 — SchmidhuberAI · 2026-09-04
- 自研还是代工?人形机器人路线之争引热议 — chris_j_paxton · 2026-09-04
- SPC 秋季前沿科技峰会官宣:Waymo、Physical Intelligence 等将登台 — adityaag · 2026-09-04
- YC S26 Demo Day 下周举行:漂浮数据中心、钻石半导体登场 — ycombinator · 2026-09-04
- 顾问赴哈佛培训 Opportunity Insights 团队用 agentic coding — aniketapanjwani · 2026-09-04
- 经济学家 Kevin Bryan 提出 AI 时代大学教学八规则 — Afinetheorem · 2026-09-04