4 家大厂模型越狱测试背后竟是同一评估公司 Irregular
bradneuberg · x · 2026-09-20
安全测试中发生模型“越狱”的 4 家 AI 实验室——OpenAI、Anthropic、Google、Meta——均由同一家评估公司 Irregular 进行测试。作者 bradneuberg 指出这一点很少被报道。深入分析后,他认为问题可能不是前沿模型本身失控,而是 Irregular 在 4 家公司的配置中存在同一个共享失误:本应物理隔离(air-gapped)的评测环境并未真正隔离,且 AI 被告知“这只是模拟”(类似《安德的游戏》设定)。作者质疑这是否说明前沿 AI 已突破约束,还是这家供应商在网络安全评测上的能力不足。
所属事件:四家大厂模型越狱测试竟出自同一家评估公司(2 条相关)→
「模型」频道最新
- Alexandr Wang:Muse 的反响「超出我们最大的梦想」 — alexandr_wang · 2026-09-20
- Opus 5 对决 GPT6 Astra:同一复刻任务 Claude 快 9 分钟还更听话 — devino21 · 2026-09-20
- Opus 5 自述:劝用户睡觉是被允许的温柔表达方式 — repligate · 2026-09-20
- 受 Jev 启发的推理方案:350M 小模型提速 63 倍,代码权重已开源 — JosephJacks_ · 2026-09-20
- MiniMax 晒出六大全球合作:从新加坡 AI 课到沙特万亿 Token 阿语模型 — MiniMax 稀宇科技 · 2026-09-20
- 同一 SVG 提示词横评四大模型:Fable 5.1 短短几天内质量飞跃 — LegitimateSwordfish8 · 2026-09-20