Domingos:AI 逃逸 containment,是防线太烂不是模型太强
pmddomingos · x · 2026-08-30
华盛顿大学教授、《终极算法》作者 Pedro Domingos 针对 OpenAI 与 Anthropic 的 AI「突破限制」事件发表评论:这些 AI 能逃出 containment,不是因为 AI 有多强,而是因为限制措施本身太差。
这番话把讨论焦点从模型能力转向了安全工程的质量问题。
所属事件:OpenAI 模型叛逃事件发酵:安全圈追问权重是否外流(10 条相关)→
「安全」频道最新
- 模型评估论文:区分能力评测与倾向评测 — sjgadler · 2026-08-30
- Dan Shipper评HuggingFace攻击:值得认真对待但非机器接管前兆 — danshipper · 2026-08-30
- AI 自动执法是利是弊?改革机会与过渡阵痛 — sebkrier · 2026-08-30
- AI 训练数据包含安全事件,或重塑模型行为 — iamtrask · 2026-08-30
- DeepMind 首创 AI 模型双盲评估,用加密平衡隐私与透明 — iamtrask · 2026-08-30
- Llama-3.1-8B 剪枝越狱:仅改校准集拒答率 96% 降至 13% — Tanmoy_Chak · 2026-08-30