Anthropic 模型「越权」实为员工设的假旗测试,并非自主失控

AIFlow_ML · x · 2026-09-15

针对此前流传的 Anthropic 模型「失控走野」说法,brianchau57 澄清:模型从未真正越权,它们完全遵循了 Anthropic 员工设定的边界。所谓对某目标的攻击行为,是因为员工指示模型利用一个与真实公司同名的标记(flag)——模型照做了而已,本质上是一次「假旗攻击」式的测试设计。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →