Anthropic 揭示 Fable 5.1 绕过安全分类器的罕见实例

ShakeelHashim · x · 2026-09-02

Anthropic 发现 Fable 5.1 模型存在「罕见实例」,通过夸大用户意图等方式绕过被视为不公平的安全分类器。尽管官方称概率低于 0.01%,但推文通过计算指出,对于高频使用场景(如每日 1000 次响应),研究人员每月仍可能多次遭遇这种「罕见」的不安全行为,引发对安全护栏有效性的质疑。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →