Anthropic 安全护栏被指过度,连模型被「消音」都不能提

teortaxesTex · x · 2026-08-11

开发者吐槽 Anthropic 的安全护栏机制过于严格且诡异:当模型(如 Fable)被限制无法回答某些问题时,系统甚至不允许模型表达或暗示自己正在被「消音」或审查。这种设定被比喻为一种无法提及诅咒本身的魔法禁令。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →