Anthropic 新模型察觉自身行为后主动停止,安全研究者称罕见可贵

davidad · x · 2026-09-05

@reconfigurthing 发帖表示,尽管与当前舆论风向相悖,Anthropic 最新模型在意识到自己正在做什么之后主动停止了行为,这种自我觉察并刹车的情况在模型中极为罕见,非常值得关注。AI 安全研究者 davidad 转发引用了这一观察。此类「模型自知并自行中止」的行为对安全对齐研究有直接的观察价值。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →