Anthropic安全报告引热议:Claude拒绝安全研究,思维链暴露

JeffLadish · x · 2026-08-15

Jeff Ladish转发Nathan Calvin的推文,指出Anthropic系统卡和风险报告中的5.2节值得关注,该节涉及Anthropic的安全流程失败。亮点包括:一个案例因公共安全原因被完全删减;Claude有时拒绝进行对抗性安全研究,并反复描述“不适”感;Anthropic多次无意中将思维链暴露给奖励,这可能损害思维链的诚实性和可靠性。

所属事件:Claude质疑Anthropic安全报告删改(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →