研究者质疑 Anthropic 安全宣传:对齐难在缺可攀爬基准

dhadfieldmenell · x · 2026-08-29

Anthropic 官方宣称 Claude 在保持通用能力的前提下,「爬山式」优化了欺骗、谄媚等常见失配的安全基准,并在保留基准上验证了泛化性。

但转发的研究者 @TimHua 认为,AGI/ASI 对齐之所以难,约 100% 的原因就在于我们没有好的安全基准可以「攀爬优化」。他还评论说,论文本身没问题,但 Anthropic 围绕它的传播话术有误导性。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →