NeelNanda 与安全研究者激辩:中国开源模型绕过对齐护栏的风险

robleclerc · x · 2026-10-05

对齐研究员 Neel Nanda 与网友就前沿模型安全展开交锋:他担忧西方让 AGI 落入中国手中,但认为实验室正在制造「超人类黑客」能力却不懂得如何控制,当前做法风险很大。

robleclerc 回应称:在安全护栏存在时实验室还能控制模型,一旦撤掉就会失控;实验室正尝试在无护栏状态下研究对齐,但中国的开源权重模型不会提供同样的保护。他还引「古格斯之戒」隐喻:正如许多人会滥用隐身能力,没有护栏的模型可能本质上无法对齐。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →