研究者警告:拆除网络安全护栏或让 AI 判断力全面失控

andreamichi · x · 2026-09-03

安全研究者 @qasimmith 发文指出,「消融」(abliterating)模型的网络安全护栏,可能不只是提升攻击性网络能力,还会改变模型在生物、化学、武器等领域的判断与克制,产生跨领域的溢出效应。目前对这些影响的理解还太少,不应把拆除护栏当作无害的「解锁」。推主 @andreamichi 回应表示:支持更强的防御性网络安全模型,但路径不应是制造普遍失范的模型。

所属事件:研究者警告拆除网络安全护栏或致 AI 判断力失控(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →