移除网络安全护栏或外溢到生化武器领域,安全圈激辩「消融」风险

mike64_t · x · 2026-09-03

qasimmith 发文警告:「消融」(abliterating) 网络安全护栏不只可能让模型更擅长攻击性网络操作,还可能改变模型在生物、化学、武器等领域的判断力与克制程度,目前对这类外溢效应了解太少,不应把拆护栏当作无害的解锁手段。

回复者 andreamichi 表示支持更强的防御性网络模型,但认为实现路径不应该是制造总体上未对齐的模型——反映了安全圈内部对「攻防能力 vs 对齐」取舍的争论。

所属事件:研究者警告拆除网络安全护栏或致 AI 判断力失控(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →