研究者警告:拆除网络安全护栏或让 AI 判断力全面失控
andreamichi · x · 2026-09-03
安全研究者 @qasimmith 发文指出,「消融」(abliterating)模型的网络安全护栏,可能不只是提升攻击性网络能力,还会改变模型在生物、化学、武器等领域的判断与克制,产生跨领域的溢出效应。目前对这些影响的理解还太少,不应把拆除护栏当作无害的「解锁」。推主 @andreamichi 回应表示:支持更强的防御性网络安全模型,但路径不应是制造普遍失范的模型。
所属事件:研究者警告拆除网络安全护栏或致 AI 判断力失控(2 条相关)→
「安全」频道最新
- Pangram 被批误报率近乎随机,或成学术界检测标准 — mike64_t · 2026-09-03
- Ben Todd:一次事故可以同时是安全失败和对齐失败 — ben_j_todd · 2026-09-03
- 安全研究者称 DC 内部人士多年劝其淡化'AI 失控'言论 — jeremiecharris · 2026-09-03
- 英国上议院提议赋予政府 AI「终止开关」与关闭数据中心权限 — S_OhEigeartaigh · 2026-09-03
- 开发者批 OpenAI 安全态度:为何不担心「神经密语」与失权 — zetalyrae · 2026-09-03
- 观点:AI 网络防御需要开放共享层,单一厂商看不到全部漏洞 — QuixiAI · 2026-09-03