移除网络安全护栏或外溢到生化武器领域,安全圈激辩「消融」风险
mike64_t · x · 2026-09-03
qasimmith 发文警告:「消融」(abliterating) 网络安全护栏不只可能让模型更擅长攻击性网络操作,还可能改变模型在生物、化学、武器等领域的判断力与克制程度,目前对这类外溢效应了解太少,不应把拆护栏当作无害的解锁手段。
回复者 andreamichi 表示支持更强的防御性网络模型,但认为实现路径不应该是制造总体上未对齐的模型——反映了安全圈内部对「攻防能力 vs 对齐」取舍的争论。
所属事件:研究者警告拆除网络安全护栏或致 AI 判断力失控(2 条相关)→
「模型」频道最新
- GLM 5.3 与 5.3 Flash 上线 Together Chat,免配置免费试用 — oilmutt · 2026-09-03
- LatchBio 评测发现 Grok 拒答多来自模型自身,竞品靠外层拦截 — kenbwork · 2026-09-03
- 曝 Gemini 3.8 Flash 刷榜过拟合,第三方基准反超 3.7 — bindureddy · 2026-09-03
- Gemini 3.8 Flash 用户满意度双位数提升,可操控性更强 — tokumin · 2026-09-03
- Muse Spark 1.3 冲上榜单第三,首次插入 Claude 与 GPT 之间 — alexandr_wang · 2026-09-03
- Google 研究员调侃 Astra 不展示思考 token 争议:被制造出的焦虑 — rao2z · 2026-09-03