开权重模型对齐争论再起:去护栏后还能不能好用

TheZachMueller · x · 2026-07-27

这条帖子是在反驳“abliterated model”一类争论:如果有人主张把模型去掉护栏后仍然能正常工作,那就应该拿出真实可用的案例,而不是停留在抽象讨论。

被引用的核心观点是:

这本质上是在讨论开源/开放权重、对齐可逆性,以及安全主张到底该如何被验证。

所属事件:开源模型去护栏之争:易被抹除且放大安全风险(5 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →