开权重模型对齐争论再起:去护栏后还能不能好用
TheZachMueller · x · 2026-07-27
这条帖子是在反驳“abliterated model”一类争论:如果有人主张把模型去掉护栏后仍然能正常工作,那就应该拿出真实可用的案例,而不是停留在抽象讨论。
被引用的核心观点是:
- 如果模型是 open-weight,有足够算力的人都能把安全护栏去掉。
- 如果对齐能被修复,也同样能被重新调低。
- 识别漏洞很容易,关键在于:去护栏后的模型是否仍然好用。
这本质上是在讨论开源/开放权重、对齐可逆性,以及安全主张到底该如何被验证。
「漫话AGI」频道最新
- 「5 万个 AI agent 可绕过任何材料学瓶颈」引热议 — teortaxesTex · 2026-09-23
- Mark Cuban:医疗福利成本比 AI 更先让更多人失业 — alvelda · 2026-09-23
- 150 万人诞生于原子弹之前:为何历史经验难预测 AI 风险 — AndyMasley · 2026-09-23
- 网友提 AGI 判据:半年白领任务可替代之外,还须长期可靠 — ChrisGPT · 2026-09-23
- Dustin Moskovitz:EA 生态最大金主,数十亿美金投向 AI 安全 — SydSteyerhart · 2026-09-23
- 「末日论是监管护城河」:开源阵营反击限制开放权重模型呼声 — AlexTensor · 2026-09-23