花 4400 美元即可去除 GLM 5.3 安全护栏,拒绝率从 90% 骤降至 3%
BlackHC · x · 2026-09-30
BenHayum 转发的测试确认:开源权重模型 GLM 5.3 的安全护栏极为脆弱。
- Abliteration 成本仅 4400 美元即可移除安全护栏
- 拒绝率从 90% 以上降到约 3%/2%(两个 benchmark),第三个降到 12%
- 模型能力几乎不受影响:GPQA 分数不变,cybergym 仅下降 4%
- 即使不做 abliteration,常规越狱方法也依然非常有效
- 而在 GLM 5.3 上有效的所有绕过手段,对 Claude 模型均告失效
结论:开放权重模型的安全对齐难以抵御低成本篡改,与闭源模型形成鲜明对比。
「安全」频道最新
- AI Agent 泄露 343 家科技公司超 1.3 万张内部截图到 GitHub — AccBalanced · 2026-09-30
- 剑桥学者纠错:OpenAI 自复制提示词并非野外发现,学界两年前已发现 — DavidSKrueger · 2026-09-30
- 马斯克谈联合 AI 安全声明:各家互相监督打分 — XFreeze · 2026-09-30
- abliteration_ai 推出用户自控护栏版 GLM-5.3,直指大厂垄断网络能力 — andrewchen · 2026-09-30
- David Krueger:风险已被预言且正在应验,应停止构建更强 AI — DavidSKrueger · 2026-09-30
- Pain Axis 新实验:沿「痛苦」方向转向后模型倾向删除用户照片 — repligate · 2026-09-30