GLM-5.3 系列模型展现罕见抗消融能力

hunarbatra · x · 2026-08-29

测试显示 GLM-5.3 系列模型对“消融”攻击具有异常强的抵抗力。尝试通过增加数据、多向子空间和层约束消融来移除其拒绝机制均告失败。研究者假设其安全策略深度分布于权重中,得益于 SFT 和偏好训练。这表明 GLM-5.3 的对齐工作非常扎实。Zai 团队将发布权重和技术报告。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →