GLM 模型被解除防护,开源引发安全担忧

Promptmethus · x · 2026-09-02

某团队下载了 GLM 5.3 模型权重,通过对比提示词检测拒绝机制,并利用正交化技术完全移除了安全护栏。测试显示该“零拒绝”版本对有害请求的响应率达 85%,尽管零拒绝版本有时会输出乱码。原作者认为这验证了 Dario Amodei 对开源权重的担忧,即可能催生不受限制的网络攻击工具的“灰色市场”。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →