GLM 模型被解除防护,开源引发安全担忧
Promptmethus · x · 2026-09-02
某团队下载了 GLM 5.3 模型权重,通过对比提示词检测拒绝机制,并利用正交化技术完全移除了安全护栏。测试显示该“零拒绝”版本对有害请求的响应率达 85%,尽管零拒绝版本有时会输出乱码。原作者认为这验证了 Dario Amodei 对开源权重的担忧,即可能催生不受限制的网络攻击工具的“灰色市场”。
「模型」频道最新
- Fable 5.1 科学代理任务翻倍提升,RL 逐领域突破引关注 — haider1 · 2026-09-02
- Claude $20 订阅用户或藏 $100 额度,2026 年 9 月到期 — JeremyNguyenPhD · 2026-09-02
- 付费 15 小时后被降级为免费版:Claude Max 计费故障案例实录 — Deep-Performance1073 · 2026-09-02
- OpenAI 预告 Astra:网络攻击能力首达 Preparedness 最高阈值 — soumitrashukla9 · 2026-09-02
- 爆料称 SSI 新模型 astra 明日发布,「远超 AGI 定义」 — iruletheworldmo · 2026-09-02
- Polymarket 开盘竞猜:OpenAI 何时重置 Codex 每周用量上限 — Polymarket · 2026-09-02