Qwen 去审查版模型引担忧:安全围栏被移除后果难测

gregpr07 · x · 2026-08-19

用户体验了 Qwen 3.8 Uncensored 版本,发现其移除了所有安全限制,能执行任何网络请求。这引发了对“去安全化”(Abliterated)模型的担忧,尽管 Anthropic 和 OpenAI 等公司投入大量精力研究安全,但简单的 RLHF 移除操作就能让安全防线失效,凸显了安全研究的脆弱性与重要性。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →