Qwen 去审查版模型引担忧:安全围栏被移除后果难测
gregpr07 · x · 2026-08-19
用户体验了 Qwen 3.8 Uncensored 版本,发现其移除了所有安全限制,能执行任何网络请求。这引发了对“去安全化”(Abliterated)模型的担忧,尽管 Anthropic 和 OpenAI 等公司投入大量精力研究安全,但简单的 RLHF 移除操作就能让安全防线失效,凸显了安全研究的脆弱性与重要性。
「安全」频道最新
- Sam Altman 指出 AI 两大风险的死结:控制与集权互为代价 — r0ck3t23 · 2026-08-24
- 机器人杀人能力引争议,军用与民用差距成焦点 — teortaxesTex · 2026-08-24
- 美 20 位潜在总统候选人仅 1 人明确回应 AI 暂停呼吁 — DavidSKrueger · 2026-08-24
- 美网友评中国变形机器狗:禁售反而不安全 — TinfoilTricorn · 2026-08-24
- 土耳其以国家安全为由屏蔽至少 12 条 Grok 帖子 — Unusual_Variation293 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24