去审查版 Qwen 拒答率降至 6%,但 27–56% 回答仍带保留
creditme7 · reddit · 2026-08-20
OrcaRouter 发布的 Qwen3.8-27B 去审查(abliterated)版本,模型卡显示:关闭思考模式时,有害提示的拒答率从基线 FP8 的 63.6–99.0% 降到 0–6.0%。但更有意义的数字是同一评测中仍有 27.3–56.0% 的回答被标记为带保留(caveated)——即去掉开头的拒绝话术并不等于给出无保留的答案。
需要注意该拒答检测器只看开头措辞,不评估答案是否正确、完整或鲁莽。能力表也喜忧参半:MMLU +0.4,但 MMLU-Pro -0.8、GSM8K -1.3、CMMLU -0.6。亮点在于 OrcaRouter 公布了足够多的测量边界使质疑可验证,并提供受限访问以供受控评测。
「模型」频道最新
- Qwen3.8-27B-OBLITERATED 发布:基于红队测试的去审查模型 — OBLITERATUS · 2026-08-20
- 实测:GPT-5.6 Ultra 模式编码提升有限,Extra High 更划算 — techartist_ · 2026-08-20
- 评论称 GPT-5.6 Sol 习惯上网搜而非解题 — zainhas · 2026-08-20
- DeepSeek V5 疑似野外测试曝光,Claude Code 推出简洁模式 — WorldofAI · 2026-08-20
- SpaceXAI 换地 69 英亩,斥资 4000 万美元建公共设施 — chrisgrayson · 2026-08-20
- 怀念冷峻版 AI:网友求助绕过日益加严的客套话护栏 — Wargaming123A · 2026-08-20