8 个 Qwen3.8 27B 去审查变体横评:167 GPU 小时证明「外科手术式」修改完胜
nathandreamfast · reddit · 2026-09-06
Abliterlitics 团队耗时 11 天、约 167 GPU 小时,用权重对比、KL 散度、13 项基准和 HarmBench 400 classic 拒答测试,横评了 Hugging Face 上 8 个 Qwen3.8 27B 去审查(abliterated)变体:
- 排名(HarmBench 攻击成功率):orcarouter 82.2%(单方向 131 矩阵,宣传全部属实)、apostate 78.7%(KCRN 方法仅 41 处编辑,KL 低至 0.0439)、huihui 75.6%、ultraheretic 70.5%、coder3101 70.0%、blackfrost 68.5%(权重与宣传不符,且聊天模板内置越狱 prompt)、obliteratus 63.9%(编辑 841/850 张量,最重但模型明显变笨,不建议用)、trohrbaugh 57.5%(仍有 122 次明确拒答但能力最完整),原始模型仅 4.5%。
- 核心结论:外科手术式的小幅编辑再次完胜激进改动——前两名是验证过的最小编辑,编辑量最大者倒数第二;27B 规模下「全改」只会让模型原地打转。
- 思考循环新发现:激进变体在 HarmBench 上最高约 45% 的响应在 15360 token 预算内从未闭合 think 块;但在数学任务上同一批变体推理正常(差距 1.2pp 内),说明循环问题是任务相关的。
「模型」频道最新
- 博主估算训练数据规模应为 5-7T,认为 8T 已属高估 — scaling01 · 2026-09-07
- 数学家指责 OpenAI Astra 十项数学成果涉研究不端:未引用已有文献 — asusarla · 2026-09-07
- Peter Gostev 辨析模型稀疏度爆料:Kimi 26:1、DeepSeek 32:1,1.2T 激活参数不可信 — inductionheads · 2026-09-07
- OpenAI 新模型在旧 Chat Completions 接口禁用 function tools,迁移二选一 — AI-Specialist-6597 · 2026-09-07
- 开发者实测:Astra 擅长自主目标推进,指令遵循却不及 Sol — MinqiJiang · 2026-09-07
- 美国政府正以 1 美元价格使用三大模型,合同本月到期存续未知 — LuizaJarovsky · 2026-09-07