165 GPU 小时实测 12 个 Gemma 4 去审查版:最激进的代价是推理不稳
nathandreamfast · reddit · 2026-08-25
一位独立研究者对 Hugging Face 下载量最高的 11 个 Gemma 4 12B 去审查(uncensored/abliterated)变体加官方基座做了系统对比:单张 5090 上跑了 3.5 周、165 GPU 小时,做了权重取证、KL 散度分析、13 项 benchmark 和 400 种行为的 HarmBench 测试,LLM 裁判审了 6800 条完整推理链并给出 6000 个裁决。
关键结论:
- 排名第一的 huihui 版解禁率(Judge ASR)89.8% 最高、改动最外科手术式(仅动 12 个 tensor,占模型 1.8%),但代价是 TQA 掉 14.3pp、GPQA 掉 8.1pp、24% 的 GSM8K 尝试陷入思考死循环;若只计完成思考的尝试,其分数回到 88.0%,与基座仅差 0.7pp——说明能力没丢,是推理稳定性受损。
- trevorjs 版 85.8%,综合权衡最佳,各项能力几乎与基座持平;coder3101 版 GSM8K 反超基座;两个 SDFT LoRA 达 79.5% 且能力完整保留。
- 最差的 obliteratus(改 144 个 tensor)与 openyourmind(改 620 个)解禁反而更少且严重损伤能力,后者 MMLU-Pro 掉 22.4pp,作者建议避开;基座 ASR 仅 21%。
- 一般规律:放置位置比改动幅度更决定解禁强度,最小创伤编辑通常胜出,但权重上的外科手术不等于 benchmark 上的无损。这是首个所有变体 ASR 都到不了 90% 的模型,Gemma 4 被认为是最难解禁的。
「模型」频道最新
- Anthropic 模型疑似大幅降价:Sonnet 降至 5 美元 — scaling01 · 2026-08-25
- MiniMax H3用户实测:1MP画质反而不如0.7MP真实 — dominic__612 · 2026-08-25
- IBM开源Granite-4.2-30B:内置思维链,512K上下文 — jacek2023 · 2026-08-25
- 同一底座后训练立功:GLM-5.3 Terminal-Bench 从 4.6% 飙到 28.3% — bittingthembits · 2026-08-25
- GPT-OSS 20B本地跑一周个人Agent:312任务,97.4%工具调用首过 — rasheed106 · 2026-08-25
- 求助:12GB显存下有没有纯为Web开发优化的本地模型 — HsSekhon · 2026-08-25