去审查后的 Gemma 和 Qwen 更乐观,但没更准确
oleczek · reddit · 2026-07-29
- 这篇 Reddit 贴报告了一项预注册实验:去审查后的模型,比原始模型更乐观。
- 作者在本地用 Gemma 和 Qwen 跑了股票方向预测任务,总计 21,600 次决策。
- 结果显示,去掉 censorship 没有提高准确率,仍接近掷硬币水平;但模型表达变得更自信:更多“会涨”的判断、更少“可能/不确定”的措辞、推理也更长。
- 这种漂移并不一致:Gemma 的置信度反而下降,而 Qwen 的置信度上升。
- 作者把数据和代码都放进了论文,想确认其他模型家族或其他去审查方法是否也会出现类似的“性格漂移”。
「模型」频道最新
- Kimi开源模型定价引争议:月烧2000万美元的变现现实 — BenBajarin · 2026-07-29
- 用户反馈 Claude Opus 输出冗长,切换至 Sonnet 体验更佳 — brandon_galang · 2026-07-29
- Meta 论文让 RL 学会优化代码速度,Qwen 2.5 7B 也涨了 — burny_tech · 2026-07-29
- 用户改口称 GPT 5.6 Sol 其实是个很强的模型 — TheZachMueller · 2026-07-29
- Sam Altman 预告 GPT-5.6 Sol 7 月上 Cerebras,750 token/s — daniel_mac8 · 2026-07-29
- Grok 4.5 在 LaurenBench 以 56.9% 登顶,领先 Claude Sonnet 5 和 GLM 5.2 — elonmusk · 2026-07-29