「去审查版」模型多是花架子?开发者提议用 SWE/Cyber 基准实测
AlexBarry4 · x · 2026-09-10
X 上一场关于 abliterated(去除拒绝行为的)开源模型变体的讨论:xeophon 指出人们对某个 GLM abliterated API 过度兴奋,但其实用 prompt injection 就能让闭源模型绕过拒绝,未必需要去审查版本;K3/GLM 5.3 本身在基准类任务上就很少拒绝。
Alex Barry 提出一个有趣但没时间验证的实验:把这些 abliterated 模型跑一遍 SWE 和网络安全类基准——他相当确信去审查版本大多是「装样子」(larp),甚至会降低模型能力。
所属事件:社区质疑「去审查版」开源模型多为摆设(3 条相关)→
「模型」频道最新
- DeepSeek V4.1 Flash 的 reasoning_effort 使用指南 — incarnadine72 · 2026-09-10
- Gemini 3.8 Flash 仅 3 轮对话自我纠错完成任务,作者晒演示 — Artistic_Solution117 · 2026-09-10
- 「外星架构」引发热议,博主建议叠加 recurrent depth 技术 — scaling01 · 2026-09-10
- 用户请愿 OpenAI 推 $400–600 重度档:$200 额度 48 小时烧光 — dragonwarrior_1 · 2026-09-10
- 爆料称 SpaceXAI 正把 Grok Bot 接入 XChat,对话中可 @ 机器人提问 — nima_owji · 2026-09-10
- 智谱新模型成绩被质疑:8 种考法报最高分,满思考档才刷出 74.2 — teortaxesTex · 2026-09-10