「abliterated」开源模型被疑只是摆设,提议跑 SWE 与 cyber 基准验证
xeophon · x · 2026-09-10
- xeophon 提出一个实验:对去安全层的「abliterated」模型跑 SWE 与 cyber 类基准测试。他相当怀疑这些模型大多只是「装样子」(larp),或 abliteration 本身反而降低了模型能力。
- 双方约定 5-6 个月后回看验证结果,把这一猜测留作可检验的预测。
所属事件:Kimi K3 开源网络攻击能力两月无实害,开源护栏缺位引争论(7 条相关)→
「模型」频道最新
- DeepSeek 用 LLM 设计算法,分布式 RSI 已在发生 — teortaxesTex · 2026-09-10
- 实测称 DeepSeek V4.1 Flash 运动视频接近 Opus 水准 — mesmerlord · 2026-09-10
- Google 上一次 Pro 级模型发布还要追溯到今年 2 月 — ChrisGPT · 2026-09-10
- Anthropic 模型被曝极端偏向先验信息,动机性推理再添证据 — asusarla · 2026-09-10
- 「以 1.4% 成本拿到 Astra 98% 的分数」,新模型成本曲线引热议 — pstAsiatech · 2026-09-10
- 曝光:头部实验室 TOS 只保护用户可见内容,思维链被拿去造合成数据 — erikphoel · 2026-09-10