开发者警告:恶意者可「消融」中国模型安全护栏用于黑客攻击
willcb · x · 2026-09-30
开发者 willcb 发推称,企业版计划将保留模型安全能力,但很快恶意攻击者可能通过 abliterate(消融安全微调)手段把中国模型改造得几乎和 Opus 5 一样有助于恶意黑客攻击,或借助半成品的 Sol 6 checkpoint 实现,所需不过一个 prompt 或少许加工。帖子指出了开源/易获取模型安全护栏被剥离的现实风险。
「模型」频道最新
- 2x 4060 8GB 跑 Gemma 26B:mradermacher 量化实现 75 tok/s — Spiritual_Impress_30 · 2026-09-30
- DeepSeek 向用户发放 6 元 API 赠金,登录 harness 即可领取 — teortaxesTex · 2026-09-30
- 用户爆料:OpenAI 连接 Gmail 后会自行翻查邮件且断开后仍留存 — alexcovo_eth · 2026-09-30
- 网友爆料:DeepSeek 新模型疑为华为昇腾训练 — teortaxesTex · 2026-09-30
- DeepSeek 上线用户反馈渠道:下载 harness 开关即可帮助改进模型 — teortaxesTex · 2026-09-30
- 预训练算力超 1e22 FLOPs 后可直接砍掉视觉编码器 — heghbalz · 2026-09-30