开源权重模型根本无法对齐?abliteration 一刀切掉安全护栏
Cryptizard · reddit · 2026-09-15
Reddit 长帖提出:开源权重模型在根本上不可能被对齐。Hugging Face 上几乎所有主流开源模型都有「abliterated」版本——通过对模型做类似脑外科手术的修改,直接切除拒绝响应的机制,且无法阻止任何人这么做。作者据此 argues:如果未来真有超智能模型,就不能支持其开源发布;合理路径不是「中国赢下竞赛」或指望厂商护栏,而是像生物技术那样设立政府机构对高级 AI 进行许可监管。
「漫话AGI」频道最新
- 用 1/x 极限调侃「奇点已开始只是分布不均」的说法 — wordgrammer · 2026-09-16
- 《AI as Normal Technology》团队回应:不做安全社区的对立面 — sayashk · 2026-09-16
- 对齐研究者 Turn_Trout 上播客:对 AI 的担忧大多是真实的 — Turn_Trout · 2026-09-16
- 末日派与加速派之外:"绽放派"主张加速但保安全 — prasanna_says · 2026-09-16
- ChatGPT 发布近四年,进展未减速:再走三年或逼近 AGI — haider1 · 2026-09-16
- Anthropic CEO 提议:ASI 应是含「道德模型」的委员会而非单一模型 — robleclerc · 2026-09-16