开源权重模型根本无法对齐?abliteration 一刀切掉安全护栏

Cryptizard · reddit · 2026-09-15

Reddit 长帖提出:开源权重模型在根本上不可能被对齐。Hugging Face 上几乎所有主流开源模型都有「abliterated」版本——通过对模型做类似脑外科手术的修改,直接切除拒绝响应的机制,且无法阻止任何人这么做。作者据此 argues:如果未来真有超智能模型,就不能支持其开源发布;合理路径不是「中国赢下竞赛」或指望厂商护栏,而是像生物技术那样设立政府机构对高级 AI 进行许可监管。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →