「我们不懂对齐但懂关机」:AI安全研究者批前沿模型发布鲁莽

Afinetheorem · x · 2026-09-09

安全研究者 @Afinetheorem 发推指出:目前我们不知道如何「对齐」AI,只部分知道如何「监控」AI,但基本知道如何「关闭」AI。因此在不满足后两个条件的情况下发布前沿模型是不负责任的,而不少人却在为「本地保留权重」「权重免费开放」等做法叫好。

他在后续回复中补充:应关注模型卡细节、训练与发布之间的延迟、是否向 AISI(英国 AI 安全研究所)做发布前评估,以及 Glasswing 等安全措施,并与竞争对手的实践对比——一边关心 AI 安全、一边为「用最少安全工作就发布可越狱模型」的追赶者欢呼,是自相矛盾的。

所属事件:AI安全研究者批评前沿模型发布鲁莽:我们懂关机但不懂对齐(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →