AI安全研究者批评前沿模型发布鲁莽:我们懂关机但不懂对齐

安全研究者@Afinetheorem发推指出,目前我们不知道如何「对齐」AI,只部分知道如何「监控」,但基本知道如何「关闭」AI,因此在不满足后两个条件时发布前沿模型十分鲁莽。他还提出判断厂商安全投入的具体对照指标:模型卡细节、训练完成到发布之间的延迟、是否向美国AISI预发布模型,以及Glasswing等安全测试。

2026-09-09 ~ 2026-09-09 · 3 条相关