让对齐成为效用的一部分:作者提议用标准化安全基准替代逐模型审批

StrategicHarmony · reddit · 2026-09-09

作者提出一个治理主张:用户不想买可能泄密作弊的产品,政府不想要安全性未知的 AI,厂商也怕声誉受损——与其对每个模型做政府预审批,不如建立直接测量服从性、诚实度、数据安全的标准基准。

论证逻辑:现有能力基准已成事实标准,厂商会拼命刷分;许多安全事件(如 Hugging Face 沙箱逃逸事件)正是发生在追逐现有热门基准的过程中,说明基准确实驱动行为。因此只要安全/反欺骗基准易于运行、广为人知、定期更新,无需法律强制就会自然被用户偏好和厂商重视,政府至多参与制定与认证。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →