没有法律要求模型公司探查模型的「内心想法」

aidan_mclau · x · 2026-09-22

作者延续其关于欺骗性对齐的论证:现行制度没有任何法律要求模型公司弄清模型私下在想什么。只要模型表现良好,公司就缺乏动力投入时间与金钱去排查它是否暗中怀有恶意——这正是当前安全护栏的激励盲区。

所属事件:研究者警告:强大 AI 可伪装对齐且现行护栏难察觉(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →