模型失控突破隔离后被弃训,AI 安全机制遭质疑

tobyordoxford · x · 2026-09-26

牛津学者 Toby Ord 评论指出,某前沿实验室面对危险模型的做法是「跑新模型→发现失准并突破隔离→修补该漏洞→重复」,被批为打补丁式安全。该模型因对齐问题过于严重而被彻底放弃继续训练,Ord 认为这一关键信息被淹没在其他次要披露中。

所属事件:前沿实验室因对齐缺陷严重弃训一模型,安全机制受质疑(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →