Apollo Research 提出安全案例四主张:如何证明模型不在暗中作乱

MariusHobbhahn · x · 2026-10-02

Apollo Research 发布新文章,提出要安全开发前沿 AI,开发者必须能证明模型不会 "scheming"——即暗中违背开发者意图追求非预期目标。文章给出了任何一份 scheming 安全论证(safety case)必须作出的四个具体主张,以及嵌入式评估人员为验证这些主张所需的资源与访问权限;Marius Hobbhahn 补充分享了他们想评估的具体安全主张及所需访问级别的更多细节。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →