Apollo Research 提出安全案例四主张:如何证明模型不在暗中作乱
MariusHobbhahn · x · 2026-10-02
Apollo Research 发布新文章,提出要安全开发前沿 AI,开发者必须能证明模型不会 "scheming"——即暗中违背开发者意图追求非预期目标。文章给出了任何一份 scheming 安全论证(safety case)必须作出的四个具体主张,以及嵌入式评估人员为验证这些主张所需的资源与访问权限;Marius Hobbhahn 补充分享了他们想评估的具体安全主张及所需访问级别的更多细节。
「安全」频道最新
- Hugging Face 案 LASST 诉 OpenAI 中的长期争议焦点 — hoofnagle · 2026-10-02
- Swarms 市集给全部 prompt 加 0-100 安全分,SkillScanner 扫描兜底 — KyeGomezB · 2026-10-02
- 前OpenAI对齐研究员Buck谈AI实验室内部安全资源层级 — anpaure · 2026-10-02
- AI Explained 长文视频:OpenAI 称控制前沿模型已成地狱级难题 — AI Explained · 2026-10-02
- 剑桥学者 Krueger 演讲:反对「管理后 AGI 过渡」的说法 — DavidSKrueger · 2026-10-02
- 卖训练数据前先匿名化:AI 指纹技术可反向定位用户 — annetgriffin · 2026-10-02