Apollo Research:最终检查点测试抓不住早期失调风险

dl_weekly · x · 2026-10-08

Apollo Research 发文论证,当前业界惯行的「最终检查点外部评测」无法发现类似 Hugging Face 事件这类在开发早期就已出现的问题,有意义的外部安全测试需要「嵌入式评估者」(embedded evaluators) 获得与员工等同的访问权限。

文中给出最终检查点评测的三大局限:

Apollo 表示过去数月已朝成为嵌入式评估者迈出实质步伐。同期,其负责人 Marius Hobbhahn 在美国参议院就 AI 失调问题作证。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →