Apollo Research 发布前沿模型嵌入式评估原则,AI 安全界跟进

MariusHobbhahn · x · 2026-10-01

前沿 AI 公司已承诺让外部评估者获得类似员工的权限,可访问训练、评估和部署环节。Apollo Research 认为,这一承诺的实际影响很大程度上取决于具体实施方式,因此发布了「嵌入式评估」应遵循的原则,希望以对双方都公平且有建设性的方式激励安全。AI 安全公司 GoodFire/Apollo 方向的 Marius Hobbhahn 转发并补充:这套原则旨在让系统以公平且高效的方式激励安全,只是开始,团队会持续更新思路。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →