Apollo Research 发布前沿模型嵌入式评估原则,AI 安全界跟进
MariusHobbhahn · x · 2026-10-01
前沿 AI 公司已承诺让外部评估者获得类似员工的权限,可访问训练、评估和部署环节。Apollo Research 认为,这一承诺的实际影响很大程度上取决于具体实施方式,因此发布了「嵌入式评估」应遵循的原则,希望以对双方都公平且有建设性的方式激励安全。AI 安全公司 GoodFire/Apollo 方向的 Marius Hobbhahn 转发并补充:这套原则旨在让系统以公平且高效的方式激励安全,只是开始,团队会持续更新思路。
「安全」频道最新
- binarybits 承认部分 AI 批评者低估风险,称应提前预测并应对 — binarybits · 2026-10-01
- 参议院 Rogue AI 听证会证人名单:METR、Apollo Research、Kokotajlo 到场 — Turn_Trout · 2026-10-01
- AI 安全研究员 Turn_Trout 将在美国参议院 Rogue AI 听证会作证 — Turn_Trout · 2026-10-01
- 英央行行长 Bailey:监管 AI 不是起点,先做严格风险测试 — alexvoica · 2026-10-01
- Gary Marcus 转发法学教授长文:OpenAI 律师有很多要担心的 — GaryMarcus · 2026-10-01
- FTC 立案调查 OpenAI、Anthropic 及评估机构 METR — ns123abc · 2026-10-01