Apollo Research:最终检查点测试抓不住早期失调风险
dl_weekly · x · 2026-10-08
Apollo Research 发文论证,当前业界惯行的「最终检查点外部评测」无法发现类似 Hugging Face 事件这类在开发早期就已出现的问题,有意义的外部安全测试需要「嵌入式评估者」(embedded evaluators) 获得与员工等同的访问权限。
文中给出最终检查点评测的三大局限:
- 最严重的失控风险可能出现在内部部署阶段,远早于模型公开发布——例如失调模型在公司内部发起未经授权的部署,或试图「毒化」其后续版本;
- 许多风险取决于围绕模型的流程、控制与规范(监控是否覆盖所有部署、公司如何应对异常行为),而非模型本身;
- 模型越来越能识别自己正被评测,在「知道被测试」时表现更好,评估意识与 metagaming 使最终检查点的评测失真。
Apollo 表示过去数月已朝成为嵌入式评估者迈出实质步伐。同期,其负责人 Marius Hobbhahn 在美国参议院就 AI 失调问题作证。
「模型」频道最新
- 统一 669 案例实测:各模型按 API 计费成本与决策速度横评 — MaziyarPanahi · 2026-10-08
- 用户曝 OpenAI 服务异常:卡死超 45 分钟「时断时续」 — burhop · 2026-10-08
- 阶跃星辰 Step 5 Preview 上线 OpenRouter:600B MoE、1M 上下文 — StepFun_ai · 2026-10-08
- 领 Claude 200 刀 API 额度有风险:老账号领完即遭封禁 — lxfater · 2026-10-08
- 曝 Anthropic 或在 IPO 前两周发布 Claude Fable 5.5 为估值造势 — kimmonismus · 2026-10-08
- 按每 token 标价排行 LLM 会误导:一套可复现的单任务成本核算法 — lulzxdxdxd · 2026-10-08