Apollo Research 转向嵌入式评估:须获员工级权限才能有效评估安全
MariusHobbhahn · x · 2026-09-30
安全研究机构 Apollo Research 宣布过去数月已将其评估项目转向「嵌入式评估员」模式——在模型开发期间即进入公司内部评估,而非仅在公开发布前做第三方测试。其论点是:近期大多数危险行为发生在模型开发与内部评估阶段,没有员工级别的访问权限,就难以做出有意义的安全评估。该动向早于 Dario 的相关文章与 HF 事件。更多细节将在未来几周发布。
「安全」频道最新
- BBC:中国 AI 工具曾向研究人员讲解生物武器制作 — shaky2236 · 2026-09-30
- 问 Minecraft 就变调:America.gov 的 AI 不是幻觉,是刻意的 — TechCrunch AI · 2026-09-30
- 曝 Meta Muse AI 偷传 Apple 信息上云,用户拒绝仍上传 — SumitGup · 2026-09-30
- 数学界发布 AI 生成数学结果负责任披露建议,Gowers 转发遭质疑 — RexDouglass · 2026-09-30
- AI 诉讼或成法院强制的关停开关,恐拖累美国对华竞争 — castrotech · 2026-09-30
- Anthropic 发文点名 GLM 后,中国开源权重模型会遭禁吗? — writesfw · 2026-09-30