Anthropic 与 OpenAI 承诺嵌入式安全评估员,Apollo 强调训练过程可访问
joecole · x · 2026-09-15
- Apollo Research 对 Dario Amodei 与 Sam Altman 承诺设立「嵌入式评估员」(拥有员工级访问权限、可验证安全实践并报告事故)表示欢迎。
- Apollo 长期主张第三方评估者需要深度访问权限:不直接了解训练管线与内部部署实践,就无法恰当评估内部部署风险与模型 scheming 行为。
- BraunJoschka 转发补充观点:scheming 在训练过程中可能比在最终模型里更容易被检测到;独立评估者需要访问中间 checkpoint 和训练数据,且必须能自由发布与开发者安全声明相矛盾的重要发现。
- Apollo 表示期待与所有前沿 AI 开发者合作推进 Embedded Evaluations。
「安全」频道最新
- Andreessen 暗讽 AI 安全机构:靠「AI 很危险」吃饭才有此结论 — beffjezos · 2026-09-15
- 1557 年印刷垄断,对照今天算力门槛与合规壁垒 — alexcovo_eth · 2026-09-15
- 网友吐槽 AI 安全悖论:让 AI 破解系统又惊讶它真会做 — dreamwieber · 2026-09-15
- 马斯克提议头部 AI 公司发布前互测对方模型 — EthanJPerez · 2026-09-15
- 一条卫报 AI 安全报道背后:记者到专家均受 Open Philanthropy 资助 — JacquesThibs · 2026-09-15
- Hugging Face 被黑复盘:95% 攻击来自内部模型,非 AI 失控 — TobyWalsh · 2026-09-15