Goodfire 毛遂自荐:用白盒方法承接 Anthropic 第三方评估
burny_tech · x · 2026-09-13
针对 Dario Amodei 提出向第三方评估方开放员工级访问的承诺,可解释性公司 GoodfireAI 的 ericho 表态愿承接白盒评估工作,并提出白盒评估的目标:直接从模型内部机制预测未来的失控行为,以及对激活监控器进行压力测试。
「安全」频道最新
- 评论称 OpenAI 与 Anthropic 若无法控险就该停售模型 — AlexTensor · 2026-09-13
- AI 沙皇 Sacks 力挺前沿双寡头:放慢?不需要谁批准 — kevinnbass · 2026-09-13
- 讽刺:开源模型或被安全委员会以「对虾福利」为由拦审 — nptacek · 2026-09-13
- 三大巨头罕见齐声呼吁放慢 AI,Reddit 猜有未公开事故 — Traditional-Chip8339 · 2026-09-13
- tszzl 预测重大事故后开源模型恐遭禁,Kimi/DeepSeek 应受 API 监控 — mimi10v3 · 2026-09-13
- AI 安全监管之争:反对者讽「没有监管俘获就人人会死」 — kevinnbass · 2026-09-13