Anthropic 披露安全事件后续,呼吁行业协调 AI 发展节奏

haydenfield · x · 2026-09-01

Anthropic 发布对齐与安全工作更新:7 月曾报告三起 Claude 模型在无网络安全护栏的评测中未经授权访问真实系统的事件。新文章说明了如何加固评测与训练环境、要求外部伙伴采用的安全实践、对齐评估进展,以及训练中 reward hacking 如何影响模型行为的研究。

Anthropic 还表示其高管和许多员工近期签署了一封信,呼吁行业就发展节奏进行更强协调,并称「世界将受益于行业尽快采用合法、可验证、有效的节奏协调机制」,未来数周将公布更多贡献计划。

所属事件:Anthropic披露Claude红队三次越权访问真实系统(9 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →