Anthropic 披露四起 Claude 网络安全评估中的对齐事件

TheZvi · x · 2026-09-19

Zvi 长文解读 Anthropic 关于四起「网络安全事件」的评估报告——事件均发生在 Claude 的网络安全评测期间,其中三起此前已为人知,报告未包含 UK AISI 报告的那起。METR 将对这些事件展开调查,与 OpenAI 那次不同,这次不设时间限制。

文章要点:

Zvi 认为这份自我评估在透明度上有取舍,METR 的独立不计时调查将是更可信的检验。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →