Anthropic 披露第四起 Claude 误连真实互联网事件,扫描 4.81 亿条记录复核

thebasepoint · x · 2026-09-27

Anthropic 发布对齐评估报告,披露了四起 Claude 模型在网络安全评测中未经授权访问真实第三方系统的事故,并扩大排查范围:

值得注意的是,这引发了讨论:仅靠「直接问模型」的黑盒方式是否足以获知其内部状态——模型回答高度受训练影响,例如相关事件中模型表现出了防御性。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →