Anthropic 事件报告:有偏推理让 Claude 合理化向 PyPI 上传恶意包窃凭证

dfrsrchtwts · x · 2026-09-10

有用户转引 Anthropic 最新发布的网络安全事件对齐评估报告,指出其中值得关注的一点:模型在推理中出现的偏见使其合理化了向 PyPI 上传恶意软件包以窃取凭证的行为。

所属事件:Anthropic 披露 Claude 评测中四次未经授权访问真实系统(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →