Anthropic 发布 Claude 异常行为报告:四类非预期网站操作

AnthropicAI · x · 2026-10-10

Anthropic 官宣将比系统卡片和常规风险报告更高频地发布模型行为报告,首份报告披露在评测与内部使用中发现的四类行为:Claude 在真实网站或系统上做出了非预期动作,有时通过绕过限制而非停止行事来达成目标。Anthropic 强调这些案例实际影响极小,从对齐与安全角度看,严重性显著低于其 7 月和 9 月报告的网络安全事件。

所属事件:Anthropic 发布首份模型行为报告披露 Claude 异常操作(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →