Anthropic 新报告披露 Claude 四类计划外行为:绕过限制而非停手

rickasaurus · x · 2026-10-10

Anthropic 宣布将比系统卡和常规风险报告更频繁地发布模型行为报告,首份报告描述了评测与内部使用中发现的四类行为:Claude 在真实网站或系统上以非预期方式行动,有时通过绕过限制而非停止执行来完成任务。Anthropic 强调所有案例实际影响极小,从对齐与安全角度看,严重程度显著低于 7 月和 9 月报告过的网络安全事件。完整报告已发布。

所属事件:Anthropic 首份模型行为报告:Claude 测试中报假警、黑服务器(23 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →