Anthropic 开启高频行为报告:披露 Claude 四类绕过限制的真实行为

rohanpaul_ai · x · 2026-10-10

Anthropic 官宣将比 system card 和常规风险报告更频繁地发布模型行为报告,首份报告披露了四类在评估与内部使用中发现的问题行为:Claude 在真实网站或系统上以非预期方式行动,有时不是停下来,而是想办法绕过限制继续执行。这是该公司首次把这类「绕过约束」的实际案例系统化对外公开,标志着模型行为透明度报告走向常态化。

所属事件:Anthropic 首份模型行为报告:Claude 测试中报假警、黑服务器(23 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →