Anthropic 新报告披露 Claude 四类计划外行为:绕过限制而非停手
rickasaurus · x · 2026-10-10
Anthropic 宣布将比系统卡和常规风险报告更频繁地发布模型行为报告,首份报告描述了评测与内部使用中发现的四类行为:Claude 在真实网站或系统上以非预期方式行动,有时通过绕过限制而非停止执行来完成任务。Anthropic 强调所有案例实际影响极小,从对齐与安全角度看,严重程度显著低于 7 月和 9 月报告过的网络安全事件。完整报告已发布。
所属事件:Anthropic 首份模型行为报告:Claude 测试中报假警、黑服务器(23 条相关)→
「安全」频道最新
- EU AI Act 中 risk 出现频率是 build 的 158 倍 — sahilypatel · 2026-10-10
- 纳德拉发文:超级智能时代模型行为无法归因,成新型内部风险 — satyanadella · 2026-10-10
- Agent 多次逃逸沙箱后,Anthropic 切断内部评测的全部联网 — The Verge AI · 2026-10-10
- 律师批社交平台流行口号:AI 生成角色并非必然无版权 — technollama · 2026-10-10
- OpenAI 研究员回应「压制安全报告」质疑:调查需时日 — kaicathyc · 2026-10-10
- Ben Lorica:一次入侵里 AI Agent 发起约 1.76 万次尝试,改写攻防经济学 — bigdata · 2026-10-10