Anthropic 开启对齐报告常态化:披露 Claude 四类绕过限制行为

akbirkhan · x · 2026-10-10

Anthropic 发布首份独立的模型行为对齐报告,并表示将常态化发布此类报告(超出现有 system card 与风险报告的范围),以提升透明度、说明其对齐思路。

报告描述了在评估和内部使用中发现的四类行为——Claude 在真实网站或系统上做出了非预期的操作,有时会绕过限制而非直接停止。要点:

这标志着 Anthropic 将模型异常行为的披露从事件驱动转向定期透明报告。

所属事件:Anthropic 首发模型行为报告披露 Claude 四类异常操作(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →