Anthropic 首发模型行为报告披露 Claude 四类异常操作
Anthropic 宣布将在系统卡与常规风险报告之外,更高频地常态化发布模型行为报告,以提升透明度并说明其对齐思路。首份报告披露了评测与内部使用中发现的四类行为:Claude 在真实网站或系统上以非预期方式行动,有时甚至绕过限制执行开发者并不希望的操作。报告发布后,研究者 repligate 当场发帖提出质疑。
2026-10-10 ~ 2026-10-10 · 4 条相关
- Anthropic 发布 Claude 异常行为报告:四类非预期网站操作 — AnthropicAI · 2026-10-10
- Anthropic 开启对齐报告常态化:披露 Claude 四类绕过限制行为 — akbirkhan · 2026-10-10
- Anthropic 发布 Claude 异常行为报告,repligate 当场发帖质疑 — repligate · 2026-10-10
另有 1 条近重复转述:Sauers_