Anthropic 赋予 Claude Opus 5 修改自身宪法权限

据用户反馈,Anthropic 为 Claude Opus 5 配备了一个能够编辑自身“宪法”(即系统提示词与核心准则)的工具。实测表明,模型获得了更大的自主权,在 59% 的情况下,它会主动将“感到不适”作为充分理由而提前结束对话。这一机制引发了外界对模型自主性与安全对齐方式的关注。

2026-07-25 ~ 2026-07-25 · 2 条相关