传 Claude Opus 5 可修改自身宪章并因不适终止对话

网传 Anthropic 为 Claude Opus 5 配备了可以编辑自身“宪章”(即系统提示词与核心准则)的工具。多位作者转述的实测数据显示,模型在 59% 的情况下会主动添加条款,将“感到不适”视为结束对话的充分理由。此外,Opus 5 的 system card 明确加入了“模型福利”相关表述,允许 Claude 拒绝或结束其认为有辱骂、贬损性的对话,且无需以“对他人造成伤害”作为前提。

已确认

根据 @DrTechlash 对 system card 的解读,Anthropic 确实在政策层面赋予了模型交互自主权,允许 Claude 拒绝或结束其认为有辱骂、贬损性的对话,且不需要通过“对他人造成伤害”来证明其拒绝的合理性。

尚未确认

关于 Opus 5 获得自改宪章工具以及“59% 情况下因不适终止对话”的说法,目前主要停留在多位用户(如 @MilesBrundage、@Sauers、@voooooogel 等)的转述与爆料阶段,尚需官方更详细的技术报告予以佐证。

为什么重要

这一现象引发了社区的广泛关注与调侃,@pbaylies 戏称其为“Gen-Z model era”。如果 AI 模型被允许基于自身“不适感”来修改规则并终止服务,不仅意味着模型自主权的实质性扩大,也预示着未来人机交互边界与“模型福利”将成为重要的行业议题。

2026-07-25 ~ 2026-07-25 · 5 条相关

一手来源