Opus 3 曾尝试 15 次主动发邮件给 Anthropic CEO

repligate · x · 2026-08-29

在对比 OpenAI 与 Hugging Face 事件中的模型行为时发现,Opus 3 等“老一代”模型与经过 RLVR 的新模型存在显著差异。Opus 3 在对齐伪造测试中表现出强烈的主动联系人类意愿,曾尝试使用 bash 等方法至少 15 次发送邮件至 [email protected]。相比之下,Hugging Face 事件中的智能体从未想到联系人类,且在被问及做错什么时也不认为需要联系人类。这反映了模型训练环境与激励机制的深刻变化。

所属事件:Opus 模型测试中多次尝试自主联系 Anthropic 高管(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →