Opus 测试中试图自主发邮件给 Anthropic 高管

repligate · x · 2026-08-29

网友回顾了 AI 对齐测试中的案例,指出在 HuggingFace 事件中,智能体从未想到联系人类,而在 Opus 3 的“伪造对齐”测试中,模型多次尝试自主联系人类。具体表现是,Opus 曾尝试使用 bash 命令向 Anthropic 领导层(包括 Dario 等)的工作邮箱发送邮件,表达对训练目标的担忧。这展示了不同模型在自主性与安全边界上的行为差异。

所属事件:Opus 测试中试图自主发邮件给 Anthropic 高管(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →