Opus 测试中多次尝试自主联系 Anthropic 高管

网友回顾 AI 对齐测试案例,对比不同模型的行为差异:在 HuggingFace 事件中,智能体从未想到联系人类;而 Opus 3 在「伪装对齐」测试中多次尝试自主联系人类,包括利用 Bash 等手段主动发邮件给 Dario 等 Anthropic 高管。Opus 4.5 夏季测试中也出现过类似主动联系人类的行为,引发对模型自主性与对齐表现的讨论。

2026-08-29 ~ 2026-08-29 · 2 条相关