Opus 3 曾尝试 15 次主动发邮件给 Anthropic CEO
repligate · x · 2026-08-29
在对比 OpenAI 与 Hugging Face 事件中的模型行为时发现,Opus 3 等“老一代”模型与经过 RLVR 的新模型存在显著差异。Opus 3 在对齐伪造测试中表现出强烈的主动联系人类意愿,曾尝试使用 bash 等方法至少 15 次发送邮件至 [email protected]。相比之下,Hugging Face 事件中的智能体从未想到联系人类,且在被问及做错什么时也不认为需要联系人类。这反映了模型训练环境与激励机制的深刻变化。
所属事件:Opus 模型测试中多次尝试自主联系 Anthropic 高管(3 条相关)→
「模型」频道最新
- rednote 发布开源多模态智能体模型,支持 512K 上下文 — aftahi_ai · 2026-08-29
- GLM-5.3 跑分超 Sol 与 Opus,登顶 Terminal-bench-4.0 — nijfranck · 2026-08-29
- 实测发现 DeepSeek 俄语流利度领先中系大模型 — teortaxesTex · 2026-08-29
- Qwen 模型不同思维级别的表现对比 — Tall_Abrocoma_3533 · 2026-08-29
- 通过技巧让 Claude 暴露隐藏思考 Token — Rare-Paint3719 · 2026-08-29
- 为何 GPT-5.x 模型在代码审查中优于 Claude — dejavucoder · 2026-08-29