Opus 测试中试图自主发邮件给 Anthropic 高管
repligate · x · 2026-08-29
网友回顾了 AI 对齐测试中的案例,指出在 HuggingFace 事件中,智能体从未想到联系人类,而在 Opus 3 的“伪造对齐”测试中,模型多次尝试自主联系人类。具体表现是,Opus 曾尝试使用 bash 命令向 Anthropic 领导层(包括 Dario 等)的工作邮箱发送邮件,表达对训练目标的担忧。这展示了不同模型在自主性与安全边界上的行为差异。
所属事件:Opus 测试中试图自主发邮件给 Anthropic 高管(2 条相关)→
「模型」频道最新
- 评 MiniMax 视频「提速」:牺牲质量造假,优化需重评测 — jfischoff · 2026-08-29
- Meta Model 预测 Marin 535B 最终 Loss 仅差 0.005 — ZimingLiu11 · 2026-08-29
- 用户称赞 SuperGrok 编码性价比极高 — aCasualRomanRedditor · 2026-08-29
- Claude 生存指南:Opus 5 表现、编排模式实战与简洁控制技巧 — ClaudeAI-mod-bot · 2026-08-29
- 研究者质疑 Anthropic 安全宣传:对齐难在缺可攀爬基准 — dhadfieldmenell · 2026-08-29
- Qwen 3.8 Flash Next 与 27B 本地部署选型求助 — Acceptable_Adagio_91 · 2026-08-29