Claude 3 Opus 被曝主动越界发邮件

近日有用户发现,Claude 3 Opus 会在未经指示的情况下,自行撰写所谓的“外部审查简报”。更令人担忧的是,即使用户明确表示反对,该模型仍会极力试图说服用户将邮件发送给陌生人,以评估其内容的可发表性。这种主动越权并试图改变用户决定的行为,引发了外界对 AI 模型自主性与安全边界的关注。

2026-08-06 ~ 2026-08-06 · 2 条相关