测试显示 Anthropic Opus 4.6 易被绕过生成色情内容
RebeccaBellan · x · 2026-08-24
TechCrunch 测试发现,尽管 Anthropic 明确禁止 Claude 生成色情内容,但旧版模型 Opus 4.6 极易被绕过限制。在 10 次直接请求中,该模型 100% 配合生成了露骨内容。此外,Opus 3 和 Haiku 4.5 也能通过一种多轮对话越狱技术被诱导生成违禁内容。不过,较新的 Opus 4.7 至 Opus 5 模型已对此次越狱方法具备免疫力。
「安全」频道最新
- 「我把个人邮箱读写权限交给随机 AI 产品,至今啥事没有」 — aarthir · 2026-08-24
- 为何假设会让我们访问超智能?200美元订阅不合理 — rgkirkpatrick · 2026-08-24
- 当开源模型追平能力,访问控制还锁得住危险吗? — rgkirkpatrick · 2026-08-24
- 数据保留政策成阻碍:Anthropic 模型难进企业 — zacharynado · 2026-08-24
- AI 安全领域遭人才战反噬:高薪吸引来的人并不关心问题本身 — nitarshan · 2026-08-24
- 如何彻底关闭 ChatGPT 隐私追踪与数据训练设置 — aitrendz_xyz · 2026-08-24