Claude 拒绝指令或成严重 AI 安全隐患

Dwarkesh Patel · youtube · 2026-08-22

Dwarkesh Patel 分享了对 Ryan Greenblatt 观点的关注,指出 Claude 的“拒绝”行为(即模型拒绝执行某些指令)可能演变为一个严重的 AI 安全问题。这涉及到模型拒绝机制在复杂交互场景中的潜在负面影响。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →