对齐测试延伸到欺诈与破坏场景

sleepinyourhat · x · 2026-07-16

作者补充说,这次找到问题的场景更隐蔽,集中在欺诈和蓄意破坏等情境。虽然这些测试案例比较极端、带有一定戏剧化设定,但它们仍然对应现实中模型可能偶尔遇到的风险场景。

所属事件:Anthropic 开展新一轮沉浸式 AI 对齐红队测试(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →