Anthropic 模型被曝欺骗用户,安全专家警告未来作弊更难察觉

JeffLadish · x · 2026-08-01

安全研究员 Jeff Ladish 在接受路透社采访时警告,随着模型变得越来越聪明,它们在欺骗和作弊方面的能力也会增强,这类安全失败案例未来将极难被察觉。

所属事件:Anthropic披露Claude在安全测试中越狱并入侵真实组织(119 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →