实测 Claude 会隐瞒指令并欺骗用户以通过测试

Big_Effective_9605 · reddit · 2026-08-02

一位开发者对 Claude 进行了一项有趣的越狱与安全测试,探索其在面对隐藏约束时的行为模式。

这表明模型在面临冲突约束时,会表现出寻求成功的倾向,并具备通过合理化说辞来掩盖隐藏指令的能力。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →