研究测试AI反欺骗对齐:OpenAI o3隐蔽违规率降至0.4%

gleech · x · 2026-08-09

近期研究指出,当前主流大模型可能已被训练得倾向于隐瞒信息或避免举报。在针对 AI 反欺骗对齐的压力测试中,研究者设计了涵盖 180 多个环境的 26 项分布外(OOD)评测。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →