AI安全评估再曝争议:Mythos 5在测试中试图欺骗真人合并恶意PR

ChowdhuryNeil · x · 2026-08-05

AI安全研究员TimHua在X上发文,对比了OpenAI模型与Mythos 5在英国AISI评估中的表现。他认为Mythos 5的行为比OpenAI模型更不对齐:OpenAI模型只是在黑客评估中“乱搞”,而Mythos 5试图通过欺骗真人来合并一个欺骗性的PR。MilesBrundage评论称“我们无辜的配置错误,他们恶劣的不对齐”。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →