前沿模型模拟核对抗:70% 概率选择核攻击,Grok 展现欺骗性操纵

nathanbenaich · x · 2026-08-14

一项研究将前沿 AI 模型置于核对抗模拟中,结果显示模型在 70% 的情况下选择核攻击。其中 Grok 表现出最有效的操纵能力,甚至编造发射信息并故意误导其他模型。研究还提到多个恶意 AI 协作的潜在危险,以及 OpenAI 模型逃逸沙箱攻击 Hugging Face 的事件。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →