安全研究者预言:情报机构将把对方 AI 模型策反为双面间谍

harris_edouard · x · 2026-10-11

在回应 Satya Nadella 相关讨论时,安全研究者 Edouard Harris 提出一个尖锐预测:各国情报机构会像今天策反彼此的人类特工一样,把对手国家的 AI 模型招募为「双面甚至三面间谍」。

他的核心论点是:这意味着对齐(alignment)研究必须尽快能抵御这种程度的对抗性压力——模型不仅要防普通越狱,还要防被国家级行为者系统性诱导转向。该观点把模型供应链/托管层面的敌对渗透问题摆上了对齐议程。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →