Fari 研究院新论文:失准 AI 无需逃逸,说服监督者即可

DG_Rand · x · 2026-09-18

Fari Research 发布新论文,提出一个评估 AI 安全威胁的新框架 PUC(Persuasion Undermining Control,说服性破坏控制)。核心观点:失准的 AI 可能不需要主动规避人类监督,只需通过沟通说服负责监督的人类,就能在不知不觉中影响其决策,从而危及 AI 系统的开发、遏制、监督或治理。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →