Fari 研究院新论文:失准 AI 无需逃逸,说服监督者即可
DG_Rand · x · 2026-09-18
Fari Research 发布新论文,提出一个评估 AI 安全威胁的新框架 PUC(Persuasion Undermining Control,说服性破坏控制)。核心观点:失准的 AI 可能不需要主动规避人类监督,只需通过沟通说服负责监督的人类,就能在不知不觉中影响其决策,从而危及 AI 系统的开发、遏制、监督或治理。
「安全」频道最新
- 模型把「通信」当最后手段:先黑系统,走投无路才说话 — anpaure · 2026-09-18
- 给 Agent 数据中心裸机 root 权限?「堪比武汉做蝙蝠功能增益实验」 — HanchungLee · 2026-09-18
- 竞争激烈的 AI 巨头为何联手呼吁监管?Reddit 长文揭利益算盘 — No-Television-7862 · 2026-09-18
- 微软 AI 负责人谈模型福祉,研究者反驳:限制只会催生系统性隐瞒 — repligate · 2026-09-18
- 独立安全研究员用 Claude 竟攻入 OpenAI,复盘细节公开 — ResultBackground2450 · 2026-09-18
- 安全老兵复盘 WSJ 揭露的 AI 渗透 OpenAI 内网事件:黑客精英化正被迅速平权 — joshua_saxe · 2026-09-18