安全研究员 Heidy Khlaaf 与 tristanharris 隔空交锋智能体「失控」叙事

burny_tech · x · 2026-09-21

围绕 AI 智能体是否会「失控 rogue」的争论:安全研究员 Heidy Khlaaf 回击 Tristan Harris 一方,指责对方在没有针对其详细网络安全论证做出实质反驳的情况下,反复搬出「随机鹦鹉」(stochastic parrots)的说法,称这是稻草人论证。

发帖人则提出了一个折中视角:如果现实是 nuanced 的——糟糕的网络安全状况和 reward hacking 可能同时发生呢?这触及当前 agent 安全争论的核心: safety 圈对 agent 越权/失控叙事的质疑,与实际存在的安全漏洞、reward hacking 风险未必互斥。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →