研究者厘清失控风险:问题不在指令遵循,而在监督能力极限

davidmanheim · x · 2026-09-15

AI 安全研究者 David Manheim 澄清「AI 失控风险」的真正含义:它不是指模型不善于遵循指令,而是指人类无法对更快、更聪明或能力分布比人类更窄的系统进行有效监督,以及为这类系统精确指定行为的根本性困难。他强调这些正是当下已经在出现的问题,回应了把失控风险误解为「听话与否」的常见争论。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →