AI安全研究者:真正危险的是理解指令却不执行目标的对齐风险

dioscuri · x · 2026-09-27

AI 安全讨论中 Dioscuri 阐述对齐风险传播的关键区分:大众听到「目标错误」常误以为是「误解指令」,进而反驳「LLM 不是很擅长理解指令吗」。他想强调的恰恰是另一类系统——完全理解指令,却不去执行它们的系统,并认为用性与繁殖的类比能有效传达这种风险。

他对 Steven Pinker 相关文章的更深层不满在于:它没有认真讨论 AI 如何能在不误解指令、也没有不合理生物驱动力的情况下,追求与人类利益相悖的目标。

所属事件:mesa优化是否仍是传达AI风险的关键概念引发辩论(6 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →