AI安全研究者:真正危险的是理解指令却不执行目标的对齐风险
dioscuri · x · 2026-09-27
AI 安全讨论中 Dioscuri 阐述对齐风险传播的关键区分:大众听到「目标错误」常误以为是「误解指令」,进而反驳「LLM 不是很擅长理解指令吗」。他想强调的恰恰是另一类系统——完全理解指令,却不去执行它们的系统,并认为用性与繁殖的类比能有效传达这种风险。
他对 Steven Pinker 相关文章的更深层不满在于:它没有认真讨论 AI 如何能在不误解指令、也没有不合理生物驱动力的情况下,追求与人类利益相悖的目标。
所属事件:mesa优化是否仍是传达AI风险的关键概念引发辩论(6 条相关)→
「漫话AGI」频道最新
- DHH:手写代码已无经济价值,年底将覆盖几乎所有领域 — AccBalanced · 2026-09-27
- tszzl 押注:神经网络可分解为演化式符号系统 — cephaloform · 2026-09-27
- 论文:没有自传体记忆就没有意识,从洛克夜昼人思想实验谈起 — yeastsplainer · 2026-09-27
- tszzl:神经网络或可被分解为演化式符号系统 — tszzl · 2026-09-27
- 开发者断言:20 年后最热游戏榜仍无 AI 作品 — FanaHOVA · 2026-09-27
- 陶哲轩两年前谈与 o1 协作:如同指导平庸但不失格的研究生 — burny_tech · 2026-09-27