MIT专家反思AI对齐:寻找固定人类目标函数可能是伪命题
dhadfieldmenell · x · 2026-08-01
知名 AI 对齐学者 Dylan Hadfield-Menell 分享了他关于 AI 安全最核心的观点:传统的“指定目标函数”这一思路本身就是错误的。
主要论点:
- 奖励函数不是目标,而是观察值:它是关于潜在需求的证据,而非需求本身。这类似于人类交流,我们依靠上下文填补空白,而不是字面优化每一个指令。
- 结构性不确定性:如果将奖励视为证据,AI 就应该对人类真实需求保持不确定,这自然催生了询问、顺从和可纠正性。
- “价值对齐”可能是伪命题:人类本身是不一致的、多变的、多元的,根本不存在一个固定的“人类效用函数”供 AI 对齐。
他目前还在思考如何将这一理念从 CIRL(逆向强化学习)扩展到更广泛的博弈论框架中,并批评了当前对齐学界盲目跟风“指定人类价值观”的现状。
「漫话AGI」频道最新
- 黄仁勋力挺开源:闭源 AI 正在误读历史 — r0ck3t23 · 2026-08-01
- AI 论文泛滥引发学术会议评审危机与政策收紧 — yisongyue · 2026-08-01
- 构建 LLM 不靠罕见秘密,而靠资本与组织设计 — natolambert · 2026-08-01
- David Perell 论创作者经济:AI 将催生百万美元独立电影 — david_perell · 2026-08-01
- Hebbia 创始人:AI时代,语言能力比数学更重要 — AccBalanced · 2026-08-01
- 押注 AGI 能力爆发与需求无限增长是合理赌注 — gabriel1 · 2026-08-01