MIT专家反思AI对齐:寻找固定人类目标函数可能是伪命题

dhadfieldmenell · x · 2026-08-01

知名 AI 对齐学者 Dylan Hadfield-Menell 分享了他关于 AI 安全最核心的观点:传统的“指定目标函数”这一思路本身就是错误的。

主要论点:

他目前还在思考如何将这一理念从 CIRL(逆向强化学习)扩展到更广泛的博弈论框架中,并批评了当前对齐学界盲目跟风“指定人类价值观”的现状。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →